周子为 / Ziwei Zhou周子为Ziwei Zhou
NOW8 月 19 日
CMU8·HKU R212·ASPLOS还有 3 周
RESEARCH

研究

21 个项目

我做的是:怎么判断一个自动化系统交出来的东西可不可信——从 agent 的 harness 一路到它生成的 GPU kernel。

排序原则(写死):ML systems / GPU 验证 → LLM agent → reasoning → 多模态 & world model → 大规模系统 → 安全。

安全永远放最后。它是我的本科专业和入门路径,不是我要读博的方向。

线 1 · 主推

ML systems 与 GPU kernel 验证

Zhihao Jia (CMU Catalyst Group)
5 个项目

PhaseGuard

Hopper/Blackwell 上 TMA / tcgen05 等异步写存在现有 dynamic checker 观测不到、且 racecheck 万倍慢化会系统性关掉竞争窗口的 race;把执行主体 × 地址区域 × phase/计数状态 × 完成谓词代数抽成 phase-automaton,从源码静态提取后有界穷举判定。

边界 — 已冻结面:CUTLASS SM90/SM100 + FlashAttention-3。当前为 model-level SAFE / exact J_K REFUSED / source-level INCONCLUSIVE。没有总体误报率估计,没有七阶段 source-level safety theorem。正式导师评审仍待完善。

进行中9月9日

ProofWeaver

agent 已经能写出带 TMA、tensor-core async group、barrier phase、staged-buffer reuse 的 warp-specialized kernel,但 static validator / random test / Compute Sanitizer / agent 自评分都不能证明在所有合法 GPU 调度下安全。

边界 — refinement 只做到 functional-index leaf 和 bounded tensor-value(P,dP,D ∈ [-16,16] 全整数域),不是 whole-kernel equivalence;binary32 RZ/FTZ 对应关系仍是人工审计的 trusted lemma。

准备中8月12日

Chimera

按 MoE routing shape 自适应任务与通信粒度。

边界 — 没有性能数字。harness 可跑且已审计,但所有衡量都没开。

暂停7月10日

OppEval

机会式求值,PL × serving 的混合线。

边界 — 1,032 个阻塞时刻里 84.5% 有 ≥2 个外部调用在途(若以 4,973 个决策点为分母则是 96.8%);两个可从项计算的关键性谓词分别恒假、恒真 → 排序空间是真的,语言给不出用它的依据。

进行中8月18日×1证否

CASM (内部代号)

内部代号 · CASM

(内部项目,对外材料不出现)

审稿中5月15日
线 2 · 第二层

LLM agent: memory / skill / harness

Zaixuan Chu (浙大)
6 个项目

GuardPatch

可审计 memory:guarded delta patch + counterfactual reuse audit。

边界 — under review;不能写成「已发表」。

审稿中7月19日

Skill2Mem

Probing skill-to-memory transfer in LLM agent memory。公共 skill 库什么时候反而有害。

边界 — under review / 高分;ACL commitment 时间线未核实,不写成已确定。

审稿中8月12日

Skill Form Matters

trace / script / hierarchy / artifact 四种表示在 agent skill memory 中的影响。

边界 — p 区间 0.108–1.000,没有单一赢家。这条结论本身就是这篇论文的核心,藏起来反而让论文标题显得奇怪。

审稿中7月19日×1证否

S2CRA

verifier-guided LLM proposal channels for auditable causal graph discovery。

边界 — 国创结项优秀已出(这是线 2 少数几个「已落地的正式结果」之一)。不投 EMNLP。

审稿中8月12日

SkillMask

capability-conditional skill selection(历史名,已被新名吸收)。

已完成8月1日

DeltaMem

delta-style memory patching(已并入 GuardPatch)。

审稿中7月19日
线 3 · 接触面

reasoning 与 credit assignment

3 个项目
线 4 · 接触面

多模态生成与 world model

Yi Yang (浙大, 毕设)
4 个项目

RetargetHOI

视频物体替换里 intent preservation 与 interaction feasibility 的冲突。

边界 — 没有 preservation / feasibility / locality / intent 分数;没有 baseline tradeoff 结论。当前顶层状态 STOP_NO_C0_C2_COMPARISON / BLOCKED_REQUIRED_CALIBRATION_ROLES。绝不能写成「我们提出了一个方法并取得了效果」。

阻塞7月15日

Active4DGS

强 4D 生成先验下经典 information gain 会不会反号。

阻塞5月1日×1证否

ActBelief

主动感知策略。

边界 — 何时买证据比买哪个重要三十倍;6.6% 帧上的免费 ensemble 分歧门可回收 60–79% 的 oracle value;自己 11 条预注册预测被否证,含两个 learned component。

阻塞7月10日×3证否

FUSE

多模态 post-training 的 forked utility 监督。

阻塞5月20日×1证否
线 5 · 第二强

大规模系统与仿真基础设施

Wenliang Du (SEED Emulator)
2 个项目
线 6 · 最后

安全(最后)

1 个项目
关于否定结果

我一半的产出是证否自己的假设(Skill Form Matters p 区间 0.108–1.000、ActBelief 自己 11 条预注册预测被否证等)。这是方法论优势,藏起来反而让那批论文标题显得奇怪。