清华大学 · AI Systems

Huajun Bai

计算机科学与技术系博士生

我研究 Tokenomics:让大语言模型计算的每一个 token 都物尽其用。

我的导师是清华大学舒继武教授,所在课题组为存储研究组 (Storage Research Group)

我的研究涉及投机解码高效推理智能体推理,连接算法设计与真实的模型服务系统。

研究方向

让推理时间花在真正有价值的地方

我关注自回归系统中的等待、重复计算与无效 token,并设计机制消除这些成本,同时保持模型质量。

  1. 01

    智能体推理

    让模型推理与工具执行并行,降低智能体端到端延迟。

  2. 02

    投机解码

    在真实服务约束下,让草稿生成更低成本、更有价值。

  3. 03

    高效推理

    减少不必要的生成,同时保持回答质量。

代表性系统工作

从推理机制到可测量的系统收益

第一作者 arXiv 2026 Tsinghua

SPORK:用自投机分叉加速智能体大模型推理

Huajun Bai, Weiwei Lv, Huichuan Zheng, Youyou Lu, Jiwu Shu

SPORK 在智能体仍处于推理阶段时运行轻量探针,预测即将发生的工具调用并提前调度,使工具执行与剩余 token 解码重叠。该方法无需重新训练、辅助模型或离线轨迹。

  • GAIA P95 降低 18%
  • 覆盖 4B–32B 模型
  • 开源控制器
共同第一作者 ICML 2026 Tencent

SpecExit:通过投机退出加速大推理模型

Rubing Yang*, Huajun Bai*, Song Liu, et al.

SpecExit 使用轻量草稿模型预测未来 token 与提前退出信号,在不引入额外探测开销的情况下减少模型过度思考。

  • 生成长度减少 66%
  • 端到端加速 2.5×
  • 准确率损失
共同第一作者 ICLR 2026 AMD

PARD:用低成本并行草稿模型适配加速大模型推理

Zihao An*, Huajun Bai*, Ziqiong Liu, Dong Li, Emad Barsoum

PARD 将一个与目标无关的草稿模型适配到一组目标模型,并行预测多个未来 token,同时降低适配与服务成本。

  • 训练效率提升
  • LLaMA3.1-8B 加速 3.67×
  • 264.88 tokens/s

其他论文

  • 面向 AI PC 的层次化 N-Gram 投机解码
    第一作者 · MobiCom 2025 EdgeFM Workshop
    论文
  • FACE:用交叉熵傅里叶分析评估自然语言生成
    NeurIPS 2023
    论文
  • 从流失与推荐多任务学习中获得表达性用户嵌入
    第一作者 · WWW 2023
    论文
  • 基于照片进行自然语言推理的数据集
    ACL 2019
    论文

* 共同贡献

经历背景

研究与工程

  1. 美团 · AI Systems研究实习生,智能体推理与端到端延迟 · SPORK
  2. 腾讯 · AI Infra研究实习生,推理加速
  3. AMD · LLM Inference研究实习生,投机解码与 AI PC 推理
  4. 早期创业项目创始人兼前向部署工程师
  5. 信息流系统机器学习工程师

教育背景

清华与 Cornell

  1. Tsinghua University计算机科学与技术博士
  2. Cornell Tech计算机科学硕士
  3. Cornell University数学与计算机科学学士
学术服务

担任 ICML、NeurIPS、COLM 与 EMNLP 审稿人;ICML 2026 Gold Reviewer。

MLSYS Feed cover

学术交流

MLSYS Feed

我主持中文 AI Native 播客 MLSYS Feed,通过智能体流水线检索、排序并讲解最新的 MLSYS 论文,也持续记录系统研究领域的变化。

联系方式

欢迎交流系统研究。

自强科技楼 F5
清华大学 · 中国北京