<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0"
  xmlns:atom="http://www.w3.org/2005/Atom"
  xmlns:itunes="http://www.itunes.com/dtds/podcast-1.0.dtd"
  xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>MLSYS Feed</title>
    <link>https://baihuajun24.github.io/podcast/</link>
    <atom:link href="https://baihuajun24.github.io/podcast/feed.xml" rel="self" type="application/rss+xml" />
    <description><![CDATA[AI Native 信息类播客推送，arxiv 论文检索 + 基于研究兴趣的推荐 + 生成理由]]></description>
    <language>en-us</language>
    <copyright>Copyright 2026 小白超 AI算</copyright>
    <lastBuildDate>Mon, 07 Sep 2026 00:30:00 GMT</lastBuildDate>
    <image>
      <url>https://baihuajun24.github.io/podcast/logo.jpg</url>
      <title>MLSYS Feed</title>
      <link>https://baihuajun24.github.io/podcast/</link>
    </image>
    <itunes:author>小白超 AI算</itunes:author>
    <itunes:summary><![CDATA[AI Native 信息类播客推送，arxiv 论文检索 + 基于研究兴趣的推荐 + 生成理由]]></itunes:summary>
    <itunes:image href="https://baihuajun24.github.io/podcast/logo.jpg" />
    <itunes:explicit>false</itunes:explicit>
    <itunes:category text="Technology" />
    <item>
      <title>0907 MLSYS 论文简报：省下来的到底省没省</title>
      <description><![CDATA[0907 MLSYS 论文简报：省下来的到底省没省

评论
上一期讲的是你在什么时候决定一个请求值多少算力。今天这三篇更狠一点，它们问的是：你以为省下来的那笔，到底有没有真的省下来。第一篇说你省的又流回去了，第二篇说你测的那个数根本不是模型的，第三篇是真的快、也是真无损，可它自己的摘要把自己的测量放大了三成到一倍。三篇串起来不是"这些活儿不行"，而是这一行报数字的方式，还配不上它做事的水平。

本期重点

第一篇，省的流回去了。`</think>` Doesn't Stop Reasoning（KAIST，arXiv:2609.03633）解剖的是免训练早退：推理模型先写一长串推理再吐结束思考标记进作答阶段，而早退就是在中途硬塞一个结束标记，逼它去作答。大家默认被掐掉的推理 token 就是省下来的。这篇发现模型根本没停——它在名义上的作答阶段里继续写推理式内容，过一会儿自己又吐一个结束标记，作者称为伪终止；而且证明是注入导致的：模型自然结束时该现象为零，压得越狠比例越高，可到四成。账是这样的：十四 B 模型上推理阶段从 4156 降到 3262，省了 894，可作答阶段同时从 547 涨到 1252，涨了 705——约 79% 的节省流了回来，总 token 净省只有 4%，准确率从 76.9 掉到 73.3。另外三组模型方法组合的回流比例是 76%、65%、51%。最有价值的是他们试着把那段伪推理直接砍掉：GSM8K 掉 15.9 个点，MATH 掉 12.1，因为那段东西在替被砍掉的推理干活——计算量是守恒的，你能把它搬个地方，但删不掉。他们提的修法（给注入标记加注意力偏置）输给了自己的对照组：开头加一句提示词让它直接作答，伪终止率 0.1、答案 444 token，而注意力偏置是 3.8、667 token。评级人上人。

第二篇，测的不是模型。Interface-Induced Trajectory Censoring（香港城市大学，arXiv:2609.03966）说 agent 的工具调用率测的根本不是模型，而是一份三方合同——checkpoint 被训练成吐什么、chat template 让它吐什么、parser 接受什么。三方对不上时你收到的是 HTTP 200 加一个空的工具调用数组，用作者的话说，跟模型自己决定不调用"字节级一模一样"。实验很干净：权重、用例、解码参数、种子、执行器、打分器全钉死，只换服务适配器，同一模型分数是 0.00 或 0.96；二乘二里两个主效应精确为零，全部摆动落在交互项——单独换哪个都没事，配错了才出事。另一个交互式基准的 115 个任务上，同一次切换让服务端解析到的调用从 0 变成 636；跟进到强化学习训练循环里，115 次中 45 次有效调用、被接受 0 次。而这篇最诚实的地方是：修好之后机制恢复了，结果却没有显著变好——通过率 53 到 62，p=0.093；另一基准解决数 7 对 10，p=0.25。它没有假装"修了就更强"，只说"你之前测的那个数不成立"。它还撤回了自己一处结论、修正了自己报错的数、主动否掉一个对自己有利的一致性指标。硬伤是触发点本身是社区已知的配置错误，新的是量化与归因。评级人上人。

第三篇，真的快。Uno（多家机构 + 一家芯片公司，arXiv:2609.04010）要去掉投机解码里那个额外的 draft 模型——它意味着多一套权重、多一份 KV 缓存和额外维护。做法是在一个冻结的自回归模型的每个投影上挂一组秩 128 的门控 LoRA，蒸馏成能一次性去噪一整块 token；验证时把适配器关掉，同一个网络变回原来的自回归模型，自己验自己。所以草稿和验证是同一套权重只差一个开关，也因此只需要一份 KV 缓存（峰值 122.2 GiB 对 130）。无损这次站得住：自回归权重冻结，验证器可证明未变，还做了 10 个随机种子加 95% 置信区间（76.4 对 76.6）——这是本轮唯一一份。速度也是真的：单张 H200、并发 64，系统吞吐 5733 对基础模型 3662；而且它真的跑了对手，两个现有方法是 5351 和 4944，接受长度 3.89 对 2.07。问题出在它自己的摘要：摘要和结论说"最高三倍"，全文表格里最大比值是 2.53；另一处说最大 batch 上两倍，同篇正文写 1.5 倍、表十八写 1.57。而且所有吞吐是构造的而非端到端计时——先测平均每步接受几个 token，再回放合成步数。评级人上人。

本期还评估但未播出
VestigeKV（arXiv:2609.03949）很漂亮：NoPE 训练把 MLA 的 64 维解耦分支变成了与 query 无关的显著性通道，可以在读取查询到来之前就压缩。但全文精读后发现它的"压缩"并不释放显存——非 top 行不删除，整行搬进 GPU 常驻归档区还额外加了索引，本质是带宽分层；而且全部测量只有一个 checkpoint。
On-Policy Distillation II（arXiv:2609.04172）的匹配结论只在数学域成立，代码/指令/agentic 只报了对师生差距的比例；标题的"一条样本"与真正成立的"16 条"不是同一主张。

时间线
00:00 开场 · 你以为省下的那笔，经得起复核吗
00:41 第一篇 · 免训练早退是怎么做的
01:30 模型根本没停 · 伪终止
02:03 账 · 省了 894，作答阶段涨了 705
02:31 约 79% 流回来，净省 4%，准确率掉 3.6 个点
02:59 想直接删掉那段？GSM8K 掉 15.9 个点
03:28 计算量是守恒的
03:54 他们的修法输给了一句提示词
04:43 第二篇 · 工具调用率测的是一份三方合同
05:21 对不上时是 HTTP 200 加空数组，字节级一模一样
05:44 只换适配器 · 0.00 或 0.96，主效应精确为零
06:22 同一次切换 · 0 变成 636
06:52 但修好之后，结果并没有显著变好
07:32 它撤回了自己的结论
08:07 第三篇 · Uno，去掉 draft 模型
08:26 冻结主模型挂门控 LoRA，关掉适配器就是验证器
09:03 无损站得住 · 10 个种子加置信区间
09:29 5733 对 3662，且真的跑了对手
10:01 可摘要说三倍，表格里最大 2.53
10:45 三篇串起来
11:00 收尾 · 工程比广告实在]]></description>
      <content:encoded><![CDATA[0907 MLSYS 论文简报：省下来的到底省没省

评论
上一期讲的是你在什么时候决定一个请求值多少算力。今天这三篇更狠一点，它们问的是：你以为省下来的那笔，到底有没有真的省下来。第一篇说你省的又流回去了，第二篇说你测的那个数根本不是模型的，第三篇是真的快、也是真无损，可它自己的摘要把自己的测量放大了三成到一倍。三篇串起来不是"这些活儿不行"，而是这一行报数字的方式，还配不上它做事的水平。

本期重点

第一篇，省的流回去了。`</think>` Doesn't Stop Reasoning（KAIST，arXiv:2609.03633）解剖的是免训练早退：推理模型先写一长串推理再吐结束思考标记进作答阶段，而早退就是在中途硬塞一个结束标记，逼它去作答。大家默认被掐掉的推理 token 就是省下来的。这篇发现模型根本没停——它在名义上的作答阶段里继续写推理式内容，过一会儿自己又吐一个结束标记，作者称为伪终止；而且证明是注入导致的：模型自然结束时该现象为零，压得越狠比例越高，可到四成。账是这样的：十四 B 模型上推理阶段从 4156 降到 3262，省了 894，可作答阶段同时从 547 涨到 1252，涨了 705——约 79% 的节省流了回来，总 token 净省只有 4%，准确率从 76.9 掉到 73.3。另外三组模型方法组合的回流比例是 76%、65%、51%。最有价值的是他们试着把那段伪推理直接砍掉：GSM8K 掉 15.9 个点，MATH 掉 12.1，因为那段东西在替被砍掉的推理干活——计算量是守恒的，你能把它搬个地方，但删不掉。他们提的修法（给注入标记加注意力偏置）输给了自己的对照组：开头加一句提示词让它直接作答，伪终止率 0.1、答案 444 token，而注意力偏置是 3.8、667 token。评级人上人。

第二篇，测的不是模型。Interface-Induced Trajectory Censoring（香港城市大学，arXiv:2609.03966）说 agent 的工具调用率测的根本不是模型，而是一份三方合同——checkpoint 被训练成吐什么、chat template 让它吐什么、parser 接受什么。三方对不上时你收到的是 HTTP 200 加一个空的工具调用数组，用作者的话说，跟模型自己决定不调用"字节级一模一样"。实验很干净：权重、用例、解码参数、种子、执行器、打分器全钉死，只换服务适配器，同一模型分数是 0.00 或 0.96；二乘二里两个主效应精确为零，全部摆动落在交互项——单独换哪个都没事，配错了才出事。另一个交互式基准的 115 个任务上，同一次切换让服务端解析到的调用从 0 变成 636；跟进到强化学习训练循环里，115 次中 45 次有效调用、被接受 0 次。而这篇最诚实的地方是：修好之后机制恢复了，结果却没有显著变好——通过率 53 到 62，p=0.093；另一基准解决数 7 对 10，p=0.25。它没有假装"修了就更强"，只说"你之前测的那个数不成立"。它还撤回了自己一处结论、修正了自己报错的数、主动否掉一个对自己有利的一致性指标。硬伤是触发点本身是社区已知的配置错误，新的是量化与归因。评级人上人。

第三篇，真的快。Uno（多家机构 + 一家芯片公司，arXiv:2609.04010）要去掉投机解码里那个额外的 draft 模型——它意味着多一套权重、多一份 KV 缓存和额外维护。做法是在一个冻结的自回归模型的每个投影上挂一组秩 128 的门控 LoRA，蒸馏成能一次性去噪一整块 token；验证时把适配器关掉，同一个网络变回原来的自回归模型，自己验自己。所以草稿和验证是同一套权重只差一个开关，也因此只需要一份 KV 缓存（峰值 122.2 GiB 对 130）。无损这次站得住：自回归权重冻结，验证器可证明未变，还做了 10 个随机种子加 95% 置信区间（76.4 对 76.6）——这是本轮唯一一份。速度也是真的：单张 H200、并发 64，系统吞吐 5733 对基础模型 3662；而且它真的跑了对手，两个现有方法是 5351 和 4944，接受长度 3.89 对 2.07。问题出在它自己的摘要：摘要和结论说"最高三倍"，全文表格里最大比值是 2.53；另一处说最大 batch 上两倍，同篇正文写 1.5 倍、表十八写 1.57。而且所有吞吐是构造的而非端到端计时——先测平均每步接受几个 token，再回放合成步数。评级人上人。

本期还评估但未播出
VestigeKV（arXiv:2609.03949）很漂亮：NoPE 训练把 MLA 的 64 维解耦分支变成了与 query 无关的显著性通道，可以在读取查询到来之前就压缩。但全文精读后发现它的"压缩"并不释放显存——非 top 行不删除，整行搬进 GPU 常驻归档区还额外加了索引，本质是带宽分层；而且全部测量只有一个 checkpoint。
On-Policy Distillation II（arXiv:2609.04172）的匹配结论只在数学域成立，代码/指令/agentic 只报了对师生差距的比例；标题的"一条样本"与真正成立的"16 条"不是同一主张。

时间线
00:00 开场 · 你以为省下的那笔，经得起复核吗
00:41 第一篇 · 免训练早退是怎么做的
01:30 模型根本没停 · 伪终止
02:03 账 · 省了 894，作答阶段涨了 705
02:31 约 79% 流回来，净省 4%，准确率掉 3.6 个点
02:59 想直接删掉那段？GSM8K 掉 15.9 个点
03:28 计算量是守恒的
03:54 他们的修法输给了一句提示词
04:43 第二篇 · 工具调用率测的是一份三方合同
05:21 对不上时是 HTTP 200 加空数组，字节级一模一样
05:44 只换适配器 · 0.00 或 0.96，主效应精确为零
06:22 同一次切换 · 0 变成 636
06:52 但修好之后，结果并没有显著变好
07:32 它撤回了自己的结论
08:07 第三篇 · Uno，去掉 draft 模型
08:26 冻结主模型挂门控 LoRA，关掉适配器就是验证器
09:03 无损站得住 · 10 个种子加置信区间
09:29 5733 对 3662，且真的跑了对手
10:01 可摘要说三倍，表格里最大 2.53
10:45 三篇串起来
11:00 收尾 · 工程比广告实在]]></content:encoded>
      <pubDate>Mon, 07 Sep 2026 00:30:00 GMT</pubDate>
      <guid isPermaLink="false">mlsys-feed-2026-09-07</guid>
      <enclosure url="https://github.com/baihuajun24/baihuajun24.github.io/releases/download/audio-archive/0907-daily-arxiv.mp3" length="11258925" type="audio/mpeg" />
      <itunes:duration>11:43</itunes:duration>
      <itunes:explicit>false</itunes:explicit>
    </item>
    <item>
      <title>0904 MLSYS 论文简报：什么时候决定花这笔钱</title>
      <description><![CDATA[0904 MLSYS 论文简报：什么时候决定花这笔钱

评论
省钱的方案都在回答同一个问题：这个请求值多少算力。但还有个几乎没人明说的维度——你是在什么时候下这个判断的。今天三篇正好各站一个时刻：一个 token 都还没生成的时候、小模型正在解码的时候、一整条 agent 轨迹跑到一半的时候。串起来有条挺清楚的曲线：决定得越早能省的越多，但你知道得越少；决定得越晚越有把握，可省的那块也越小。最讨巧的是中间那个位置，因为解码中的判断信号是白来的。

本期重点

时刻一，生成前。SCX Router（Knowledgator / SCX.ai，arXiv:2609.02292）面对的是一份天天在变的模型端点名单，价格、质量、延迟、上下文长度、工具权限各不相同。动机数字很直白：在某公开评测的语言子集上，八个候选里随便挑一个平均只有 0.52，挑对了是 0.78。做法是在生成之前放一个 0.6B 的判别式分类器，一次非生成式前向就给每个端点打出适配分，全程不解码任何路由 token；对话历史做成常驻 KV 缓存、每轮只编码新增部分，候选端点的名字作为瞬态 token 挂上去打完分即丢弃 KV，所以名单可以逐轮更换而不污染会话缓存。这个设计是漂亮的。但结论要按住：跟最强的那个固定模型比是 0.707 对 0.696，一千道题、单一种子、无置信区间、无显著性检验，这个差距就是噪声；而且那一千道题是从更大集合里按"路由至少在某个深度有正收益"筛出来的，等于按结果挑样本。它一个已发表的路由基线都没跑，更要紧的是它主打的 KV 缓存省算力那套说法，全文没有一个延迟数字——卖点本身没测。拿设计，别拿结论。评级人上人。

时刻二，解码中。Pro-Router（Anyscale / 密西西比州立 / 中科院计算所，arXiv:2608.28726）先把两派都批评了一遍：只看请求的路由器在一个 token 都没有时就下判断，而请求本身不告诉你小模型答不答得出来；看完答案再打分的那派准是准了，但每个请求要多跑一遍另一个语言模型，这笔开销把省下的直接吃掉。它的观察是今天最漂亮的一个——那个判断信号，解码的时候已经免费产生了。小模型每吐一个 token 都会顺带给出对数概率、最大概率、前二十的熵，把这条序列喂给一个约 6.7 万参数、跑在端侧 CPU 上的小头，就能判断这个答案是直接发出去还是升级到云端大模型。代价是每请求 2 到 3 毫秒，而那些要在 GPU 上再跑一遍打分模型的已有方法是 47 到 119 毫秒。而且这是今天唯一一篇真的把已有方法重新跑过来对比的论文，这在本期是稀缺品。要挑刺：它说自己路由准确率最高，可这个"最高"全文只有四张柱状图，一个基线数值都没印，读者无从判断领先幅度；它自报的绝对值里有一个模型上只有 0.685，而这个指标的随机水平是 0.5；那个二十倍的延迟优势也有一部分来自实现选择——自家的头跑在 CPU 上，对手被放在 GPU 上跑。评级人上人。

时刻三，整条轨迹。EarlyEval（上海交大 / 新加坡管理大学 / 华东师大 / 上海创智学院，arXiv:2609.02783）换了个问题：不是选哪个模型，而是要不要接着跑。场景是 agent 评测，动机数字是今天最有说服力的一组——在一个五百道题的主流评测上完整跑一遍，按公开价目一次 715 到 935 美元，多模态版本最贵到 2270 美元，而一个开发周期要跑几十次。已有的省钱办法都是减题目，可留下的每道还是原价，单题成本一点没动。它的做法是每一步判断一次：把轨迹到目前为止的几百维特征喂给两个梯度提升树，一个预测会成功一个预测会失败，任一越过阈值就地停掉并记下预测结果。效果是省掉 26% 的执行步数、预测准确率 95%，而各 agent 最后的解决率平均只偏了 1.1 个百分点。三点要说清楚：它同样没跟任何已发表方法比过；这个漂亮数字所在的设定里只有一种 agent 框架，它自己做的换框架留出测试上节省掉了约三分之一；以及在那个代码评测上，它的特征里包含与标准答案补丁的重合度——做评测这是合理的，但这意味着它不是一个通用的线上中止器。评级人上人。

快速一览
知道什么时候求助（arXiv:2608.24087）站的位置跟 Pro-Router 几乎重合，结论却相反：它认为解码时的原始置信度不够用，需要的是一个校准过的、关于最终答案会不会对的后验，逐 token 判断要不要中途放弃。这篇诚实得罕见——正文里撤回了自己的两个定理并附上反例。单作者，理论部分基本没有实验支撑，作为一个值得记住的提法收下。
ProgRouter（arXiv:2608.25992）把决定放在多智能体工作流的每一次派发上，依据是从协调者账本导出的进度代理指标，还叠了能耗预算。想法不错，但赢面很薄，那些预算阈值是作者自己定的。

一句话收尾
今天这五篇都读了全文，只有一篇认真跑了跟已有方法的对比，其余四篇是单一随机种子、没有置信区间。点子密度很高，把话说实的密度还没跟上。

时间线
00:00 开场 · 省钱的方案都在回答同一个问题，但没人说是在什么时候回答
00:41 三个时刻的框架 · 生成前 / 解码中 / 整条轨迹
01:07 时刻一，生成前 · SCX Router（Knowledgator / SCX.ai）
01:33 动机 · 八个候选里随便挑平均 0.52，挑对了 0.78
02:11 机制 · 常驻 KV 缓存 + 瞬态候选标签，全程不解码路由 token
02:43 结论要按住 · 0.707 对 0.696，单一种子无置信区间
03:10 而且那一千道题是按结果挑出来的
03:48 时刻二，解码中 · Pro-Router（Anyscale / 密西西比州立 / 中科院计算所）
04:06 两派各自为什么不成立
04:32 今天最漂亮的观察 · 判断信号在解码时已经免费产生了
05:07 代价 2–3 毫秒，对手 47–119 毫秒；也是唯一真跑了已有方法对比的一篇
05:35 挑刺 · 说自己准确率最高，可全文只有柱状图没有数值
06:11 时刻三，整条轨迹 · EarlyEval（上海交大 / 新加坡管理大学 / 华东师大 / 上海创智学院）
06:31 动机 · 跑一次五百题评测 715 到 935 美元，一个开发周期要跑几十次
07:15 机制 · 一个成功头一个失败头，每步判一次，越过阈值就地停
07:41 省掉 26% 步数，各 agent 解决率平均只偏 1.1 个百分点
08:20 但它看了标准答案 · 所以不是通用的线上中止器
08:50 三个时刻串起来 · 越早省得越多，但知道得越少
09:25 快讯 · 知道什么时候求助（同一时刻，相反结论）
10:13 快讯 · ProgRouter
10:33 收尾 · 五篇里只有一篇认真跑了对比]]></description>
      <content:encoded><![CDATA[0904 MLSYS 论文简报：什么时候决定花这笔钱

评论
省钱的方案都在回答同一个问题：这个请求值多少算力。但还有个几乎没人明说的维度——你是在什么时候下这个判断的。今天三篇正好各站一个时刻：一个 token 都还没生成的时候、小模型正在解码的时候、一整条 agent 轨迹跑到一半的时候。串起来有条挺清楚的曲线：决定得越早能省的越多，但你知道得越少；决定得越晚越有把握，可省的那块也越小。最讨巧的是中间那个位置，因为解码中的判断信号是白来的。

本期重点

时刻一，生成前。SCX Router（Knowledgator / SCX.ai，arXiv:2609.02292）面对的是一份天天在变的模型端点名单，价格、质量、延迟、上下文长度、工具权限各不相同。动机数字很直白：在某公开评测的语言子集上，八个候选里随便挑一个平均只有 0.52，挑对了是 0.78。做法是在生成之前放一个 0.6B 的判别式分类器，一次非生成式前向就给每个端点打出适配分，全程不解码任何路由 token；对话历史做成常驻 KV 缓存、每轮只编码新增部分，候选端点的名字作为瞬态 token 挂上去打完分即丢弃 KV，所以名单可以逐轮更换而不污染会话缓存。这个设计是漂亮的。但结论要按住：跟最强的那个固定模型比是 0.707 对 0.696，一千道题、单一种子、无置信区间、无显著性检验，这个差距就是噪声；而且那一千道题是从更大集合里按"路由至少在某个深度有正收益"筛出来的，等于按结果挑样本。它一个已发表的路由基线都没跑，更要紧的是它主打的 KV 缓存省算力那套说法，全文没有一个延迟数字——卖点本身没测。拿设计，别拿结论。评级人上人。

时刻二，解码中。Pro-Router（Anyscale / 密西西比州立 / 中科院计算所，arXiv:2608.28726）先把两派都批评了一遍：只看请求的路由器在一个 token 都没有时就下判断，而请求本身不告诉你小模型答不答得出来；看完答案再打分的那派准是准了，但每个请求要多跑一遍另一个语言模型，这笔开销把省下的直接吃掉。它的观察是今天最漂亮的一个——那个判断信号，解码的时候已经免费产生了。小模型每吐一个 token 都会顺带给出对数概率、最大概率、前二十的熵，把这条序列喂给一个约 6.7 万参数、跑在端侧 CPU 上的小头，就能判断这个答案是直接发出去还是升级到云端大模型。代价是每请求 2 到 3 毫秒，而那些要在 GPU 上再跑一遍打分模型的已有方法是 47 到 119 毫秒。而且这是今天唯一一篇真的把已有方法重新跑过来对比的论文，这在本期是稀缺品。要挑刺：它说自己路由准确率最高，可这个"最高"全文只有四张柱状图，一个基线数值都没印，读者无从判断领先幅度；它自报的绝对值里有一个模型上只有 0.685，而这个指标的随机水平是 0.5；那个二十倍的延迟优势也有一部分来自实现选择——自家的头跑在 CPU 上，对手被放在 GPU 上跑。评级人上人。

时刻三，整条轨迹。EarlyEval（上海交大 / 新加坡管理大学 / 华东师大 / 上海创智学院，arXiv:2609.02783）换了个问题：不是选哪个模型，而是要不要接着跑。场景是 agent 评测，动机数字是今天最有说服力的一组——在一个五百道题的主流评测上完整跑一遍，按公开价目一次 715 到 935 美元，多模态版本最贵到 2270 美元，而一个开发周期要跑几十次。已有的省钱办法都是减题目，可留下的每道还是原价，单题成本一点没动。它的做法是每一步判断一次：把轨迹到目前为止的几百维特征喂给两个梯度提升树，一个预测会成功一个预测会失败，任一越过阈值就地停掉并记下预测结果。效果是省掉 26% 的执行步数、预测准确率 95%，而各 agent 最后的解决率平均只偏了 1.1 个百分点。三点要说清楚：它同样没跟任何已发表方法比过；这个漂亮数字所在的设定里只有一种 agent 框架，它自己做的换框架留出测试上节省掉了约三分之一；以及在那个代码评测上，它的特征里包含与标准答案补丁的重合度——做评测这是合理的，但这意味着它不是一个通用的线上中止器。评级人上人。

快速一览
知道什么时候求助（arXiv:2608.24087）站的位置跟 Pro-Router 几乎重合，结论却相反：它认为解码时的原始置信度不够用，需要的是一个校准过的、关于最终答案会不会对的后验，逐 token 判断要不要中途放弃。这篇诚实得罕见——正文里撤回了自己的两个定理并附上反例。单作者，理论部分基本没有实验支撑，作为一个值得记住的提法收下。
ProgRouter（arXiv:2608.25992）把决定放在多智能体工作流的每一次派发上，依据是从协调者账本导出的进度代理指标，还叠了能耗预算。想法不错，但赢面很薄，那些预算阈值是作者自己定的。

一句话收尾
今天这五篇都读了全文，只有一篇认真跑了跟已有方法的对比，其余四篇是单一随机种子、没有置信区间。点子密度很高，把话说实的密度还没跟上。

时间线
00:00 开场 · 省钱的方案都在回答同一个问题，但没人说是在什么时候回答
00:41 三个时刻的框架 · 生成前 / 解码中 / 整条轨迹
01:07 时刻一，生成前 · SCX Router（Knowledgator / SCX.ai）
01:33 动机 · 八个候选里随便挑平均 0.52，挑对了 0.78
02:11 机制 · 常驻 KV 缓存 + 瞬态候选标签，全程不解码路由 token
02:43 结论要按住 · 0.707 对 0.696，单一种子无置信区间
03:10 而且那一千道题是按结果挑出来的
03:48 时刻二，解码中 · Pro-Router（Anyscale / 密西西比州立 / 中科院计算所）
04:06 两派各自为什么不成立
04:32 今天最漂亮的观察 · 判断信号在解码时已经免费产生了
05:07 代价 2–3 毫秒，对手 47–119 毫秒；也是唯一真跑了已有方法对比的一篇
05:35 挑刺 · 说自己准确率最高，可全文只有柱状图没有数值
06:11 时刻三，整条轨迹 · EarlyEval（上海交大 / 新加坡管理大学 / 华东师大 / 上海创智学院）
06:31 动机 · 跑一次五百题评测 715 到 935 美元，一个开发周期要跑几十次
07:15 机制 · 一个成功头一个失败头，每步判一次，越过阈值就地停
07:41 省掉 26% 步数，各 agent 解决率平均只偏 1.1 个百分点
08:20 但它看了标准答案 · 所以不是通用的线上中止器
08:50 三个时刻串起来 · 越早省得越多，但知道得越少
09:25 快讯 · 知道什么时候求助（同一时刻，相反结论）
10:13 快讯 · ProgRouter
10:33 收尾 · 五篇里只有一篇认真跑了对比]]></content:encoded>
      <pubDate>Fri, 04 Sep 2026 00:30:00 GMT</pubDate>
      <guid isPermaLink="false">mlsys-feed-2026-09-04</guid>
      <enclosure url="https://github.com/baihuajun24/baihuajun24.github.io/releases/download/audio-archive/0904-daily-arxiv.mp3" length="10489389" type="audio/mpeg" />
      <itunes:duration>10:55</itunes:duration>
      <itunes:explicit>false</itunes:explicit>
    </item>
    <item>
      <title>0903 MLSYS 论文简报：上下文的三种减法</title>
      <description><![CDATA[# 0903 MLSYS 论文简报：上下文的三种减法

Audio: 10:42

## 评论
昨天那期讲的是 agent 的上下文怎么在服务端存得更便宜——缓存怎么复用、前缀该留谁。今天把问题往前推一步：这些东西一开始有没有必要进上下文？三篇论文正好是三种减法——历史、工具说明书、原始数据。有意思的是，三篇都很诚实地报了同一件事：收益不均匀，而且经常有个特别土的办法就够了。第一篇自己给出的对照里，一条纯 prompt 层的便签比它的整套机制更便宜且同样全对，一个十五行正则的计数器是全表最省的一格；第二篇真正站得住的发现不是"少给省钱"而是"早给会坏事"；第三篇有约四分之一的问题反而比基线更贵。

## 本期重点

减法一，历史。Parsing the Stream（Salesforce AI Research，arXiv:2609.01466）盯的是 agent 跑长任务时唯一的产物——那条只追加的轨迹。作者拿自己十二个真实工作会话来测，中位一条约 600 万 token，任何模型窗口都装不下；而这条轨迹同时压垮两类读者：想中途知道 agent 在干什么的人，和必须把轨迹折回自己窗口里的 agent 本身——今天这两类读者被两套系统分别伺候，可读的是同一条流。做法是把事件流单遍折成一份有类型的运行状态：目标、当前边界、挂起的调用、计数器、碰过的文件，以及从工具结果里抽出、以来源为键的事实。最讲究的一处是"聚合保持型淘汰"——事实存不下时淘汰单条数值，但淘汰前把它折进该键的计数与求和里，个别值可以丢，被跟踪的统计量一个都不能错。然后从同一份状态编译出两个视图：给人看的网页，给 agent 用的紧凑文本块（worker 上下文 = 编译视图 + 最近 5 步原始步骤，每 5 步由 curator 重新物化）。数字：观察者侧输入 token 从 779K 降到 57K（约 14×），监控题准确率 0.871 对上直接读原始轨迹尾部的 0.479，中间对照 flat log 0.621。但账要算清楚：0.479 那个基线是被封顶的单次读取（10 万字符预算），作者自承不封顶的读根本不可得、真正公平的基线（会用工具的多轮 reader）这篇没跑。而这篇最狠的一刀是它自己捅的：120 环任务上折叠视图 30/30 @ $1.59，可一条纯 prompt 层的便签（让模型每步多写一个 note 字段，零系统机制）同样 30/30 且只要 $0.97，一个 15 行正则的计数器 10/10 @ $0.67 是全表最便宜的一格——作者写道，在这个任务族上那个极简产物就够了。最有画面感的取证细节：折叠视图那五次失败，视图上显示的总和每次都是对的，错在模型自己在正确总和上又把一个已计入的数加了一遍（而且每次都是最近 5 步窗口与折叠覆盖范围重叠的那个）；修法不是改算法，而是让聚合行自报覆盖范围。评级夯——它把自己不成立的地方全写出来了，还标了失效边界：顺序敏感的任务上它 3/10，反而输给全上下文的 6/10。

减法二，工具说明书。String（首尔大学 / H1R.AI，arXiv:2608.28027）要治的是把所有工具的接口描述一次性塞进上下文——论文给的参照是 100 个服务的完整描述每轮 103,518 个 token。做法是一个应用就是一个 Markdown 文件，工具知识不进上下文而留在运行时里，一次只渲染一个局部视图；经 MCP 整个运行时对外只暴露一个工具，所以发现新能力靠翻页，而不是靠一个越来越长的工具列表。数字是 token 平均降 33.5%，成功率 51.8% 对 50.5%。账：那 1.3 个点基本是噪声，而那张表连方差和置信区间都没给；33.5% 只统计"已完成的 episode"（作者自承选择偏差）；十万那个基线也偏弱——把所有描述全倒进去，可他们自己的一行索引只要 3,291；应用还是作者手工移植的，论文自承该比较"未能把可执行封装与渲染纪律分离"。但全篇最好的结果压根不在标题上，在一个消融里：信息量完全固定不变，只是把第二层细节提前一轮给出去，成功率掉 11.6（Sonnet）到 23.3（Haiku）个点，95% 置信区间不含零；而把所有可选动作一次全摆出来，选错动作的比例从 2% 涨到 28%。所以这篇真正的发现不是"少给省钱"，是"早给会坏事"。评级人上人。

减法三，原始数据。agentic data cracking（Harvard，arXiv:2608.31082）盯的是 agent 为了取几个字段就得把整篇文档反复载入——作者实测回答一个问题最多烧掉约 100 万 token、接近 1 美元。为什么不提前结构化？因为文档里潜在的实体和属性比真实负载会用到的多出几个数量级，而且查询来之前根本不知道该抽什么。于是它借了数据库 cracking 的思路——查询驱动、增量组织，并立了个很干净的规矩：绝不为了抽取而单独打开一篇文档；只有当 agent 已经为了回答问题打开了原文，才在那份已经付过预填充的上下文上分叉一个子 agent，用固定的解码预算把结构抽出来，等于结构化成了推理的副产品而不是前置工程。而且是投机的——不只抽当前要的那个属性，还抽同一篇里下一个问题可能用得上的邻近结构；他们类比成缓存未命中之后的预取，只是把基于地址的局部性换成了 agent 发现的语义局部性。数字：平均每题从 $0.26 降到 $0.12（约 53%），准确率判定 43.0 对 42.0，p=0.39 不显著。账：53% 是均值而分布极不均——中位省 3.4×、第 10 百分位省 9×，但第 90 百分位反而比基线贵 1.24×，也就是约四分之一的问题纯粹在多付钱；而那个把仓库焐热的相关问题是全价跑的、还不进主指标，所以整个负载的净收益必然明显低于 53%。更要紧的是复用局部性是人为造出来的：该数据集本来几乎不重复访问同一批文档，是作者用大模型按"实体重叠、属性不同"给每题配了一个相关问题，而这恰好是投机抽取最擅长的形状。有个说法很妙：他们把攒下来的这堆结构叫护城河，因为纯文本的结构能跨模型升级活下来，而 KV 缓存绑死在一个模型上、体积还比原文大得多。评级人上人。

## 快速一览
The Reasoning Tax（联想 ISG，arXiv:2608.26235）定义了一个 token 经济分：准确率的提升除以 token 的倍数。结论是任务的结构比难度更决定值不值——数学竞赛题最划算，更难的研究生级问答反而不划算；还有反着的例子，推理档位从中调到最高，代码题掉 0.5 分、研究生问答掉 1.7 分。口径要说清楚：所谓 151 次其实是 151 个模型×基准的组合（构成 77 对），每格只跑一次，数据取自第三方榜单而非作者复跑，路由规则的阈值也没有留出验证。

## 本期还评估但未播出
TEPA（arXiv:2608.07429，可撤销的 agent 记忆）经全文精读后否决：0.950 对 0.210 的全反转场景是作者自造的合成流，到唯一的外部基准上只是打平（0.890 = last-write-wins 0.890），偏好流上相对"无记忆"的净增益 p=1.000，而在一个更长的设定里它 0.000、朴素的 append-only 反而 0.350。

## 内容时间戳
00:00 开场 · 昨天讲怎么存得更便宜，今天问该不该存
00:38 减法一，历史 · Parsing the Stream（Salesforce）
00:50 问题：agent 唯一的产物就是那条只追加的流，中位一条约 600 万 token
01:25 两类读者都被压垮 · 人读原始尾部只有 0.48，带全历史的 worker 三十次只成八次
02:13 只解析一次 · 折成有类型的运行状态，聚合保持型淘汰
02:52 效果与口径 · 0.48 提到 0.87，但那个 0.48 是被预算封顶的基线
03:23 它自己捅的一刀 · 一条 prompt 便签同样全对且更便宜，15 行正则最省（夯）
04:40 减法二，工具说明书 · String（首尔大学 / H1R.AI）
04:50 问题：所有工具的接口描述常驻上下文，每一轮都要重付
05:37 标题数字基本打平 · 差 1.3 个点，表里没有方差
05:56 真正的发现 · 同样的信息早给一轮，掉 11 到 23 个点（人上人）
06:30 减法三，原始数据 · agentic data cracking（哈佛）
06:58 问题：预先结构化便宜 28 倍，可你不知道该抽什么
07:17 什么是 cracking · 索引是查询的副产品，不预先建
08:23 这笔账 · 平均省一半，但最贵那档更贵；局部性是人为造的（人上人）
09:28 快速一览 · 推理税：任务结构比难度更决定值不值
09:59 收尾 · 这个百分比的分母是什么？

## 论文与链接
Parsing the Stream: A Live Trace Model for Long-Horizon Agents and Their Observers — arXiv:2609.01466
String: An Agentic OS Where Every App Is a Markdown File — arXiv:2608.28027
Token-Efficient Data Reasoning Agents via Adaptive Structuring of Unstructured Data — arXiv:2608.31082
The Reasoning Tax: Token Economics of LLM Reasoning — arXiv:2608.26235

## 制作元信息
选题：一篇取自当日新论文（Parsing the Stream，2026-09-02 批次），另两篇取自过去三周的候选池。本期共精读五篇、选入三篇。
关系：本期是 0902 的对偶篇——0902 三篇都在让 agent 上下文更便宜地被服务，本期三篇都在问它是否该存在。0902 的 ReCache（把工具 schema 缓存得更便宜）与本期 String（干脆延后披露 schema）是同一成本问题的相反解法。
来源：三篇主讲与两篇被否候选均为全文精读（PDF 逐页），机构取自 PDF 首页作者块。
口径：各篇数字均为论文自报，模型与基准不同不可横比。Parsing the Stream 的对照基线被预算封顶且公平基线未跑；String 的成功率差在噪声内、该表无方差；agentic data cracking 的复用局部性由作者构造且约四分之一问题净亏；推理税的数据来自第三方榜单、每格一次。
音频：本地 Qwen3-TTS 合成，双主持 Jeff（uncle_fu）/ Ada（serena），未加速。
]]></description>
      <content:encoded><![CDATA[# 0903 MLSYS 论文简报：上下文的三种减法

Audio: 10:42

## 评论
昨天那期讲的是 agent 的上下文怎么在服务端存得更便宜——缓存怎么复用、前缀该留谁。今天把问题往前推一步：这些东西一开始有没有必要进上下文？三篇论文正好是三种减法——历史、工具说明书、原始数据。有意思的是，三篇都很诚实地报了同一件事：收益不均匀，而且经常有个特别土的办法就够了。第一篇自己给出的对照里，一条纯 prompt 层的便签比它的整套机制更便宜且同样全对，一个十五行正则的计数器是全表最省的一格；第二篇真正站得住的发现不是"少给省钱"而是"早给会坏事"；第三篇有约四分之一的问题反而比基线更贵。

## 本期重点

减法一，历史。Parsing the Stream（Salesforce AI Research，arXiv:2609.01466）盯的是 agent 跑长任务时唯一的产物——那条只追加的轨迹。作者拿自己十二个真实工作会话来测，中位一条约 600 万 token，任何模型窗口都装不下；而这条轨迹同时压垮两类读者：想中途知道 agent 在干什么的人，和必须把轨迹折回自己窗口里的 agent 本身——今天这两类读者被两套系统分别伺候，可读的是同一条流。做法是把事件流单遍折成一份有类型的运行状态：目标、当前边界、挂起的调用、计数器、碰过的文件，以及从工具结果里抽出、以来源为键的事实。最讲究的一处是"聚合保持型淘汰"——事实存不下时淘汰单条数值，但淘汰前把它折进该键的计数与求和里，个别值可以丢，被跟踪的统计量一个都不能错。然后从同一份状态编译出两个视图：给人看的网页，给 agent 用的紧凑文本块（worker 上下文 = 编译视图 + 最近 5 步原始步骤，每 5 步由 curator 重新物化）。数字：观察者侧输入 token 从 779K 降到 57K（约 14×），监控题准确率 0.871 对上直接读原始轨迹尾部的 0.479，中间对照 flat log 0.621。但账要算清楚：0.479 那个基线是被封顶的单次读取（10 万字符预算），作者自承不封顶的读根本不可得、真正公平的基线（会用工具的多轮 reader）这篇没跑。而这篇最狠的一刀是它自己捅的：120 环任务上折叠视图 30/30 @ $1.59，可一条纯 prompt 层的便签（让模型每步多写一个 note 字段，零系统机制）同样 30/30 且只要 $0.97，一个 15 行正则的计数器 10/10 @ $0.67 是全表最便宜的一格——作者写道，在这个任务族上那个极简产物就够了。最有画面感的取证细节：折叠视图那五次失败，视图上显示的总和每次都是对的，错在模型自己在正确总和上又把一个已计入的数加了一遍（而且每次都是最近 5 步窗口与折叠覆盖范围重叠的那个）；修法不是改算法，而是让聚合行自报覆盖范围。评级夯——它把自己不成立的地方全写出来了，还标了失效边界：顺序敏感的任务上它 3/10，反而输给全上下文的 6/10。

减法二，工具说明书。String（首尔大学 / H1R.AI，arXiv:2608.28027）要治的是把所有工具的接口描述一次性塞进上下文——论文给的参照是 100 个服务的完整描述每轮 103,518 个 token。做法是一个应用就是一个 Markdown 文件，工具知识不进上下文而留在运行时里，一次只渲染一个局部视图；经 MCP 整个运行时对外只暴露一个工具，所以发现新能力靠翻页，而不是靠一个越来越长的工具列表。数字是 token 平均降 33.5%，成功率 51.8% 对 50.5%。账：那 1.3 个点基本是噪声，而那张表连方差和置信区间都没给；33.5% 只统计"已完成的 episode"（作者自承选择偏差）；十万那个基线也偏弱——把所有描述全倒进去，可他们自己的一行索引只要 3,291；应用还是作者手工移植的，论文自承该比较"未能把可执行封装与渲染纪律分离"。但全篇最好的结果压根不在标题上，在一个消融里：信息量完全固定不变，只是把第二层细节提前一轮给出去，成功率掉 11.6（Sonnet）到 23.3（Haiku）个点，95% 置信区间不含零；而把所有可选动作一次全摆出来，选错动作的比例从 2% 涨到 28%。所以这篇真正的发现不是"少给省钱"，是"早给会坏事"。评级人上人。

减法三，原始数据。agentic data cracking（Harvard，arXiv:2608.31082）盯的是 agent 为了取几个字段就得把整篇文档反复载入——作者实测回答一个问题最多烧掉约 100 万 token、接近 1 美元。为什么不提前结构化？因为文档里潜在的实体和属性比真实负载会用到的多出几个数量级，而且查询来之前根本不知道该抽什么。于是它借了数据库 cracking 的思路——查询驱动、增量组织，并立了个很干净的规矩：绝不为了抽取而单独打开一篇文档；只有当 agent 已经为了回答问题打开了原文，才在那份已经付过预填充的上下文上分叉一个子 agent，用固定的解码预算把结构抽出来，等于结构化成了推理的副产品而不是前置工程。而且是投机的——不只抽当前要的那个属性，还抽同一篇里下一个问题可能用得上的邻近结构；他们类比成缓存未命中之后的预取，只是把基于地址的局部性换成了 agent 发现的语义局部性。数字：平均每题从 $0.26 降到 $0.12（约 53%），准确率判定 43.0 对 42.0，p=0.39 不显著。账：53% 是均值而分布极不均——中位省 3.4×、第 10 百分位省 9×，但第 90 百分位反而比基线贵 1.24×，也就是约四分之一的问题纯粹在多付钱；而那个把仓库焐热的相关问题是全价跑的、还不进主指标，所以整个负载的净收益必然明显低于 53%。更要紧的是复用局部性是人为造出来的：该数据集本来几乎不重复访问同一批文档，是作者用大模型按"实体重叠、属性不同"给每题配了一个相关问题，而这恰好是投机抽取最擅长的形状。有个说法很妙：他们把攒下来的这堆结构叫护城河，因为纯文本的结构能跨模型升级活下来，而 KV 缓存绑死在一个模型上、体积还比原文大得多。评级人上人。

## 快速一览
The Reasoning Tax（联想 ISG，arXiv:2608.26235）定义了一个 token 经济分：准确率的提升除以 token 的倍数。结论是任务的结构比难度更决定值不值——数学竞赛题最划算，更难的研究生级问答反而不划算；还有反着的例子，推理档位从中调到最高，代码题掉 0.5 分、研究生问答掉 1.7 分。口径要说清楚：所谓 151 次其实是 151 个模型×基准的组合（构成 77 对），每格只跑一次，数据取自第三方榜单而非作者复跑，路由规则的阈值也没有留出验证。

## 本期还评估但未播出
TEPA（arXiv:2608.07429，可撤销的 agent 记忆）经全文精读后否决：0.950 对 0.210 的全反转场景是作者自造的合成流，到唯一的外部基准上只是打平（0.890 = last-write-wins 0.890），偏好流上相对"无记忆"的净增益 p=1.000，而在一个更长的设定里它 0.000、朴素的 append-only 反而 0.350。

## 内容时间戳
00:00 开场 · 昨天讲怎么存得更便宜，今天问该不该存
00:38 减法一，历史 · Parsing the Stream（Salesforce）
00:50 问题：agent 唯一的产物就是那条只追加的流，中位一条约 600 万 token
01:25 两类读者都被压垮 · 人读原始尾部只有 0.48，带全历史的 worker 三十次只成八次
02:13 只解析一次 · 折成有类型的运行状态，聚合保持型淘汰
02:52 效果与口径 · 0.48 提到 0.87，但那个 0.48 是被预算封顶的基线
03:23 它自己捅的一刀 · 一条 prompt 便签同样全对且更便宜，15 行正则最省（夯）
04:40 减法二，工具说明书 · String（首尔大学 / H1R.AI）
04:50 问题：所有工具的接口描述常驻上下文，每一轮都要重付
05:37 标题数字基本打平 · 差 1.3 个点，表里没有方差
05:56 真正的发现 · 同样的信息早给一轮，掉 11 到 23 个点（人上人）
06:30 减法三，原始数据 · agentic data cracking（哈佛）
06:58 问题：预先结构化便宜 28 倍，可你不知道该抽什么
07:17 什么是 cracking · 索引是查询的副产品，不预先建
08:23 这笔账 · 平均省一半，但最贵那档更贵；局部性是人为造的（人上人）
09:28 快速一览 · 推理税：任务结构比难度更决定值不值
09:59 收尾 · 这个百分比的分母是什么？

## 论文与链接
Parsing the Stream: A Live Trace Model for Long-Horizon Agents and Their Observers — arXiv:2609.01466
String: An Agentic OS Where Every App Is a Markdown File — arXiv:2608.28027
Token-Efficient Data Reasoning Agents via Adaptive Structuring of Unstructured Data — arXiv:2608.31082
The Reasoning Tax: Token Economics of LLM Reasoning — arXiv:2608.26235

## 制作元信息
选题：一篇取自当日新论文（Parsing the Stream，2026-09-02 批次），另两篇取自过去三周的候选池。本期共精读五篇、选入三篇。
关系：本期是 0902 的对偶篇——0902 三篇都在让 agent 上下文更便宜地被服务，本期三篇都在问它是否该存在。0902 的 ReCache（把工具 schema 缓存得更便宜）与本期 String（干脆延后披露 schema）是同一成本问题的相反解法。
来源：三篇主讲与两篇被否候选均为全文精读（PDF 逐页），机构取自 PDF 首页作者块。
口径：各篇数字均为论文自报，模型与基准不同不可横比。Parsing the Stream 的对照基线被预算封顶且公平基线未跑；String 的成功率差在噪声内、该表无方差；agentic data cracking 的复用局部性由作者构造且约四分之一问题净亏；推理税的数据来自第三方榜单、每格一次。
音频：本地 Qwen3-TTS 合成，双主持 Jeff（uncle_fu）/ Ada（serena），未加速。
]]></content:encoded>
      <pubDate>Thu, 03 Sep 2026 00:30:00 GMT</pubDate>
      <guid isPermaLink="false">mlsys-feed-2026-09-03</guid>
      <enclosure url="https://github.com/baihuajun24/baihuajun24.github.io/releases/download/audio-archive/0903-daily-arxiv.mp3" length="10288173" type="audio/mpeg" />
      <itunes:duration>10:42</itunes:duration>
      <itunes:explicit>false</itunes:explicit>
    </item>
    <item>
      <title>0902 MLSYS 论文简报：agent 把缓存这本账重记了</title>
      <description><![CDATA[# 0902 MLSYS 论文简报：agent 把缓存这本账重记了
Audio: 11:18

> 停更三周，回来第一期做一个主题：当请求从人打字变成 agent 自动发起，KV 缓存这本账被重记了。三篇论文正好落在三个尺度上——集群怎么路由、单机留什么、以及缓存的单位到底该是什么。

## 内容时间戳

- 00:00 开场 · 缓存这本账，被 agent 重记了
- 00:28 SMetric（上海交大 / 阿里）· 生产轨迹：92.9% 请求由 agent 发起，复用率 80%+
- 01:43 反直觉的一条 · 全局层配满后，完全不看缓存的调度器只差 7%
- 02:57 只调度每个会话的第一个请求 · 轮次信号是白嫖的，路由器保持无状态
- 03:48 SMetric 的账 · 2% 低端就是全局层满配点；增益只在饱和拐点附近（夯）
- 04:39 TOPAS（中科大 / 合工大）· 前缀常驻 vs 批处理显存，1.8-1.9 倍的差距
- 05:40 联合状态打分 · 收益按任务最长剩余路径的期望缩短量算
- 06:29 TOPAS 的账 · 39.8% 来自合成负载，真实工作流 9.8%；单卡单次无方差（人上人）
- 07:12 ReCache（上海交大 / 宁波东方理工 / 西安交大）· 可重排的工具集合不是前缀
- 07:58 抹掉跨资源注意力 + 位置归零 · 同一个工具永远是同一份 KV
- 08:21 字段消融 · 只留末尾 token 幻觉率 76%；加回工具名幻觉率相对降 97.63%
- 08:54 描述几乎无用，参数怎么填才值钱 · 模型要的是约束不是散文
- 09:31 ReCache 的三笔账 · 要全参微调、未见工具掉 5.5 分、没跑任何缓存复用基线（人上人）
- 10:37 收尾 · 你优化的是命中率，还是命中来自哪一层？

## 本期主讲

**1. SMetric: Rethink LLM Scheduling for Serving Agents with Balanced Session-centric Scheduling**（上海交通大学并行与分布式系统研究所 / 阿里巴巴，arXiv:2607.08565）
先摆生产数据：两条真实商用编码智能体的 trace 里，92.9% 的请求由 agent 自动发起而非人在打字；KV 缓存可复用比例超过 80%，而聊天负载只有 54–62%。目标也随之改变——agent 只在拿到完整回复后才行动，集群总吞吐成了第一目标。于是调度器都在抢缓存亲和，代价是负载不均衡（生产调度器 2.7×、学术基线 3.0×）。最有价值的观察是反直觉的：全局缓存层配满时，完全不看缓存的纯负载均衡调度器吞吐只低 7%，四种策略整体复用率都在 73–75%，差别只在命中层级（本地命中 58% vs 6%）——全局层已经把「复用」和「请求落点」解耦了。另一个数字说明「会话钉死」：缓存亲和下 96.6% 的后续请求回到首轮实例，纯负载均衡下只有 4.0%。方案因此只有一句：只把每个会话的首个请求纯按负载打散，后续照常走缓存亲和；而「这是第几轮」这个信号是白嫖的——接口无状态、每个请求都带完整历史，数消息条数即可，路由器保持完全无状态（他们刻意否决了 session→instance 映射表，因为会话永不显式结束、表会一直长还得 GC）。同机部署吞吐高 10–16%，首字时延中位数 1.1 秒。诚实点：宣传的「预填充吞吐 +2~34%」，2% 低端恰是全局层满配点——全局层越充裕优势越小；完全没有全局存储时与生产调度器差在 1% 以内；增益只集中在饱和拐点附近的窄区间（1.0× 负载差 1%、1.5× 高 15%、1.75× 只高 4%）；trace 未公开、两条只回放一条、采集窗口仅两小时、测试床 32 张卡对上千卡生产集群。评级：夯。

**2. TOPAS: Workflow-Aware Prefix-State Scheduling for Multi-Agent LLM Serving**（中国科学技术大学 / 合肥工业大学，arXiv:2608.25523）
把同一个矛盾下沉到一张卡：agent 的长 system prompt 前缀常驻能省 prefill，但它占走的显存正是留给并发批处理和解码的显存。动机实验朴素也够狠——同一批请求、同样预算，只把服务顺序从两个 agent 交替改成按 agent 分组，平均批大小从 4.7 涨到 9.3，总耗时从 2086 秒掉到 1145 秒。论文里还有一张手算的图：追进度的策略平均完成时间 21.5，而攒同前缀请求、摊薄装载费的策略反而是 24——两种看起来都对的直觉互相打脸。做法是不再逐个请求排序，而是枚举「这一步之后留哪几段前缀、同时能跑哪一批请求」这个联合状态并按秒打分；最值得说的是收益的定义——不按请求自身的服务时间算，而按这个请求做完之后任务最长剩余路径能缩短多少，于是推进一条非瓶颈分支不会被错记成进度。实现于 SGLang v0.5.3。数字：合成工作流 mean/p99 完成时间降 39.8%/49.4%，真实的两个 MetaGPT 工作流分别是 22.0% 和 9.8%。诚实点：39.8% 来自合成负载（固定长度 query + 固定生成长度，把「路径长度可预测」这个最有利条件给足了），真实流水线上是个位数；单张 A100、单实例，到达序列只采样一次、无重复实验、无方差——p99 尾指标在单次实验下尤其不稳；它还假设所有任务遵循同一个已知的工作流图，而核心量「最长剩余路径」正是靠这张图算出来的。评级：人上人。

**3. ReCache: Efficient KV Cache Reuse and Compression for Tool-Augmented LLM Agents**（上海交通大学 / 宁波东方理工大学 / 西安交通大学，arXiv:2608.19662）
前两篇都还认「前缀」，这篇说在 agent 上这个前提已经不成立：agent 按任务检索工具，同一个工具反复出现，但每次的组合不同、顺序也不同；而前缀缓存要求复用内容构成完全相同的前缀，所以换掉一个工具、或同一批换个排列顺序，后面所有工具的 KV 全部作废。改法是抹掉跨资源注意力、把每个工具内部的位置索引归零重排，而周围上下文保留原位置——同一个工具无论排第几、和谁一起被检索，KV 都是同一份，可以离线单独构造、单独复用。消融里有全篇最刺眼的数字：每个工具只留最后一个 token，调用分数掉到 14.8、幻觉率 76%，模型基本在瞎编工具名；仅仅把工具名加回去，幻觉率就相对下降 97.63%。另一个对照更好玩：在工具名和参数名的基础上再加「这个工具是干嘛的」那段描述，分数只从 67.7 动到 67.9，而加「这个参数该怎么填」直接到 72.8——模型要的是约束，不是散文。数字上，只做那一步注意力改造，见过的工具上 82.3 对稠密基线 82.4 基本持平、首字时延快 3.655 倍，完整版显存降 92.43%。诚实点：它不是免训练的，需要全参数微调（作者在 Limitations 自承冻结模型留作未来工作）；「基本持平」的 82.3 只是单独一项且只在训练见过的工具上成立，完整版在见过的工具上掉 2.1 分、在完全没见过的工具上是 60.8 对 66.3、掉 5.5 分——而「没见过的新工具」恰恰是它想解决的场景；表里没有跑任何一个真正的缓存复用基线（前缀缓存、EPIC、CacheBlend、KVLink、KVCOMM 全都只在文献综述里）；3.655 倍那个首字时延定义上排除了离线缓存构造，等于假设 100% 命中。评级：人上人。

## 收尾

三篇在三个尺度上打同一场仗。共同点是 agent 同时拆掉了两个前提：一个是「复用和请求落在哪儿绑定」——全局缓存层已经把它解耦了；另一个是「复用是前缀形状的」——可重排的工具集合根本不是前缀。所以下次看到「我们做了 KV 缓存优化」，可以先问一句：你优化的是命中率，还是命中来自哪一层？

## 论文与链接

- SMetric — arXiv:2607.08565
- TOPAS — arXiv:2608.25523
- ReCache — arXiv:2608.19662
]]></description>
      <content:encoded><![CDATA[# 0902 MLSYS 论文简报：agent 把缓存这本账重记了
Audio: 11:18

> 停更三周，回来第一期做一个主题：当请求从人打字变成 agent 自动发起，KV 缓存这本账被重记了。三篇论文正好落在三个尺度上——集群怎么路由、单机留什么、以及缓存的单位到底该是什么。

## 内容时间戳

- 00:00 开场 · 缓存这本账，被 agent 重记了
- 00:28 SMetric（上海交大 / 阿里）· 生产轨迹：92.9% 请求由 agent 发起，复用率 80%+
- 01:43 反直觉的一条 · 全局层配满后，完全不看缓存的调度器只差 7%
- 02:57 只调度每个会话的第一个请求 · 轮次信号是白嫖的，路由器保持无状态
- 03:48 SMetric 的账 · 2% 低端就是全局层满配点；增益只在饱和拐点附近（夯）
- 04:39 TOPAS（中科大 / 合工大）· 前缀常驻 vs 批处理显存，1.8-1.9 倍的差距
- 05:40 联合状态打分 · 收益按任务最长剩余路径的期望缩短量算
- 06:29 TOPAS 的账 · 39.8% 来自合成负载，真实工作流 9.8%；单卡单次无方差（人上人）
- 07:12 ReCache（上海交大 / 宁波东方理工 / 西安交大）· 可重排的工具集合不是前缀
- 07:58 抹掉跨资源注意力 + 位置归零 · 同一个工具永远是同一份 KV
- 08:21 字段消融 · 只留末尾 token 幻觉率 76%；加回工具名幻觉率相对降 97.63%
- 08:54 描述几乎无用，参数怎么填才值钱 · 模型要的是约束不是散文
- 09:31 ReCache 的三笔账 · 要全参微调、未见工具掉 5.5 分、没跑任何缓存复用基线（人上人）
- 10:37 收尾 · 你优化的是命中率，还是命中来自哪一层？

## 本期主讲

**1. SMetric: Rethink LLM Scheduling for Serving Agents with Balanced Session-centric Scheduling**（上海交通大学并行与分布式系统研究所 / 阿里巴巴，arXiv:2607.08565）
先摆生产数据：两条真实商用编码智能体的 trace 里，92.9% 的请求由 agent 自动发起而非人在打字；KV 缓存可复用比例超过 80%，而聊天负载只有 54–62%。目标也随之改变——agent 只在拿到完整回复后才行动，集群总吞吐成了第一目标。于是调度器都在抢缓存亲和，代价是负载不均衡（生产调度器 2.7×、学术基线 3.0×）。最有价值的观察是反直觉的：全局缓存层配满时，完全不看缓存的纯负载均衡调度器吞吐只低 7%，四种策略整体复用率都在 73–75%，差别只在命中层级（本地命中 58% vs 6%）——全局层已经把「复用」和「请求落点」解耦了。另一个数字说明「会话钉死」：缓存亲和下 96.6% 的后续请求回到首轮实例，纯负载均衡下只有 4.0%。方案因此只有一句：只把每个会话的首个请求纯按负载打散，后续照常走缓存亲和；而「这是第几轮」这个信号是白嫖的——接口无状态、每个请求都带完整历史，数消息条数即可，路由器保持完全无状态（他们刻意否决了 session→instance 映射表，因为会话永不显式结束、表会一直长还得 GC）。同机部署吞吐高 10–16%，首字时延中位数 1.1 秒。诚实点：宣传的「预填充吞吐 +2~34%」，2% 低端恰是全局层满配点——全局层越充裕优势越小；完全没有全局存储时与生产调度器差在 1% 以内；增益只集中在饱和拐点附近的窄区间（1.0× 负载差 1%、1.5× 高 15%、1.75× 只高 4%）；trace 未公开、两条只回放一条、采集窗口仅两小时、测试床 32 张卡对上千卡生产集群。评级：夯。

**2. TOPAS: Workflow-Aware Prefix-State Scheduling for Multi-Agent LLM Serving**（中国科学技术大学 / 合肥工业大学，arXiv:2608.25523）
把同一个矛盾下沉到一张卡：agent 的长 system prompt 前缀常驻能省 prefill，但它占走的显存正是留给并发批处理和解码的显存。动机实验朴素也够狠——同一批请求、同样预算，只把服务顺序从两个 agent 交替改成按 agent 分组，平均批大小从 4.7 涨到 9.3，总耗时从 2086 秒掉到 1145 秒。论文里还有一张手算的图：追进度的策略平均完成时间 21.5，而攒同前缀请求、摊薄装载费的策略反而是 24——两种看起来都对的直觉互相打脸。做法是不再逐个请求排序，而是枚举「这一步之后留哪几段前缀、同时能跑哪一批请求」这个联合状态并按秒打分；最值得说的是收益的定义——不按请求自身的服务时间算，而按这个请求做完之后任务最长剩余路径能缩短多少，于是推进一条非瓶颈分支不会被错记成进度。实现于 SGLang v0.5.3。数字：合成工作流 mean/p99 完成时间降 39.8%/49.4%，真实的两个 MetaGPT 工作流分别是 22.0% 和 9.8%。诚实点：39.8% 来自合成负载（固定长度 query + 固定生成长度，把「路径长度可预测」这个最有利条件给足了），真实流水线上是个位数；单张 A100、单实例，到达序列只采样一次、无重复实验、无方差——p99 尾指标在单次实验下尤其不稳；它还假设所有任务遵循同一个已知的工作流图，而核心量「最长剩余路径」正是靠这张图算出来的。评级：人上人。

**3. ReCache: Efficient KV Cache Reuse and Compression for Tool-Augmented LLM Agents**（上海交通大学 / 宁波东方理工大学 / 西安交通大学，arXiv:2608.19662）
前两篇都还认「前缀」，这篇说在 agent 上这个前提已经不成立：agent 按任务检索工具，同一个工具反复出现，但每次的组合不同、顺序也不同；而前缀缓存要求复用内容构成完全相同的前缀，所以换掉一个工具、或同一批换个排列顺序，后面所有工具的 KV 全部作废。改法是抹掉跨资源注意力、把每个工具内部的位置索引归零重排，而周围上下文保留原位置——同一个工具无论排第几、和谁一起被检索，KV 都是同一份，可以离线单独构造、单独复用。消融里有全篇最刺眼的数字：每个工具只留最后一个 token，调用分数掉到 14.8、幻觉率 76%，模型基本在瞎编工具名；仅仅把工具名加回去，幻觉率就相对下降 97.63%。另一个对照更好玩：在工具名和参数名的基础上再加「这个工具是干嘛的」那段描述，分数只从 67.7 动到 67.9，而加「这个参数该怎么填」直接到 72.8——模型要的是约束，不是散文。数字上，只做那一步注意力改造，见过的工具上 82.3 对稠密基线 82.4 基本持平、首字时延快 3.655 倍，完整版显存降 92.43%。诚实点：它不是免训练的，需要全参数微调（作者在 Limitations 自承冻结模型留作未来工作）；「基本持平」的 82.3 只是单独一项且只在训练见过的工具上成立，完整版在见过的工具上掉 2.1 分、在完全没见过的工具上是 60.8 对 66.3、掉 5.5 分——而「没见过的新工具」恰恰是它想解决的场景；表里没有跑任何一个真正的缓存复用基线（前缀缓存、EPIC、CacheBlend、KVLink、KVCOMM 全都只在文献综述里）；3.655 倍那个首字时延定义上排除了离线缓存构造，等于假设 100% 命中。评级：人上人。

## 收尾

三篇在三个尺度上打同一场仗。共同点是 agent 同时拆掉了两个前提：一个是「复用和请求落在哪儿绑定」——全局缓存层已经把它解耦了；另一个是「复用是前缀形状的」——可重排的工具集合根本不是前缀。所以下次看到「我们做了 KV 缓存优化」，可以先问一句：你优化的是命中率，还是命中来自哪一层？

## 论文与链接

- SMetric — arXiv:2607.08565
- TOPAS — arXiv:2608.25523
- ReCache — arXiv:2608.19662
]]></content:encoded>
      <pubDate>Wed, 02 Sep 2026 00:30:00 GMT</pubDate>
      <guid isPermaLink="false">mlsys-feed-2026-09-02</guid>
      <enclosure url="https://github.com/baihuajun24/baihuajun24.github.io/releases/download/audio-archive/0902-daily-arxiv.mp3" length="10850733" type="audio/mpeg" />
      <itunes:duration>11:18</itunes:duration>
      <itunes:explicit>false</itunes:explicit>
    </item>
    <item>
      <title>0810 MLSYS 论文简报：别把上一步的输出当定稿</title>
      <description><![CDATA[# 0810 MLSYS 论文简报：别把上一步的输出当定稿
Audio: 09:33

> 今天三篇干的是同一个动作：回头去改上一阶段已经定死的东西。量化把整数码当定局、记忆把老师的经验原样搬、技能库把检索到的文档直接塞进 prompt——三篇都说，那只是草稿。三篇都评人上人，而且都罕见地诚实。

## 内容时间戳

- 00:00 开场 · 三篇干的是同一个动作
- 00:39 ReQuant（北大 / 港中深 / 中兴）· 量化后回头翻整数码（人上人）
- 03:32 Agent Memory Distillation（KAIST / DeepAuto.ai）· 老师记忆按学生能力重切粒度（人上人）
- 06:23 SkillAligner（浙江大学）· 执行前把检索到的技能重写一遍（人上人）
- 08:28 快速一览 · 碳感知路由 / VLM 看图省 token / 自蒸馏门控
- 09:21 收尾

## 本期主讲

**1. ReQuant: Fixed-Grid Discrete Refinement for Post-Training Quantization**（北京大学 / 香港中文大学深圳 / 中兴，arXiv:2608.07019）
训练后量化流水线产出一份整数分配就停了——权重一旦映到格点，这个离散决策就当最终答案；GPTQ 的贪心逐列扫描里前面的列冻住、只让后面的列补偿。ReQuant 的观察是层重建损失按输出行可分解、行内对量化误差是凸二次，所以把一个坐标挪到相邻格点的损失变化有闭式解，从缓存梯度里 O(1) 可算，于是能做离散坐标下降。它接在任何已完成的 PTQ 输出之后，冻住位宽、scale、zero-point、格点布局、存储格式与推理 kernel，只反复翻整数码，且只接受严格降低重建误差的翻转，并有有限步终止证明——部署侧完全不变。实测弱初始化收益很猛：Llama-3 8B W4A4+QuaRot 下 RTN 十任务均值 53.33→61.94，70B 上 32.78→66.93；W2A4 下 GPTQ 35.88→41.00 且 WikiText-2 困惑度 31.98→15.06。诚实点：真正收益集中在弱初始化，对上已经很强的 GPTAQ 只有 +0.04 到 +0.81 分，低于它自己五个种子的 ±0.55 波动，与噪声分不开（论文自己报了）；离线代价是初始化器的 5–16 倍。评级：人上人。

**2. Agent Memory Distillation: Empowering Small LLM Agents with Hierarchical Teacher Memory**（KAIST / DeepAuto.ai，arXiv:2608.07169）
小模型 agent 成功率低，攒出来的记忆库全是失败轨迹，记忆系统在小模型上基本失效；而把大老师的记忆原样塞给学生也不行——老师写的是"先登录再放歌"这种高层策略，学生根本不会执行登录那一步。洞察是记忆的粒度与表示形式要和学生能力对齐，并做成了消融：子任务记忆用代码 49.40% 对纯自然语言 23.21%，工作流记忆反过来自然语言 49.40% 优于代码 44.05%。老师只从成功轨迹抽三层记忆（工作流 / 子任务 / 函数），前两层开场注入，函数记忆只在工具报错时按函数名反应式检索，全程 k=1、不训练任何参数。Qwen3-4B 在 AppWorld 上 14.88%→49.40%，逼近老师 GPT-5-mini 的 50.00%；五次重复 49.60±0.91；去泄漏划分下仍有 41.07%。诚实点：标题的"蒸馏"轻微夸大——不更新任何参数，是免训练的结构化 prompt 注入（作者正文自述）；收益高度集中在 AppWorld（ToolSandbox 仅 +3.4 个点）；最反直觉的是老师不是越强越好，更强的老师带 4B 学生反而更差。评级：人上人。

**3. SkillAligner: Treating Retrieved Skills as Adaptable Drafts at Execution Time**（浙江大学，arXiv:2608.06880）
先给了一个很值钱的诊断：语义相关不等于执行有用。把 BM25 top-5 技能文档原样注入，会把本来做对的任务翻成失败——九个设定里全部出现这种技能引起的退化，比例 5.80%–17.91%，且换更强的模型不解决。原因是查询、执行接口、以及同时检索到的其它技能三者都在变，所以"这个技能该怎么用"没法提前写死。做法：执行前加一次 LLM 调用，把 top-5 技能连同执行规范（工具、schema、合法动作格式、权限）重写成一份四字段紧凑指南，免训练、与检索器无关。九设定平均 47.07→58.17（九格全胜），退化率 17.91/9.40/10.29→2.24/2.80/3.57。诚实点：38.26% 的净 token 节省是被 SearchQA 拉高的平均值（SearchQA 62.77% vs ALFWorld 26.33%）；指南一次生成后全程冻结，中途不匹配也改不了；退化归因由另一模型打标且未报人工一致性。评级：人上人。

## 快速一览

- Routing LLM Inference to the Cleanest Grid in Real Time（arXiv:2608.06188）· 生产 GPU 路由器上的碳排放项；口径：线上实测仅省 1.45%，约 51% 来自一整年历史回放的建模值。
- A Picture is Worth a Thousand Tokens（arXiv:2608.07427，爱立信）· 电信 KPI 时序渲染成二维图喂 VLM，输入 token 降 3.6–10.4×、实测每查询 GPU 能耗降 1.8–2.5×。
- DASH（arXiv:2608.06243）· 自蒸馏里把每 token 的损失权重改成由散度决定的自适应门控。

## 论文与链接

- ReQuant — arXiv:2608.07019
- Agent Memory Distillation — arXiv:2608.07169
- SkillAligner — arXiv:2608.06880
- Routing LLM Inference to the Cleanest Grid — arXiv:2608.06188
- A Picture is Worth a Thousand Tokens — arXiv:2608.07427
- DASH — arXiv:2608.06243
]]></description>
      <content:encoded><![CDATA[# 0810 MLSYS 论文简报：别把上一步的输出当定稿
Audio: 09:33

> 今天三篇干的是同一个动作：回头去改上一阶段已经定死的东西。量化把整数码当定局、记忆把老师的经验原样搬、技能库把检索到的文档直接塞进 prompt——三篇都说，那只是草稿。三篇都评人上人，而且都罕见地诚实。

## 内容时间戳

- 00:00 开场 · 三篇干的是同一个动作
- 00:39 ReQuant（北大 / 港中深 / 中兴）· 量化后回头翻整数码（人上人）
- 03:32 Agent Memory Distillation（KAIST / DeepAuto.ai）· 老师记忆按学生能力重切粒度（人上人）
- 06:23 SkillAligner（浙江大学）· 执行前把检索到的技能重写一遍（人上人）
- 08:28 快速一览 · 碳感知路由 / VLM 看图省 token / 自蒸馏门控
- 09:21 收尾

## 本期主讲

**1. ReQuant: Fixed-Grid Discrete Refinement for Post-Training Quantization**（北京大学 / 香港中文大学深圳 / 中兴，arXiv:2608.07019）
训练后量化流水线产出一份整数分配就停了——权重一旦映到格点，这个离散决策就当最终答案；GPTQ 的贪心逐列扫描里前面的列冻住、只让后面的列补偿。ReQuant 的观察是层重建损失按输出行可分解、行内对量化误差是凸二次，所以把一个坐标挪到相邻格点的损失变化有闭式解，从缓存梯度里 O(1) 可算，于是能做离散坐标下降。它接在任何已完成的 PTQ 输出之后，冻住位宽、scale、zero-point、格点布局、存储格式与推理 kernel，只反复翻整数码，且只接受严格降低重建误差的翻转，并有有限步终止证明——部署侧完全不变。实测弱初始化收益很猛：Llama-3 8B W4A4+QuaRot 下 RTN 十任务均值 53.33→61.94，70B 上 32.78→66.93；W2A4 下 GPTQ 35.88→41.00 且 WikiText-2 困惑度 31.98→15.06。诚实点：真正收益集中在弱初始化，对上已经很强的 GPTAQ 只有 +0.04 到 +0.81 分，低于它自己五个种子的 ±0.55 波动，与噪声分不开（论文自己报了）；离线代价是初始化器的 5–16 倍。评级：人上人。

**2. Agent Memory Distillation: Empowering Small LLM Agents with Hierarchical Teacher Memory**（KAIST / DeepAuto.ai，arXiv:2608.07169）
小模型 agent 成功率低，攒出来的记忆库全是失败轨迹，记忆系统在小模型上基本失效；而把大老师的记忆原样塞给学生也不行——老师写的是"先登录再放歌"这种高层策略，学生根本不会执行登录那一步。洞察是记忆的粒度与表示形式要和学生能力对齐，并做成了消融：子任务记忆用代码 49.40% 对纯自然语言 23.21%，工作流记忆反过来自然语言 49.40% 优于代码 44.05%。老师只从成功轨迹抽三层记忆（工作流 / 子任务 / 函数），前两层开场注入，函数记忆只在工具报错时按函数名反应式检索，全程 k=1、不训练任何参数。Qwen3-4B 在 AppWorld 上 14.88%→49.40%，逼近老师 GPT-5-mini 的 50.00%；五次重复 49.60±0.91；去泄漏划分下仍有 41.07%。诚实点：标题的"蒸馏"轻微夸大——不更新任何参数，是免训练的结构化 prompt 注入（作者正文自述）；收益高度集中在 AppWorld（ToolSandbox 仅 +3.4 个点）；最反直觉的是老师不是越强越好，更强的老师带 4B 学生反而更差。评级：人上人。

**3. SkillAligner: Treating Retrieved Skills as Adaptable Drafts at Execution Time**（浙江大学，arXiv:2608.06880）
先给了一个很值钱的诊断：语义相关不等于执行有用。把 BM25 top-5 技能文档原样注入，会把本来做对的任务翻成失败——九个设定里全部出现这种技能引起的退化，比例 5.80%–17.91%，且换更强的模型不解决。原因是查询、执行接口、以及同时检索到的其它技能三者都在变，所以"这个技能该怎么用"没法提前写死。做法：执行前加一次 LLM 调用，把 top-5 技能连同执行规范（工具、schema、合法动作格式、权限）重写成一份四字段紧凑指南，免训练、与检索器无关。九设定平均 47.07→58.17（九格全胜），退化率 17.91/9.40/10.29→2.24/2.80/3.57。诚实点：38.26% 的净 token 节省是被 SearchQA 拉高的平均值（SearchQA 62.77% vs ALFWorld 26.33%）；指南一次生成后全程冻结，中途不匹配也改不了；退化归因由另一模型打标且未报人工一致性。评级：人上人。

## 快速一览

- Routing LLM Inference to the Cleanest Grid in Real Time（arXiv:2608.06188）· 生产 GPU 路由器上的碳排放项；口径：线上实测仅省 1.45%，约 51% 来自一整年历史回放的建模值。
- A Picture is Worth a Thousand Tokens（arXiv:2608.07427，爱立信）· 电信 KPI 时序渲染成二维图喂 VLM，输入 token 降 3.6–10.4×、实测每查询 GPU 能耗降 1.8–2.5×。
- DASH（arXiv:2608.06243）· 自蒸馏里把每 token 的损失权重改成由散度决定的自适应门控。

## 论文与链接

- ReQuant — arXiv:2608.07019
- Agent Memory Distillation — arXiv:2608.07169
- SkillAligner — arXiv:2608.06880
- Routing LLM Inference to the Cleanest Grid — arXiv:2608.06188
- A Picture is Worth a Thousand Tokens — arXiv:2608.07427
- DASH — arXiv:2608.06243
]]></content:encoded>
      <pubDate>Mon, 10 Aug 2026 00:30:00 GMT</pubDate>
      <guid isPermaLink="false">mlsys-feed-2026-08-10</guid>
      <enclosure url="https://github.com/baihuajun24/baihuajun24.github.io/releases/download/audio-archive/0810-daily-arxiv.mp3" length="9174573" type="audio/mpeg" />
      <itunes:duration>09:33</itunes:duration>
      <itunes:explicit>false</itunes:explicit>
    </item>
    <item>
      <title>0807 MLSYS 论文简报：你以为的路由收益，可能只是重跑噪声</title>
      <description><![CDATA[# 0807 MLSYS 论文简报：你以为的路由收益，可能只是重跑噪声
Audio: 09:31

> 今天换个打法：只深讲两篇，快速轮加长到四篇——今天这批真正过线的就两篇。两篇共用一句话：先量对东西，再谈优化。均评人上人。

## 内容时间戳

- 00:00 开场 · 今天为什么只深讲两篇
- 00:46 SAKI（Cotality）· KV 索引该优化打分失真而不是重建 key（人上人）
- 04:59 路由不可学（伦敦大学学院 / Holistic AI）· 收益大半是重跑噪声（人上人）
- 08:12 快速一览 · 技能召回 / 切分推理 / 突发流量调度 / anytime-valid 评测
- 09:18 收尾

## 本期主讲

**1. SAKI: Score-Aware Low-Rank Key Indexing with Random-Matrix Noise Correction for KV Retrieval**（Cotality，arXiv:2608.03228）
长上下文解码已经变成检索问题：8B 模型百万 token 的 bf16 KV cache 约 130 GB，真实系统先用 rank-r 的 key 索引粗选、再取精确 value。现有两类做法（截断权重矩阵、或在激活分布下重建缓存张量）优化的都不是 attention 真正使用的量——attention 用的是 q 点乘 k 的打分排序，不是 key 的重建误差。把"key 侧低秩压缩造成的期望打分失真"直接求期望，得到一个双边协方差加权的低秩逼近，打分算子被 query 与 key 的真实统计量从两侧夹住。关键结论：rank-r 最优解不是投影器，而是不对称的低秩双线性映射；正交投影器只是 rank-r 映射类的严格子集，所以所有 span-based 方法（含 PCA）在原理上就表达不了它。落地只需每 head 一次校准前向 + 一次 128x128 SVD，两个因子可离线折进权重。实测（LLaMA-3.1-8B 全 1024 head，4096 上下文）top-64 召回中位数 r=32 时 0.799 对 PCA 0.748、r=64 时 0.876 对 0.833；跨四个模型无一格子输给 PCA；校准效率约 8 倍。最漂亮的是理论预测与实测的 per-head 打分 MSE 下降跨 1024 head 的 Pearson r = 0.9969。诚实点：正文两处明说尚未投稿；只有 recall 代理指标，4K 上下文、单一校准域，无端到端质量，全文无任何延迟/显存/吞吐指标。评级：人上人。

**2. Routing Is Least Learnable Where It Is Most Valuable: Bounds on Representation Routing for Web Agents**（伦敦大学学院 / Holistic AI，arXiv:2608.06171）
一个负结果。web agent 要操作网页得先"看见"页面——可访问性树（文本）、截图（像素）、或两者融合的标注图；今天这个选择建站时定一次、之后不变。7686 次评分 episode、36 个条件后，表面收益诱人：六模态 oracle 成功率 7.1–51.9%，最好单模态只有 2.2–35.6%。但两刀砍下来：其一，先给"重跑一次"定价——同一条件重跑就有 12.1–14.3% 的任务结果翻转，而真加一个不同模态只多买 +1.97 到 +7 个点，大 oracle 收益大半是六臂并集比一臂基线的虚高。其二，路由标签只在"有东西成功了"的地方存在，每 cell 六类合计仅 15–97 个标签，按每类最少十行筛，6 个 cell 里 4 个训不出分类器——agent 成功率越低标签越稀缺，于是路由最该帮忙处恰恰最没监督。唯一活下来的正收益是离线重组：保留最好模态、只把从没解出的任务丢给最便宜的臂，8 个 cell 全部省 9.5–30.6% 成本且成功率不变。论文还公开撤回了自己五条早先写死的结论。诚实点：成功率仅 2–36%，仪器分辨率与效应量相当；重跑波动带只在 2 个 cell 实测、外推到另外 6 个；作者自述该结论标记当下能力水位并预测自身会被推翻。评级：人上人。

## 快速一览

- Comparative Approaches to Agent Retrieval over Large Skill Libraries（arXiv:2608.06196）· 大技能库里怎么召回技能，正好接上前一期那篇 Wix 的确定性门：一个管召回、一个管拦截。
- RAC: Reference-Aware Activation Compression（arXiv:2608.04991）· 端云切分推理的边界激活压缩编解码。
- LLM Inference Under Bursty Workload Distribution（arXiv:2608.06135）· 把排队论调度里需预知的到达率换成在线估计；注意全程为模拟环境，正文未给出吞吐与时延数字。
- AV-AIVAT（arXiv:2608.06362）· anytime-valid 停机让 agent 评测"证据够了就停"；标题的 74 倍来自其引用方法 2018 年对弱基线的方差削减，该文自身证明的是 54 倍方差削减仅换 1.37 倍更早停机。

## 论文与链接

- SAKI — arXiv:2608.03228
- Routing Is Least Learnable Where It Is Most Valuable — arXiv:2608.06171
- Comparative Approaches to Agent Retrieval over Large Skill Libraries — arXiv:2608.06196
- RAC — arXiv:2608.04991
- LLM Inference Under Bursty Workload Distribution — arXiv:2608.06135
- AV-AIVAT — arXiv:2608.06362
]]></description>
      <content:encoded><![CDATA[# 0807 MLSYS 论文简报：你以为的路由收益，可能只是重跑噪声
Audio: 09:31

> 今天换个打法：只深讲两篇，快速轮加长到四篇——今天这批真正过线的就两篇。两篇共用一句话：先量对东西，再谈优化。均评人上人。

## 内容时间戳

- 00:00 开场 · 今天为什么只深讲两篇
- 00:46 SAKI（Cotality）· KV 索引该优化打分失真而不是重建 key（人上人）
- 04:59 路由不可学（伦敦大学学院 / Holistic AI）· 收益大半是重跑噪声（人上人）
- 08:12 快速一览 · 技能召回 / 切分推理 / 突发流量调度 / anytime-valid 评测
- 09:18 收尾

## 本期主讲

**1. SAKI: Score-Aware Low-Rank Key Indexing with Random-Matrix Noise Correction for KV Retrieval**（Cotality，arXiv:2608.03228）
长上下文解码已经变成检索问题：8B 模型百万 token 的 bf16 KV cache 约 130 GB，真实系统先用 rank-r 的 key 索引粗选、再取精确 value。现有两类做法（截断权重矩阵、或在激活分布下重建缓存张量）优化的都不是 attention 真正使用的量——attention 用的是 q 点乘 k 的打分排序，不是 key 的重建误差。把"key 侧低秩压缩造成的期望打分失真"直接求期望，得到一个双边协方差加权的低秩逼近，打分算子被 query 与 key 的真实统计量从两侧夹住。关键结论：rank-r 最优解不是投影器，而是不对称的低秩双线性映射；正交投影器只是 rank-r 映射类的严格子集，所以所有 span-based 方法（含 PCA）在原理上就表达不了它。落地只需每 head 一次校准前向 + 一次 128x128 SVD，两个因子可离线折进权重。实测（LLaMA-3.1-8B 全 1024 head，4096 上下文）top-64 召回中位数 r=32 时 0.799 对 PCA 0.748、r=64 时 0.876 对 0.833；跨四个模型无一格子输给 PCA；校准效率约 8 倍。最漂亮的是理论预测与实测的 per-head 打分 MSE 下降跨 1024 head 的 Pearson r = 0.9969。诚实点：正文两处明说尚未投稿；只有 recall 代理指标，4K 上下文、单一校准域，无端到端质量，全文无任何延迟/显存/吞吐指标。评级：人上人。

**2. Routing Is Least Learnable Where It Is Most Valuable: Bounds on Representation Routing for Web Agents**（伦敦大学学院 / Holistic AI，arXiv:2608.06171）
一个负结果。web agent 要操作网页得先"看见"页面——可访问性树（文本）、截图（像素）、或两者融合的标注图；今天这个选择建站时定一次、之后不变。7686 次评分 episode、36 个条件后，表面收益诱人：六模态 oracle 成功率 7.1–51.9%，最好单模态只有 2.2–35.6%。但两刀砍下来：其一，先给"重跑一次"定价——同一条件重跑就有 12.1–14.3% 的任务结果翻转，而真加一个不同模态只多买 +1.97 到 +7 个点，大 oracle 收益大半是六臂并集比一臂基线的虚高。其二，路由标签只在"有东西成功了"的地方存在，每 cell 六类合计仅 15–97 个标签，按每类最少十行筛，6 个 cell 里 4 个训不出分类器——agent 成功率越低标签越稀缺，于是路由最该帮忙处恰恰最没监督。唯一活下来的正收益是离线重组：保留最好模态、只把从没解出的任务丢给最便宜的臂，8 个 cell 全部省 9.5–30.6% 成本且成功率不变。论文还公开撤回了自己五条早先写死的结论。诚实点：成功率仅 2–36%，仪器分辨率与效应量相当；重跑波动带只在 2 个 cell 实测、外推到另外 6 个；作者自述该结论标记当下能力水位并预测自身会被推翻。评级：人上人。

## 快速一览

- Comparative Approaches to Agent Retrieval over Large Skill Libraries（arXiv:2608.06196）· 大技能库里怎么召回技能，正好接上前一期那篇 Wix 的确定性门：一个管召回、一个管拦截。
- RAC: Reference-Aware Activation Compression（arXiv:2608.04991）· 端云切分推理的边界激活压缩编解码。
- LLM Inference Under Bursty Workload Distribution（arXiv:2608.06135）· 把排队论调度里需预知的到达率换成在线估计；注意全程为模拟环境，正文未给出吞吐与时延数字。
- AV-AIVAT（arXiv:2608.06362）· anytime-valid 停机让 agent 评测"证据够了就停"；标题的 74 倍来自其引用方法 2018 年对弱基线的方差削减，该文自身证明的是 54 倍方差削减仅换 1.37 倍更早停机。

## 论文与链接

- SAKI — arXiv:2608.03228
- Routing Is Least Learnable Where It Is Most Valuable — arXiv:2608.06171
- Comparative Approaches to Agent Retrieval over Large Skill Libraries — arXiv:2608.06196
- RAC — arXiv:2608.04991
- LLM Inference Under Bursty Workload Distribution — arXiv:2608.06135
- AV-AIVAT — arXiv:2608.06362
]]></content:encoded>
      <pubDate>Fri, 07 Aug 2026 00:30:00 GMT</pubDate>
      <guid isPermaLink="false">mlsys-feed-2026-08-07</guid>
      <enclosure url="https://github.com/baihuajun24/baihuajun24.github.io/releases/download/audio-archive/0807-daily-arxiv.mp3" length="9133101" type="audio/mpeg" />
      <itunes:duration>09:31</itunes:duration>
      <itunes:explicit>false</itunes:explicit>
    </item>
    <item>
      <title>0806 MLSYS 论文简报：AsymSpec 让云边投机解码不再堵上行</title>
      <description><![CDATA[# 0806 MLSYS 论文简报：AsymSpec 让云边投机解码不再堵上行
Audio: 10:58

> 今天三篇有同一条线索：把决定权交给最便宜的那一层，贵的大模型只负责剩下的。评级 夯 / 夯 / 人上人。

## 内容时间戳

- 00:00 开场 · 把决定权交给最便宜的那一层
- 00:38 AsymSpec（天津大学）· 非对称链路上的云边投机解码（夯）
- 04:22 ReCo（港科大 / 西安交大 / 北大）· 一个过程奖励同时管 KV 与停机（夯）
- 07:37 Wix 技能门 · 进上下文之前的确定性拦截（人上人）
- 09:59 快速一览 · 证据忠实度 / agent 失效检测
- 10:44 收尾

## 本期主讲

**1. AsymSpec: Efficient Cloud-Edge Speculative Decoding over Asymmetric Networks**（天津大学，arXiv:2608.04974）
云边投机解码里草稿模型在边缘、目标模型在云上，每个投机块都要过一次上行云端才能验证。老办法上传整个词表大小的草稿分布、回复却只有几十字节，上下行消息量差 16032–18992×（解析测算）；实测通信+等待占端到端时延 85% 以上。洞察是接受与纠正的频率、信息量完全不同，正好映射非对称链路两个方向：上行只传 token 加草稿概率，完整分布留在边缘当可查状态；纠正走更宽的下行。保真度不看 top-K 覆盖率，而是给残差分布本身推全变差上界当证书，不够就单调扩 K，再不够退回拒绝采样精确恢复；调度上每请求最多一个未决块，等待时切到另一个已确定前缀的请求。实测 18 个操作点全部最高吞吐，比最强基线 2.82–28.03×、几何平均 7.96×；强网到弱网基线掉 71.4–78.6%，它反涨 1.9%。诚实点：网络为 tc/NetEm 模拟、原型是两个 Python 服务、边缘用消费级显卡而非真网关；28.03× 上限由弱网下基线崩塌驱动，几何平均才是可比数；纠正是全变差预算内而非逐比特精确。评级：夯。

**2. Fewer Tokens, Smaller Cache: Reward-Coordinated Efficient Reasoning**（港科大 / 西安交大 / 北大，arXiv:2608.04771）
先测出一笔被忽略的账单——固定压缩率下模型反而吐更多 token：25% 压缩率时某主流方法把 MATH-500 平均生成长度 3268.7 拉到 4538.1（+38.8%），另一个 8B 模型 4409.8 拉到 7891.7（+79.0%），最高 79.8% 的题目比满 cache 还长。以往压缩对整条轨迹一视同仁、且只按"删了什么"评价。ReCo 用一个 30M 过程奖励给每步打分，一个信号同时决定该步 KV 保留、惩罚反思 token、触发提前停机（对照：从高奖励步删 70% 比同预算随机步删，准确率高 3.5–6 分）。实测 token 少 37%/65%/46%，单卡 H20 墙钟 2.08/2.35/2.18×，峰值显存 28.78 降到 17.92 GB（−37.7%），自身开销合计不到 4%。诚实点：准确率不是持平而是"掉得最少"，比满 CoT 低 1.9–2.7 分（AIME25 33.3% 对 40.0%）；只在 7–8B 蒸馏模型、数学与理科问答、单卡上验证。评级：夯。

**3. Don't Offer What Can't Be Done: Deterministic Executability Gating for LLM Skill Selection at Scale**（Wix，arXiv:2608.01050）
技能库一大，语义相关就不够用了——技能可能话题对得上却在当前账号状态下不可执行。招法：每个技能内部本就写着退出条件，把这些谓词反过来，在技能描述进入模型上下文之前就地评估；门与技能共用谓词，拦截在构造上可靠。生产实测（一个月、一个十技能域族）：756641 条消息、267612 个会话；门砍掉 59.4% 的技能-消息对与 2.288 亿 token，语义加门合计把技能描述上下文砍掉 90.5%，平均每条消息从 10 个技能里拿掉 5.94 个。反事实回放：全暴露十技能时模型在 1000 个会话里有 78 个（7.8%）选中生产已拦截的技能。诚实点：单公司单技能族一个月窗口、无跨产品泛化证据；7.8% 来自专门构造的高风险队列、只回放一次、无方差；脚注自报投稿 KDD 2027 应用赛道且在审——在审不等于录用。评级：人上人。

## 快速一览

- Does Accuracy Equal Evidence? Reasoning Faithfulness under KV Cache Compression（arXiv:2608.01631）· KV 压缩可保住最终答案正确率，却毁掉推理链的证据支撑。
- Real-Time Detection and Repair of LLM Agent Failures（arXiv:2608.02464）· 用微秒级遥测监控替掉每步一次的 LLM 裁判，再闭环成回滚与修复。

## 论文与链接

- AsymSpec — arXiv:2608.04974
- Fewer Tokens, Smaller Cache (ReCo) — arXiv:2608.04771
- Don't Offer What Can't Be Done — arXiv:2608.01050
- Does Accuracy Equal Evidence? — arXiv:2608.01631
- Real-Time Detection and Repair of LLM Agent Failures — arXiv:2608.02464
]]></description>
      <content:encoded><![CDATA[# 0806 MLSYS 论文简报：AsymSpec 让云边投机解码不再堵上行
Audio: 10:58

> 今天三篇有同一条线索：把决定权交给最便宜的那一层，贵的大模型只负责剩下的。评级 夯 / 夯 / 人上人。

## 内容时间戳

- 00:00 开场 · 把决定权交给最便宜的那一层
- 00:38 AsymSpec（天津大学）· 非对称链路上的云边投机解码（夯）
- 04:22 ReCo（港科大 / 西安交大 / 北大）· 一个过程奖励同时管 KV 与停机（夯）
- 07:37 Wix 技能门 · 进上下文之前的确定性拦截（人上人）
- 09:59 快速一览 · 证据忠实度 / agent 失效检测
- 10:44 收尾

## 本期主讲

**1. AsymSpec: Efficient Cloud-Edge Speculative Decoding over Asymmetric Networks**（天津大学，arXiv:2608.04974）
云边投机解码里草稿模型在边缘、目标模型在云上，每个投机块都要过一次上行云端才能验证。老办法上传整个词表大小的草稿分布、回复却只有几十字节，上下行消息量差 16032–18992×（解析测算）；实测通信+等待占端到端时延 85% 以上。洞察是接受与纠正的频率、信息量完全不同，正好映射非对称链路两个方向：上行只传 token 加草稿概率，完整分布留在边缘当可查状态；纠正走更宽的下行。保真度不看 top-K 覆盖率，而是给残差分布本身推全变差上界当证书，不够就单调扩 K，再不够退回拒绝采样精确恢复；调度上每请求最多一个未决块，等待时切到另一个已确定前缀的请求。实测 18 个操作点全部最高吞吐，比最强基线 2.82–28.03×、几何平均 7.96×；强网到弱网基线掉 71.4–78.6%，它反涨 1.9%。诚实点：网络为 tc/NetEm 模拟、原型是两个 Python 服务、边缘用消费级显卡而非真网关；28.03× 上限由弱网下基线崩塌驱动，几何平均才是可比数；纠正是全变差预算内而非逐比特精确。评级：夯。

**2. Fewer Tokens, Smaller Cache: Reward-Coordinated Efficient Reasoning**（港科大 / 西安交大 / 北大，arXiv:2608.04771）
先测出一笔被忽略的账单——固定压缩率下模型反而吐更多 token：25% 压缩率时某主流方法把 MATH-500 平均生成长度 3268.7 拉到 4538.1（+38.8%），另一个 8B 模型 4409.8 拉到 7891.7（+79.0%），最高 79.8% 的题目比满 cache 还长。以往压缩对整条轨迹一视同仁、且只按"删了什么"评价。ReCo 用一个 30M 过程奖励给每步打分，一个信号同时决定该步 KV 保留、惩罚反思 token、触发提前停机（对照：从高奖励步删 70% 比同预算随机步删，准确率高 3.5–6 分）。实测 token 少 37%/65%/46%，单卡 H20 墙钟 2.08/2.35/2.18×，峰值显存 28.78 降到 17.92 GB（−37.7%），自身开销合计不到 4%。诚实点：准确率不是持平而是"掉得最少"，比满 CoT 低 1.9–2.7 分（AIME25 33.3% 对 40.0%）；只在 7–8B 蒸馏模型、数学与理科问答、单卡上验证。评级：夯。

**3. Don't Offer What Can't Be Done: Deterministic Executability Gating for LLM Skill Selection at Scale**（Wix，arXiv:2608.01050）
技能库一大，语义相关就不够用了——技能可能话题对得上却在当前账号状态下不可执行。招法：每个技能内部本就写着退出条件，把这些谓词反过来，在技能描述进入模型上下文之前就地评估；门与技能共用谓词，拦截在构造上可靠。生产实测（一个月、一个十技能域族）：756641 条消息、267612 个会话；门砍掉 59.4% 的技能-消息对与 2.288 亿 token，语义加门合计把技能描述上下文砍掉 90.5%，平均每条消息从 10 个技能里拿掉 5.94 个。反事实回放：全暴露十技能时模型在 1000 个会话里有 78 个（7.8%）选中生产已拦截的技能。诚实点：单公司单技能族一个月窗口、无跨产品泛化证据；7.8% 来自专门构造的高风险队列、只回放一次、无方差；脚注自报投稿 KDD 2027 应用赛道且在审——在审不等于录用。评级：人上人。

## 快速一览

- Does Accuracy Equal Evidence? Reasoning Faithfulness under KV Cache Compression（arXiv:2608.01631）· KV 压缩可保住最终答案正确率，却毁掉推理链的证据支撑。
- Real-Time Detection and Repair of LLM Agent Failures（arXiv:2608.02464）· 用微秒级遥测监控替掉每步一次的 LLM 裁判，再闭环成回滚与修复。

## 论文与链接

- AsymSpec — arXiv:2608.04974
- Fewer Tokens, Smaller Cache (ReCo) — arXiv:2608.04771
- Don't Offer What Can't Be Done — arXiv:2608.01050
- Does Accuracy Equal Evidence? — arXiv:2608.01631
- Real-Time Detection and Repair of LLM Agent Failures — arXiv:2608.02464
]]></content:encoded>
      <pubDate>Thu, 06 Aug 2026 00:30:00 GMT</pubDate>
      <guid isPermaLink="false">mlsys-feed-2026-08-06</guid>
      <enclosure url="https://github.com/baihuajun24/baihuajun24.github.io/releases/download/audio-archive/0806-daily-arxiv.mp3" length="10528557" type="audio/mpeg" />
      <itunes:duration>10:58</itunes:duration>
      <itunes:explicit>false</itunes:explicit>
    </item>
    <item>
      <title>0804 MLSYS 论文简报：Bole 让混合注意力也能玩树投机</title>
      <description><![CDATA[# 0804 MLSYS 论文简报：Bole 让混合注意力也能玩树投机
Audio: 08:57

> 长上下文和长交互要付三笔账：解码要一步步走、KV cache 占显存、agent 历史越堆越长。今天三篇各治一笔，且都评顶级。

## 内容时间戳

- 00:00 开场 · 长上下文的三笔账
- 00:37 Bole（南京大学 / 蚂蚁集团）· 混合注意力的树投机
- 03:38 RestoreKV（釜山大学）· KV 驱逐后用 LoRA 复原
- 06:11 Context Compaction Theory（波士顿大学 / 哈佛等）· 上下文压缩的理论极限
- 07:52 快速一览 · LaCache / RING
- 08:42 收尾

## 本期主讲

**1. Bole: Efficient Tree Speculation for Hybrid-Attention Language Models**（南京大学 / 蚂蚁集团，arXiv:2608.01651）
混合注意力（全注意力交替线性注意力）解码时是显存带宽瓶颈，投机解码本该救，但现有树投机都绕全注意力 KV 设计——碰到线性注意力那条递归就得逐分支算、还给每个树节点存整份状态，验证延迟与显存都爆炸。Bole 证明门控线性注意力在候选树上有精确闭式解（祖先作用矩阵严格下三角且深度有限幂零 → 逆等于有限次多项式），于是从一个进树前的不变状态一次性并行算完，分支更新压成 token 尺度小因子、只在采样后重建接受的那条、全程不拍快照。做进 SGLang（六千多行）：线性注意力树验证快 3.4–7.7×、瞬时状态显存降 82–99×、端到端解码吞吐最高是自回归的 4.72×（比最强树投机基线 2.03×）、首/每 token 延迟最多砍 67.6%/49.9%、几何平均 2.74×。诚实点：仅在 Qwen3.5 系列 + 自带 MTP 草稿头上验证，闭式解专为门控 delta 递归推导。评级：顶级。

**2. RestoreKV: Recovering Full-Cache Behavior Under Aggressive Query-Agnostic KV Eviction**（釜山大学 / 淑明女大，arXiv:2608.01247）
查询无关 KV 驱逐（先压一次、任意查询复用）预算紧了就断崖，而以往方法都在抠"该留哪些原始 KV 对"，压出来永远是原始缓存的子集。RestoreKV 换思路：拿出总预算里一小块放 8 个可学习复原 token，在驱逐前用一个 LoRA 适配器让它们一次性看完整缓存、把丢失信息压成一小份补回来，总预算不超；LoRA 只在复原那一下开、解码全程关。极紧预算下 RULER 强基线 38.2→73.2，等预算 60 设定改善 59 个，开销 <0.5%、显存 +0.4%，4B 两小时只调 0.4% 参数。诚实点：名字说大了（离满 cache 九十多仍差）、增益集中在极紧预算、需按模型与驱逐法各训一个适配器，但消融把增益来源与位置编码混淆都控住了。评级：顶级。

**3. Context Compaction Theory**（波士顿大学 / 哈佛 / 纽约城市学院等，arXiv:2608.01326）
agent 跑久了历史会爆，现在都靠上下文压缩续命，但没人说得清极限。这篇把它建成两方游戏，证明"生成式压缩"等价于通讯复杂度里的单向通讯——几十年的下界直接搬过来告诉你某类任务的压缩预算下限；还证明生成式可以严格比"挑选式"更省。案例研究拿一个前沿模型的上下文压缩接口做集合成员查询，发现压缩后基本是瞎猜水平，说明现实离理论还很远。不刷榜，但第一次把一个人人在用、却没人架理论的东西架上了理论，并打了个诚实的样。评级：顶级。

## 快速一览

- LaCache: Robust Semantic Caching for LLM Serving（arXiv:2608.01718）· 给 LLM 服务做语义缓存，额外核对投机解码前几个 token 是否命中来防缓存碰撞攻击。
- RING: Retrieval-Internalized Generation（arXiv:2608.01630）· 把大规模外部知识灌进一组记忆专家，学一个在内部记忆上做路由与检索的策略，把外部检索内化。

## 论文与链接

- Bole — arXiv:2608.01651
- RestoreKV — arXiv:2608.01247
- Context Compaction Theory — arXiv:2608.01326
- LaCache — arXiv:2608.01718
- RING — arXiv:2608.01630

## 制作元信息

- 检索：watermark 补至 08-04 批次（当日批次约 11:38 BJT 落地后开跑），663 检索 / 506 候选 → Claude-as-judge（8 子代理，按更新后的兴趣：模型路由 / 大小模型协同 / 高效推理）判 60 → 7 入选。
- 三篇主讲全文 PDF 出卡定级（评级冻结），均顶级。
- 音频：本地合成（mlx-audio Qwen3-TTS-12Hz-1.7B-CustomVoice），双主持 Jeff（uncle_fu）/ Ada（serena），1.0x。
- 口径：各篇加速/分数为论文自报、口径不同不可横比；Bole 仅 Qwen3.5 + 自带草稿头验证；RestoreKV 增益集中于极紧预算；Context Compaction 接口测试为论文自身案例。
]]></description>
      <pubDate>Tue, 04 Aug 2026 00:30:00 GMT</pubDate>
      <guid isPermaLink="false">mlsys-feed-2026-08-04</guid>
      <enclosure url="https://github.com/baihuajun24/baihuajun24.github.io/releases/download/audio-archive/0804-daily-arxiv.mp3" length="8598957" type="audio/mpeg" />
      <itunes:duration>08:57</itunes:duration>
      <content:encoded><![CDATA[# 0804 MLSYS 论文简报：Bole 让混合注意力也能玩树投机
Audio: 08:57

> 长上下文和长交互要付三笔账：解码要一步步走、KV cache 占显存、agent 历史越堆越长。今天三篇各治一笔，且都评顶级。

## 内容时间戳

- 00:00 开场 · 长上下文的三笔账
- 00:37 Bole（南京大学 / 蚂蚁集团）· 混合注意力的树投机
- 03:38 RestoreKV（釜山大学）· KV 驱逐后用 LoRA 复原
- 06:11 Context Compaction Theory（波士顿大学 / 哈佛等）· 上下文压缩的理论极限
- 07:52 快速一览 · LaCache / RING
- 08:42 收尾

## 本期主讲

**1. Bole: Efficient Tree Speculation for Hybrid-Attention Language Models**（南京大学 / 蚂蚁集团，arXiv:2608.01651）
混合注意力（全注意力交替线性注意力）解码时是显存带宽瓶颈，投机解码本该救，但现有树投机都绕全注意力 KV 设计——碰到线性注意力那条递归就得逐分支算、还给每个树节点存整份状态，验证延迟与显存都爆炸。Bole 证明门控线性注意力在候选树上有精确闭式解（祖先作用矩阵严格下三角且深度有限幂零 → 逆等于有限次多项式），于是从一个进树前的不变状态一次性并行算完，分支更新压成 token 尺度小因子、只在采样后重建接受的那条、全程不拍快照。做进 SGLang（六千多行）：线性注意力树验证快 3.4–7.7×、瞬时状态显存降 82–99×、端到端解码吞吐最高是自回归的 4.72×（比最强树投机基线 2.03×）、首/每 token 延迟最多砍 67.6%/49.9%、几何平均 2.74×。诚实点：仅在 Qwen3.5 系列 + 自带 MTP 草稿头上验证，闭式解专为门控 delta 递归推导。评级：顶级。

**2. RestoreKV: Recovering Full-Cache Behavior Under Aggressive Query-Agnostic KV Eviction**（釜山大学 / 淑明女大，arXiv:2608.01247）
查询无关 KV 驱逐（先压一次、任意查询复用）预算紧了就断崖，而以往方法都在抠"该留哪些原始 KV 对"，压出来永远是原始缓存的子集。RestoreKV 换思路：拿出总预算里一小块放 8 个可学习复原 token，在驱逐前用一个 LoRA 适配器让它们一次性看完整缓存、把丢失信息压成一小份补回来，总预算不超；LoRA 只在复原那一下开、解码全程关。极紧预算下 RULER 强基线 38.2→73.2，等预算 60 设定改善 59 个，开销 <0.5%、显存 +0.4%，4B 两小时只调 0.4% 参数。诚实点：名字说大了（离满 cache 九十多仍差）、增益集中在极紧预算、需按模型与驱逐法各训一个适配器，但消融把增益来源与位置编码混淆都控住了。评级：顶级。

**3. Context Compaction Theory**（波士顿大学 / 哈佛 / 纽约城市学院等，arXiv:2608.01326）
agent 跑久了历史会爆，现在都靠上下文压缩续命，但没人说得清极限。这篇把它建成两方游戏，证明"生成式压缩"等价于通讯复杂度里的单向通讯——几十年的下界直接搬过来告诉你某类任务的压缩预算下限；还证明生成式可以严格比"挑选式"更省。案例研究拿一个前沿模型的上下文压缩接口做集合成员查询，发现压缩后基本是瞎猜水平，说明现实离理论还很远。不刷榜，但第一次把一个人人在用、却没人架理论的东西架上了理论，并打了个诚实的样。评级：顶级。

## 快速一览

- LaCache: Robust Semantic Caching for LLM Serving（arXiv:2608.01718）· 给 LLM 服务做语义缓存，额外核对投机解码前几个 token 是否命中来防缓存碰撞攻击。
- RING: Retrieval-Internalized Generation（arXiv:2608.01630）· 把大规模外部知识灌进一组记忆专家，学一个在内部记忆上做路由与检索的策略，把外部检索内化。

## 论文与链接

- Bole — arXiv:2608.01651
- RestoreKV — arXiv:2608.01247
- Context Compaction Theory — arXiv:2608.01326
- LaCache — arXiv:2608.01718
- RING — arXiv:2608.01630

## 制作元信息

- 检索：watermark 补至 08-04 批次（当日批次约 11:38 BJT 落地后开跑），663 检索 / 506 候选 → Claude-as-judge（8 子代理，按更新后的兴趣：模型路由 / 大小模型协同 / 高效推理）判 60 → 7 入选。
- 三篇主讲全文 PDF 出卡定级（评级冻结），均顶级。
- 音频：本地合成（mlx-audio Qwen3-TTS-12Hz-1.7B-CustomVoice），双主持 Jeff（uncle_fu）/ Ada（serena），1.0x。
- 口径：各篇加速/分数为论文自报、口径不同不可横比；Bole 仅 Qwen3.5 + 自带草稿头验证；RestoreKV 增益集中于极紧预算；Context Compaction 接口测试为论文自身案例。
]]></content:encoded>
    </item>
    <item>
      <title>0803 MLSYS 论文简报：给推理省钱的三个层面</title>
      <description><![CDATA[# 0803 MLSYS 论文简报：给推理省钱的三个层面
Audio: 08:42

> 给大模型推理省钱，可以从三个层面下手：少解码几步、每个 token 少算一点、把 KV cache 里没用的早点扔掉。今天三篇正好各占一个层面，都训练无关、都有真实加速。

## 内容时间戳

- 00:00 开场 · 给推理省钱的三个层面
- 00:46 SparseSpec-L（中国科学技术大学）· 自投机解码，草稿用可召回稀疏 KV
- 02:36 WIDE（东方理工 / 慕尼黑 LMU）· token 级动态宽度剪枝 + 算子协同
- 05:16 Back from the Future · 逆因果惊奇度做 KV 驱逐
- 08:12 快速一览 · ReTopK / ARES
- 08:39 收尾

## 本期主讲

**1. WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning**（东方理工 / 慕尼黑 LMU，arXiv:2607.28418）
结构化剪枝的老毛病：静态剪枝对所有输入一刀切、砍狠了精度掉；动态剪枝又只会粗粒度地跳整层、跳子模块，不规则执行在硬件上跑不出真加速。WIDE 把动态路由从"跳整层"下推到 token 级的宽度——每个 token 自选注意力头组与前馈通道组——再配一个 GPU 算子协同设计：把每个 token 稀疏的掩码重排成连续块，让细粒度稀疏也保持稠密式高效访存，不用物化 token 专属权重。50% 稀疏下精度保住八成六到八成八，比只会跳层的动态基线最高高出二十多个点；算子层面预填充最高 1.98×、解码 4.95×，端到端预填充 1.68×、解码 1.55×。学出来的稀疏注意力砍到 66%、前馈只砍 28%。诚实点：只在两个 Llama 模型上验证，端到端 ~1.6× 远低于算子上限，50% 稀疏绝对精度仍掉约 13 点。评级：顶级。

**2. A Sparse Glimpse of the Whole: Train-Free Self-Speculative Decoding (SparseSpec-L)**（中国科学技术大学，arXiv:2607.27735）
投机解码要草稿便宜、接受率高、还能一次猜够长，三者常顾此失彼：训练小草稿泛化差，静态压 KV 又永久丢上下文、长文接受率崩。SparseSpec-L 让目标模型自己当草稿，用一份"可召回"的稀疏 KV——重要性分数从上一次全量验证的注意力统计里免费回收，稠密 KV 一个不扔、只在起草时用稀疏视图，目标分布不变；再用熵控制器在线选投机步长。长上下文最高 2.79×、接受率 72.9%、平均一次过 11 个 token，另一长文基准 2.60×。它给了个干净的公式解释"步长不是越长越好"（边际接受率低于相对草稿成本时加速回落）。诚实点：加速建立在非 FlashAttention 的验证核上、对优化引擎是否提速未测，单卡 ≤64K、输出 128 token，且自承认不是首个稀疏-KV 自投机。评级：人上人。

**3. Back from the Future: Key-Value Cache Management by Counter-Causal Surprise**（Metacognition AI / 澳国立 / 阿德莱德，arXiv:2607.27600）
换个角度问 KV cache 该扔谁：一个 token 若光看它后面的内容就能预测出来，就是冗余可扔——用"逆因果惊奇度"（1 减去从未来预测该 token 的概率）当保留信号。实现上把因果掩码换成上三角、每个位置只看其后位置，复用已存 K/V、只重算 query，全程不训练。全量成本是序列平方乘层数，故给了个只用最后一层的快速近似，刷新延迟 54ms→7.9ms（快 7–9 倍），代价是多存约占 KV 12% 的中间激活。MATH500 上四个模型里三个是最优驱逐法、AIME 上也是驱逐法里最好，但离满 cache 仍有差距。诚实点：增益温和、部分结果只在图里、未与最近更强的驱逐法正面比、全量版预填充成本近翻倍。评级：人上人。

## 快速一览

- Recall Before You Rank (ReTopK)（arXiv:2607.27692）· 训练无关地复用历史 Top-K 选择、省稀疏注意力选择器开销，128K 下几乎不掉精度、注意力提速 3×。
- ARES: Adaptive Reasoning-Effort Steering（arXiv:2607.27879）· 按每次调用自适应分配 reasoning 力气、带显式美元成本核算，用在 agent 回路做成本感知推理。

## 论文与链接

- WIDE — arXiv:2607.28418
- SparseSpec-L — arXiv:2607.27735
- Back from the Future — arXiv:2607.27600
- ReTopK — arXiv:2607.27692
- ARES — arXiv:2607.27879

## 制作元信息

- 检索：watermark 自动补 07-29→08-02 跳过批次，874 篇检索 / 678 候选 → Claude-as-judge（8 子代理）判 60 → 8 入选。
- 三篇主讲全文 PDF 出卡定级（评级冻结）：WIDE 顶级 / SparseSpec-L 人上人 / Back-from-the-Future 人上人。
- 音频：本地合成（mlx-audio Qwen3-TTS-12Hz-1.7B-CustomVoice），双主持 Jeff（uncle_fu）/ Ada（serena），1.0x。
- 口径：各篇加速倍数为论文自报、硬件与基准不同不可横比；主讲边界见正文诚实点。
]]></description>
      <pubDate>Mon, 03 Aug 2026 00:30:00 GMT</pubDate>
      <guid isPermaLink="false">mlsys-feed-2026-08-03</guid>
      <enclosure url="https://github.com/baihuajun24/baihuajun24.github.io/releases/download/audio-archive/0803-daily-arxiv.mp3" length="8350509" type="audio/mpeg" />
      <itunes:duration>08:42</itunes:duration>
      <content:encoded><![CDATA[# 0803 MLSYS 论文简报：给推理省钱的三个层面
Audio: 08:42

> 给大模型推理省钱，可以从三个层面下手：少解码几步、每个 token 少算一点、把 KV cache 里没用的早点扔掉。今天三篇正好各占一个层面，都训练无关、都有真实加速。

## 内容时间戳

- 00:00 开场 · 给推理省钱的三个层面
- 00:46 SparseSpec-L（中国科学技术大学）· 自投机解码，草稿用可召回稀疏 KV
- 02:36 WIDE（东方理工 / 慕尼黑 LMU）· token 级动态宽度剪枝 + 算子协同
- 05:16 Back from the Future · 逆因果惊奇度做 KV 驱逐
- 08:12 快速一览 · ReTopK / ARES
- 08:39 收尾

## 本期主讲

**1. WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning**（东方理工 / 慕尼黑 LMU，arXiv:2607.28418）
结构化剪枝的老毛病：静态剪枝对所有输入一刀切、砍狠了精度掉；动态剪枝又只会粗粒度地跳整层、跳子模块，不规则执行在硬件上跑不出真加速。WIDE 把动态路由从"跳整层"下推到 token 级的宽度——每个 token 自选注意力头组与前馈通道组——再配一个 GPU 算子协同设计：把每个 token 稀疏的掩码重排成连续块，让细粒度稀疏也保持稠密式高效访存，不用物化 token 专属权重。50% 稀疏下精度保住八成六到八成八，比只会跳层的动态基线最高高出二十多个点；算子层面预填充最高 1.98×、解码 4.95×，端到端预填充 1.68×、解码 1.55×。学出来的稀疏注意力砍到 66%、前馈只砍 28%。诚实点：只在两个 Llama 模型上验证，端到端 ~1.6× 远低于算子上限，50% 稀疏绝对精度仍掉约 13 点。评级：顶级。

**2. A Sparse Glimpse of the Whole: Train-Free Self-Speculative Decoding (SparseSpec-L)**（中国科学技术大学，arXiv:2607.27735）
投机解码要草稿便宜、接受率高、还能一次猜够长，三者常顾此失彼：训练小草稿泛化差，静态压 KV 又永久丢上下文、长文接受率崩。SparseSpec-L 让目标模型自己当草稿，用一份"可召回"的稀疏 KV——重要性分数从上一次全量验证的注意力统计里免费回收，稠密 KV 一个不扔、只在起草时用稀疏视图，目标分布不变；再用熵控制器在线选投机步长。长上下文最高 2.79×、接受率 72.9%、平均一次过 11 个 token，另一长文基准 2.60×。它给了个干净的公式解释"步长不是越长越好"（边际接受率低于相对草稿成本时加速回落）。诚实点：加速建立在非 FlashAttention 的验证核上、对优化引擎是否提速未测，单卡 ≤64K、输出 128 token，且自承认不是首个稀疏-KV 自投机。评级：人上人。

**3. Back from the Future: Key-Value Cache Management by Counter-Causal Surprise**（Metacognition AI / 澳国立 / 阿德莱德，arXiv:2607.27600）
换个角度问 KV cache 该扔谁：一个 token 若光看它后面的内容就能预测出来，就是冗余可扔——用"逆因果惊奇度"（1 减去从未来预测该 token 的概率）当保留信号。实现上把因果掩码换成上三角、每个位置只看其后位置，复用已存 K/V、只重算 query，全程不训练。全量成本是序列平方乘层数，故给了个只用最后一层的快速近似，刷新延迟 54ms→7.9ms（快 7–9 倍），代价是多存约占 KV 12% 的中间激活。MATH500 上四个模型里三个是最优驱逐法、AIME 上也是驱逐法里最好，但离满 cache 仍有差距。诚实点：增益温和、部分结果只在图里、未与最近更强的驱逐法正面比、全量版预填充成本近翻倍。评级：人上人。

## 快速一览

- Recall Before You Rank (ReTopK)（arXiv:2607.27692）· 训练无关地复用历史 Top-K 选择、省稀疏注意力选择器开销，128K 下几乎不掉精度、注意力提速 3×。
- ARES: Adaptive Reasoning-Effort Steering（arXiv:2607.27879）· 按每次调用自适应分配 reasoning 力气、带显式美元成本核算，用在 agent 回路做成本感知推理。

## 论文与链接

- WIDE — arXiv:2607.28418
- SparseSpec-L — arXiv:2607.27735
- Back from the Future — arXiv:2607.27600
- ReTopK — arXiv:2607.27692
- ARES — arXiv:2607.27879

## 制作元信息

- 检索：watermark 自动补 07-29→08-02 跳过批次，874 篇检索 / 678 候选 → Claude-as-judge（8 子代理）判 60 → 8 入选。
- 三篇主讲全文 PDF 出卡定级（评级冻结）：WIDE 顶级 / SparseSpec-L 人上人 / Back-from-the-Future 人上人。
- 音频：本地合成（mlx-audio Qwen3-TTS-12Hz-1.7B-CustomVoice），双主持 Jeff（uncle_fu）/ Ada（serena），1.0x。
- 口径：各篇加速倍数为论文自报、硬件与基准不同不可横比；主讲边界见正文诚实点。
]]></content:encoded>
    </item>
    <item>
      <title>0729 MLSYS 论文简报：长上下文 KV 的三种省法</title>
      <description><![CDATA[# 0729 MLSYS 论文简报：长上下文 KV 的三种省法
Audio: 09:57

> 长上下文推理里越堆越大的 KV cache 怎么省着用？三篇给了三种打法：把每页压成小摘要、把稀疏注意力的选择摊薄、把驱逐重新想成一个估计问题。压、挑、扔。

## 内容时间戳

- 00:00 开场 · 长上下文 KV 的三种省法
- 00:44 LOCKS（单作者预印本）· 页级低秩摘要，只读 top 页
- 03:34 PIVOT（腾讯）· 稀疏注意力 indexer 的 query 轴摊销
- 05:53 Eviction as Estimation（北卡教堂山 / 纽约大学）· 把驱逐重述为估计
- 08:42 快速一览 · Kimi K3 / Agentic Context Management / Agentic CPU-GPU Scheduling
- 09:52 收尾

## 本期主讲

**1. LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding**（单作者预印本，无机构署名，arXiv:2607.24555）
长上下文推理的瓶颈是 KV cache 的读带宽——cache 常驻显存，但每个 decode step 得整段全读。想稀疏地只读一部分又有死结：精确挑 top key 就得先读每个 key。LOCKS 给每页配一个常驻的低秩谱摘要（对该页做特征分解、留 rank-8，约占本页 KV 的十分之一），选择时只读摘要就能重构每页注意力质量、只挑 top 页去真读，全程不碰候选 key/value。还证了一个结构性不可能结论：任何跨页共享的固定投影必然对某些页自己独有的方向瞎掉。十万以上上下文、预算 2048 下平均分追平满 cache；一百万上下文每 token 延迟低 2.0×、每步读字节少约 9.8×；作为免训练插件挂进原版 vLLM 并跑进完整 CUDA graph。诚实点：保真度理论界仅对未量化摘要成立，量化版靠实测；效率优势集中在极长上下文/大 batch，短上下文仅持平。评级：夯。

**2. PIVOT: Efficient Query-Group Indexing for Token-Level Sparse Attention**（腾讯，arXiv:2607.24593）
DSA 这类 token 级稀疏注意力让下游算得便宜了，但瓶颈转移到 indexer——为每个 query 从整段前缀挑 top-k，每层仍是平方复杂度（文中引用：200K 时约占 prefill 端到端延迟 81%，注：该数字引自 IndexCache、非本文实测）。观察：相邻 query 的 top-k 重叠高达 0.8–0.9。于是把一组 query 按均值池化成一个代理 query 只扫一次前缀拿候选集；快变体直接把候选分给全组，精度版让每个 query 在小候选集内再各自精挑。全程不丢 token、下游仍看到完整前缀，只共享"挑选"这一步。indexer 层最高约 4×、端到端最高 1.6×，精度追平稠密；诚实报边界（极长上下文快变体掉点、短序列精度版更慢并加护栏回退稠密）。评级：顶级。

**3. Eviction as Estimation: A Fixed-Lag Smoothing View of Test-Time Memory**（北卡罗来纳大学教堂山分校 / 纽约大学，arXiv:2607.24667）
把 KV 驱逐重述为估计问题：驱逐时你其实在猜这个 item 未来还有没有用，而有用是未来才揭晓的。借估计理论的三种姿态——过滤估计现在、预测估计未来、平滑等几步回看过去——发现现有方法都挤在"到达即决定"（H=0），Belady 最优在 H→∞，中间的 fixed-lag smoothing 是空白。只要把决策延迟有界的 H 步，不可观测的未来就变成可测量的近期使用。提出的训练无关策略本质是给 H2O 加一个"预测正确才算数"的权重。难得的诚实：它明说自己不是新 SOTA——独立 benchmark 上仅 H2O 级，流式多轮里甚至同时输给 H2O 和 SnapKV，对 H2O 一胜一平三负。价值在框架，和一张"何时测量胜过累积"的诚实地图。评级：人上人。

## 快速一览

- Kimi K3: Open Frontier Intelligence（arXiv:2607.24653）· 开源前沿大模型报告，MoE 架构，对做推理 infra 有参考价值。
- Agentic Context Management: Solving Agent Memory and Cost（arXiv:2607.21503）· 把 agent 的记忆与成本当统一问题来管，思路对味但较早期。
- Agentic CPU-GPU Scheduling for Heterogeneous AI Workloads（arXiv:2607.22242）· 给异构 AI 负载做 agent 化的 CPU/GPU 调度。

## 论文与链接
- LOCKS — arXiv:2607.24555
- PIVOT — arXiv:2607.24593
- Eviction as Estimation — arXiv:2607.24667

## 制作元信息
- 检索：薄批次日（07-29），watermark 补 07-28 + 部分 07-29，87 篇 → 判 60（Claude-as-judge, 8 子代理）→ 6 入选。
- 三篇主讲全文 PDF 出卡定级（评级冻结）：LOCKS 夯 / PIVOT 顶级 / Eviction as Estimation 人上人。
- 音频：本地合成（mlx-audio Qwen3-TTS-12Hz-1.7B-CustomVoice），双主持 Jeff（uncle_fu）/ Ada（serena），1.0x。
- 口径：LOCKS 保真度界仅对未量化成立；PIVOT 的"占八成延迟"为引用他人；Eviction as Estimation 明确非 SOTA。
]]></description>
      <content:encoded><![CDATA[# 0729 MLSYS 论文简报：长上下文 KV 的三种省法
Audio: 09:57

> 长上下文推理里越堆越大的 KV cache 怎么省着用？三篇给了三种打法：把每页压成小摘要、把稀疏注意力的选择摊薄、把驱逐重新想成一个估计问题。压、挑、扔。

## 内容时间戳

- 00:00 开场 · 长上下文 KV 的三种省法
- 00:44 LOCKS（单作者预印本）· 页级低秩摘要，只读 top 页
- 03:34 PIVOT（腾讯）· 稀疏注意力 indexer 的 query 轴摊销
- 05:53 Eviction as Estimation（北卡教堂山 / 纽约大学）· 把驱逐重述为估计
- 08:42 快速一览 · Kimi K3 / Agentic Context Management / Agentic CPU-GPU Scheduling
- 09:52 收尾

## 本期主讲

**1. LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding**（单作者预印本，无机构署名，arXiv:2607.24555）
长上下文推理的瓶颈是 KV cache 的读带宽——cache 常驻显存，但每个 decode step 得整段全读。想稀疏地只读一部分又有死结：精确挑 top key 就得先读每个 key。LOCKS 给每页配一个常驻的低秩谱摘要（对该页做特征分解、留 rank-8，约占本页 KV 的十分之一），选择时只读摘要就能重构每页注意力质量、只挑 top 页去真读，全程不碰候选 key/value。还证了一个结构性不可能结论：任何跨页共享的固定投影必然对某些页自己独有的方向瞎掉。十万以上上下文、预算 2048 下平均分追平满 cache；一百万上下文每 token 延迟低 2.0×、每步读字节少约 9.8×；作为免训练插件挂进原版 vLLM 并跑进完整 CUDA graph。诚实点：保真度理论界仅对未量化摘要成立，量化版靠实测；效率优势集中在极长上下文/大 batch，短上下文仅持平。评级：夯。

**2. PIVOT: Efficient Query-Group Indexing for Token-Level Sparse Attention**（腾讯，arXiv:2607.24593）
DSA 这类 token 级稀疏注意力让下游算得便宜了，但瓶颈转移到 indexer——为每个 query 从整段前缀挑 top-k，每层仍是平方复杂度（文中引用：200K 时约占 prefill 端到端延迟 81%，注：该数字引自 IndexCache、非本文实测）。观察：相邻 query 的 top-k 重叠高达 0.8–0.9。于是把一组 query 按均值池化成一个代理 query 只扫一次前缀拿候选集；快变体直接把候选分给全组，精度版让每个 query 在小候选集内再各自精挑。全程不丢 token、下游仍看到完整前缀，只共享"挑选"这一步。indexer 层最高约 4×、端到端最高 1.6×，精度追平稠密；诚实报边界（极长上下文快变体掉点、短序列精度版更慢并加护栏回退稠密）。评级：顶级。

**3. Eviction as Estimation: A Fixed-Lag Smoothing View of Test-Time Memory**（北卡罗来纳大学教堂山分校 / 纽约大学，arXiv:2607.24667）
把 KV 驱逐重述为估计问题：驱逐时你其实在猜这个 item 未来还有没有用，而有用是未来才揭晓的。借估计理论的三种姿态——过滤估计现在、预测估计未来、平滑等几步回看过去——发现现有方法都挤在"到达即决定"（H=0），Belady 最优在 H→∞，中间的 fixed-lag smoothing 是空白。只要把决策延迟有界的 H 步，不可观测的未来就变成可测量的近期使用。提出的训练无关策略本质是给 H2O 加一个"预测正确才算数"的权重。难得的诚实：它明说自己不是新 SOTA——独立 benchmark 上仅 H2O 级，流式多轮里甚至同时输给 H2O 和 SnapKV，对 H2O 一胜一平三负。价值在框架，和一张"何时测量胜过累积"的诚实地图。评级：人上人。

## 快速一览

- Kimi K3: Open Frontier Intelligence（arXiv:2607.24653）· 开源前沿大模型报告，MoE 架构，对做推理 infra 有参考价值。
- Agentic Context Management: Solving Agent Memory and Cost（arXiv:2607.21503）· 把 agent 的记忆与成本当统一问题来管，思路对味但较早期。
- Agentic CPU-GPU Scheduling for Heterogeneous AI Workloads（arXiv:2607.22242）· 给异构 AI 负载做 agent 化的 CPU/GPU 调度。

## 论文与链接
- LOCKS — arXiv:2607.24555
- PIVOT — arXiv:2607.24593
- Eviction as Estimation — arXiv:2607.24667

## 制作元信息
- 检索：薄批次日（07-29），watermark 补 07-28 + 部分 07-29，87 篇 → 判 60（Claude-as-judge, 8 子代理）→ 6 入选。
- 三篇主讲全文 PDF 出卡定级（评级冻结）：LOCKS 夯 / PIVOT 顶级 / Eviction as Estimation 人上人。
- 音频：本地合成（mlx-audio Qwen3-TTS-12Hz-1.7B-CustomVoice），双主持 Jeff（uncle_fu）/ Ada（serena），1.0x。
- 口径：LOCKS 保真度界仅对未量化成立；PIVOT 的"占八成延迟"为引用他人；Eviction as Estimation 明确非 SOTA。
]]></content:encoded>
      <pubDate>Wed, 29 Jul 2026 00:30:00 GMT</pubDate>
      <guid isPermaLink="false">mlsys-feed-2026-07-29</guid>
      <enclosure url="https://github.com/baihuajun24/baihuajun24.github.io/releases/download/audio-archive/0729-daily-arxiv.mp3" length="9553581" type="audio/mpeg" />
      <itunes:duration>09:57</itunes:duration>
      <itunes:explicit>false</itunes:explicit>
    </item>
    <item>
      <title>0728 MLSYS 论文简报：给大模型推理省钱的三招</title>
      <description><![CDATA[# 0728 MLSYS 论文简报：给大模型推理省钱的三招
Audio: 11:06

> 今天三篇，主题很集中——省钱三招：从三个正交维度砍大模型推理的成本。一篇砍投机解码里被忽视的 draft 全读 KV 税，一篇砍跨分词器蒸馏的浪费，一篇砍权重和激活里的冗余。

## 内容时间戳

- 00:00 开场 · 省钱三招
- 00:46 Windowed-MTP（英伟达）· 投机解码的 draft-KV 税
- 04:04 Cross-Tokenizer Distillation（中科院大学 / 快手）· 字节空间蒸馏
- 06:58 SPDP（首尔国立大学）· 静态+动态剪枝统一 GPU kernel
- 09:30 快速一览 · MoE 通信重叠 / 小模型编排 / HiKV
- 10:55 收尾

## 本期主讲

**1. Windowed-MTP: Removing the Full-Context Draft-KV Tax at Million-Token Context**（英伟达，arXiv:2607.21535）
投机解码假设 draft "几乎免费"，但内置的 MTP draft 头每猜一个 token 都要对整个 KV cache 做全注意力，读取量随上下文线性涨。当 target 转向便宜的 hybrid/linear attention，这个 draft 税就暴露出来，1M 上下文下几乎让每个解码步翻倍。解法极简：只给 draft attention 套一个 StreamingLLM 式滑窗加 sink，verify 仍全上下文——训练无关、drop-in、**构造上无损**（接受哪个 token 由全注意力 target 说了算）。单 decode step 成本降 28–44%，H100 复现是不投机的 2.43 倍，窗口外约 99% 的 draft KV 可回收显存。诚实度突出（区分构造无损 vs bf16 非确定性、单 seed 口径）；单作者 preprint。评级：人上人。

**2. Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization**（中科院大学 · 快手 KwaiKAT，arXiv:2607.22334）
想拿强的大模型蒸馏一个小模型，但两个模型分词器完全不同、token 对不上，没法做稠密蒸馏。洞察很漂亮：师生把同一句话切成不同 token，但都 decode 到同一个字节流。于是把老师监督搬到共享字节空间，把老师每个 token 的概率路由给"字节前缀正好是它的最长学生 token"，再聚合回学生词表——天然满足词表完整、字节对齐、质量守恒，且字节层面是精确解。六个数学/代码基准比最强跨分词器 baseline 高 3.7–6.6 分。还主动挖出并诊断了 whitespace collapse 失效模式（纯字节精确监督把代码通过率从 49% 打到 9%，一个只遮 3.5% 对齐行的 mask 就解决）。评级：顶级。

**3. Unified Static-Dynamic Pruning for Efficient LLM Inference (SPDP)**（首尔国立大学，arXiv:2607.21985）
静态剪枝离线定 mask 去权重、动态剪枝运行时跳激活，一个沿行、一个沿列，正交维度稀疏本可相乘，但数据格式一直不兼容。SPDP 设计一个统一的列主 Tiled-CBC 格式配两个分阶段 GPU kernel，第一次真正在 GPU 上把这两种稀疏叠起来跑。A10G/L4 上比 SpInfer 快 1.24–1.37×（最高 2.5×），同困惑度多吃 25% 稀疏；端到端平均 1.34×，受内存瓶颈与 Amdahl 上界限制。诚实报负结果（极端稀疏打不过 CSR、prefill 打不过 cuBLAS）。venue 口径：作者 arXiv 标注 VLDB 录用，但 PDF 用的是占位模板，按"作者标注"表述。评级：人上人。

## 快速一览

- Fine-grained Computation-Communication Overlap for Mixture-of-Experts（ICPP'26，arXiv:2607.19539）· tile 级信号量重叠 MoE 的两次 all-to-all 通信与专家计算，四卡端到端最高 2.64×。
- Small, Free, and Effective: Orchestrating Open-Weight SLMs for Malware Analysis（RAID，arXiv:2607.20216）· 一堆开源小模型编排能不能打过单个大模型？4B+8B 组合在恶意软件分析上做到 35.30%，反超最强前沿 baseline——route-to-small 的正面证据。
- HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration（arXiv:2607.22389）· 分层的、重要性感知的 KV cache 配硬件加速。

## 论文与链接
- Windowed-MTP — arXiv:2607.21535
- Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization — arXiv:2607.22334
- Unified Static-Dynamic Pruning for Efficient LLM Inference (SPDP) — arXiv:2607.21985

## 制作元信息
- 检索：watermark 自动补 07-24→07-27 四天跳过批次，406 篇 → 去重 316 → rough-rank 取 60 判。
- 评分：本地无 API key，走 Claude-as-judge（8 个并行子代理按 llm_judge rubric 评分）→ 回灌真实 pipeline，状态已更新。
- 三篇主讲全文 PDF 出卡定级（评级冻结）：BPM 顶级 / Windowed-MTP 人上人 / SPDP 人上人。
- 音频：本地合成（mlx-audio Qwen3-TTS-12Hz-1.7B-CustomVoice），双主持 Jeff（uncle_fu）/ Ada（serena），1.0x。
- 口径：Windowed-MTP 无损为构造性；BPM 师生为 2026 命名模型、数字无法独立复核；SPDP 的 VLDB 录用为作者标注、PDF 是占位模板。
]]></description>
      <content:encoded><![CDATA[# 0728 MLSYS 论文简报：给大模型推理省钱的三招
Audio: 11:06

> 今天三篇，主题很集中——省钱三招：从三个正交维度砍大模型推理的成本。一篇砍投机解码里被忽视的 draft 全读 KV 税，一篇砍跨分词器蒸馏的浪费，一篇砍权重和激活里的冗余。

## 内容时间戳

- 00:00 开场 · 省钱三招
- 00:46 Windowed-MTP（英伟达）· 投机解码的 draft-KV 税
- 04:04 Cross-Tokenizer Distillation（中科院大学 / 快手）· 字节空间蒸馏
- 06:58 SPDP（首尔国立大学）· 静态+动态剪枝统一 GPU kernel
- 09:30 快速一览 · MoE 通信重叠 / 小模型编排 / HiKV
- 10:55 收尾

## 本期主讲

**1. Windowed-MTP: Removing the Full-Context Draft-KV Tax at Million-Token Context**（英伟达，arXiv:2607.21535）
投机解码假设 draft "几乎免费"，但内置的 MTP draft 头每猜一个 token 都要对整个 KV cache 做全注意力，读取量随上下文线性涨。当 target 转向便宜的 hybrid/linear attention，这个 draft 税就暴露出来，1M 上下文下几乎让每个解码步翻倍。解法极简：只给 draft attention 套一个 StreamingLLM 式滑窗加 sink，verify 仍全上下文——训练无关、drop-in、**构造上无损**（接受哪个 token 由全注意力 target 说了算）。单 decode step 成本降 28–44%，H100 复现是不投机的 2.43 倍，窗口外约 99% 的 draft KV 可回收显存。诚实度突出（区分构造无损 vs bf16 非确定性、单 seed 口径）；单作者 preprint。评级：人上人。

**2. Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization**（中科院大学 · 快手 KwaiKAT，arXiv:2607.22334）
想拿强的大模型蒸馏一个小模型，但两个模型分词器完全不同、token 对不上，没法做稠密蒸馏。洞察很漂亮：师生把同一句话切成不同 token，但都 decode 到同一个字节流。于是把老师监督搬到共享字节空间，把老师每个 token 的概率路由给"字节前缀正好是它的最长学生 token"，再聚合回学生词表——天然满足词表完整、字节对齐、质量守恒，且字节层面是精确解。六个数学/代码基准比最强跨分词器 baseline 高 3.7–6.6 分。还主动挖出并诊断了 whitespace collapse 失效模式（纯字节精确监督把代码通过率从 49% 打到 9%，一个只遮 3.5% 对齐行的 mask 就解决）。评级：顶级。

**3. Unified Static-Dynamic Pruning for Efficient LLM Inference (SPDP)**（首尔国立大学，arXiv:2607.21985）
静态剪枝离线定 mask 去权重、动态剪枝运行时跳激活，一个沿行、一个沿列，正交维度稀疏本可相乘，但数据格式一直不兼容。SPDP 设计一个统一的列主 Tiled-CBC 格式配两个分阶段 GPU kernel，第一次真正在 GPU 上把这两种稀疏叠起来跑。A10G/L4 上比 SpInfer 快 1.24–1.37×（最高 2.5×），同困惑度多吃 25% 稀疏；端到端平均 1.34×，受内存瓶颈与 Amdahl 上界限制。诚实报负结果（极端稀疏打不过 CSR、prefill 打不过 cuBLAS）。venue 口径：作者 arXiv 标注 VLDB 录用，但 PDF 用的是占位模板，按"作者标注"表述。评级：人上人。

## 快速一览

- Fine-grained Computation-Communication Overlap for Mixture-of-Experts（ICPP'26，arXiv:2607.19539）· tile 级信号量重叠 MoE 的两次 all-to-all 通信与专家计算，四卡端到端最高 2.64×。
- Small, Free, and Effective: Orchestrating Open-Weight SLMs for Malware Analysis（RAID，arXiv:2607.20216）· 一堆开源小模型编排能不能打过单个大模型？4B+8B 组合在恶意软件分析上做到 35.30%，反超最强前沿 baseline——route-to-small 的正面证据。
- HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration（arXiv:2607.22389）· 分层的、重要性感知的 KV cache 配硬件加速。

## 论文与链接
- Windowed-MTP — arXiv:2607.21535
- Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization — arXiv:2607.22334
- Unified Static-Dynamic Pruning for Efficient LLM Inference (SPDP) — arXiv:2607.21985

## 制作元信息
- 检索：watermark 自动补 07-24→07-27 四天跳过批次，406 篇 → 去重 316 → rough-rank 取 60 判。
- 评分：本地无 API key，走 Claude-as-judge（8 个并行子代理按 llm_judge rubric 评分）→ 回灌真实 pipeline，状态已更新。
- 三篇主讲全文 PDF 出卡定级（评级冻结）：BPM 顶级 / Windowed-MTP 人上人 / SPDP 人上人。
- 音频：本地合成（mlx-audio Qwen3-TTS-12Hz-1.7B-CustomVoice），双主持 Jeff（uncle_fu）/ Ada（serena），1.0x。
- 口径：Windowed-MTP 无损为构造性；BPM 师生为 2026 命名模型、数字无法独立复核；SPDP 的 VLDB 录用为作者标注、PDF 是占位模板。
]]></content:encoded>
      <pubDate>Tue, 28 Jul 2026 00:30:00 GMT</pubDate>
      <guid isPermaLink="false">mlsys-feed-2026-07-28</guid>
      <enclosure url="https://github.com/baihuajun24/baihuajun24.github.io/releases/download/audio-archive/0728-daily-arxiv.mp3" length="10658733" type="audio/mpeg" />
      <itunes:duration>11:06</itunes:duration>
      <itunes:explicit>false</itunes:explicit>
    </item>
    <item>
      <title>0709 MLSYS 论文简报：给推理省时间省成本</title>
      <description><![CDATA[# 0709 MLSYS 论文简报：给推理省时间省成本
Audio: 08:23

> 今天三篇，主题很集中——都是在"别浪费每一份计算、每一个 token"上做文章：把投机的思想搬到 KV cache 的网络传输、把投机解码的草稿模型训练目标对齐推理、把模型路由和 KV 缓存复用耦合起来一起算账。

## 内容时间戳

- 00:00 开场 · 三篇主题：给推理省时间省成本
- 00:17 Lynx（伦敦大学学院·华为）· 投机式 KV 传输
- 02:52 Spec-AUF（北京大学）· 草稿训练对齐推理
- 05:08 HyDRA（微软·GitHub）· 异构模型路由 + cache-aware
- 07:57 收束：别浪费每一份计算、每一个 token

## 本期主讲

**1. Lynx: Progressive Speculative Quantization for accelerating KV Transfer in Long-Context Inference**（伦敦大学学院 · 华为，arXiv:2607.01831）
disaggregated 推理里，长上下文的大 KV cache 要跨网络从 prefill 传到 decode，decode 必须等传完才能开始，网络传输成了瓶颈。Lynx 挑战"KV cache 不可分割"的假设：按比特重要性拆成 Anchor（高位、先传）和 Residual（低位、后到）两股流，decode 收到 Anchor 就投机式开跑、Residual 到了再补精度校验。拿到 INT4 级传输延迟、精度却匹配高精度量化（比 SOTA 高 5.1 个百分点），TTFT 与到第 32 个 token 的时间最多降 30.5%。

**2. Spec-AUF: Accept-Until-Fail Training under Train-Inference Misalignment for Masked Block Drafters**（北京大学，arXiv:2607.01893）
block 草稿模型一次并行猜一整块，却用整块 cross-entropy 监督每个位置——而推理时 verifier 从左到右验、第一个被拒之后全丢，训练与推理错配。之前用加权衰减打补丁仍不够（靠后位置的价值是"有条件的"）。Spec-AUF 用 teacher-forcing 只监督"会被接受的前缀"（Accept-Until-Fail），把 verifier 的左到右接受契约写进训练目标。Qwen3-8B、DFlash/Domino 两种草稿、六个 benchmark 上，平均接受长度稳定提升——接受越长，投机加速比越高。

**3. HyDRA: Hybrid Dynamic Routing Architecture for Heterogeneous LLM Pools**（微软 · GitHub，arXiv:2605.17106）
GitHub Copilot Auto 背后的路由器。不预测"用哪个模型"，而是预测 query 在四维能力（推理/代码生成/调试/工具使用）上各需多强（ModernBERT + 4 个 sigmoid 头），再与配置化模型档案做 shortfall matching，选满足需求里最便宜的——与模型身份解耦，换目录只改配置不重训。亮点是 cache-aware 粘滞路由：每轮切模型会让 prompt 缓存（省九成）失效，所以只在缓存本会失效的边界（首轮、compaction、总结后）才重路由。同池对比与 OpenRouter Auto 解题率打平但省成本 3.3×，路由器 CPU 上 55ms。

## 论文与链接
- Lynx — arXiv:2607.01831
- Spec-AUF — arXiv:2607.01893
- HyDRA — arXiv:2605.17106

## 制作元信息
- 检索：pool 07-03→07-08 六天（hours_back 168，gap-pool CAP 500），抓取 1671 篇 → 去重去历史 1309 → rough-rank 取 60 + backlog 9 判。
- 评分：本地无 API key，走 Claude-as-judge（9 个并行子代理按 llm_judge rubric 评分）→ 回灌真实 pipeline，状态已更新。
- 三篇为 PI 从判后 shortlist 中钦定（Lynx + Spec-AUF + HyDRA，HyDRA 系 PI 本周 inbound 从召回池命中）。
- 音频：本地合成（mlx-audio Qwen3-TTS-12Hz-1.7B-CustomVoice），双主持 小白（本人克隆声）/ Ada（serena）。
- 口径：GRPO/路由等数字均对各自 PDF 首页/正文复核。
]]></description>
      <content:encoded><![CDATA[# 0709 MLSYS 论文简报：给推理省时间省成本
Audio: 08:23

> 今天三篇，主题很集中——都是在"别浪费每一份计算、每一个 token"上做文章：把投机的思想搬到 KV cache 的网络传输、把投机解码的草稿模型训练目标对齐推理、把模型路由和 KV 缓存复用耦合起来一起算账。

## 内容时间戳

- 00:00 开场 · 三篇主题：给推理省时间省成本
- 00:17 Lynx（伦敦大学学院·华为）· 投机式 KV 传输
- 02:52 Spec-AUF（北京大学）· 草稿训练对齐推理
- 05:08 HyDRA（微软·GitHub）· 异构模型路由 + cache-aware
- 07:57 收束：别浪费每一份计算、每一个 token

## 本期主讲

**1. Lynx: Progressive Speculative Quantization for accelerating KV Transfer in Long-Context Inference**（伦敦大学学院 · 华为，arXiv:2607.01831）
disaggregated 推理里，长上下文的大 KV cache 要跨网络从 prefill 传到 decode，decode 必须等传完才能开始，网络传输成了瓶颈。Lynx 挑战"KV cache 不可分割"的假设：按比特重要性拆成 Anchor（高位、先传）和 Residual（低位、后到）两股流，decode 收到 Anchor 就投机式开跑、Residual 到了再补精度校验。拿到 INT4 级传输延迟、精度却匹配高精度量化（比 SOTA 高 5.1 个百分点），TTFT 与到第 32 个 token 的时间最多降 30.5%。

**2. Spec-AUF: Accept-Until-Fail Training under Train-Inference Misalignment for Masked Block Drafters**（北京大学，arXiv:2607.01893）
block 草稿模型一次并行猜一整块，却用整块 cross-entropy 监督每个位置——而推理时 verifier 从左到右验、第一个被拒之后全丢，训练与推理错配。之前用加权衰减打补丁仍不够（靠后位置的价值是"有条件的"）。Spec-AUF 用 teacher-forcing 只监督"会被接受的前缀"（Accept-Until-Fail），把 verifier 的左到右接受契约写进训练目标。Qwen3-8B、DFlash/Domino 两种草稿、六个 benchmark 上，平均接受长度稳定提升——接受越长，投机加速比越高。

**3. HyDRA: Hybrid Dynamic Routing Architecture for Heterogeneous LLM Pools**（微软 · GitHub，arXiv:2605.17106）
GitHub Copilot Auto 背后的路由器。不预测"用哪个模型"，而是预测 query 在四维能力（推理/代码生成/调试/工具使用）上各需多强（ModernBERT + 4 个 sigmoid 头），再与配置化模型档案做 shortfall matching，选满足需求里最便宜的——与模型身份解耦，换目录只改配置不重训。亮点是 cache-aware 粘滞路由：每轮切模型会让 prompt 缓存（省九成）失效，所以只在缓存本会失效的边界（首轮、compaction、总结后）才重路由。同池对比与 OpenRouter Auto 解题率打平但省成本 3.3×，路由器 CPU 上 55ms。

## 论文与链接
- Lynx — arXiv:2607.01831
- Spec-AUF — arXiv:2607.01893
- HyDRA — arXiv:2605.17106

## 制作元信息
- 检索：pool 07-03→07-08 六天（hours_back 168，gap-pool CAP 500），抓取 1671 篇 → 去重去历史 1309 → rough-rank 取 60 + backlog 9 判。
- 评分：本地无 API key，走 Claude-as-judge（9 个并行子代理按 llm_judge rubric 评分）→ 回灌真实 pipeline，状态已更新。
- 三篇为 PI 从判后 shortlist 中钦定（Lynx + Spec-AUF + HyDRA，HyDRA 系 PI 本周 inbound 从召回池命中）。
- 音频：本地合成（mlx-audio Qwen3-TTS-12Hz-1.7B-CustomVoice），双主持 小白（本人克隆声）/ Ada（serena）。
- 口径：GRPO/路由等数字均对各自 PDF 首页/正文复核。
]]></content:encoded>
      <pubDate>Thu, 09 Jul 2026 00:30:00 GMT</pubDate>
      <guid isPermaLink="false">mlsys-feed-2026-07-09</guid>
      <enclosure url="https://github.com/baihuajun24/baihuajun24.github.io/releases/download/audio-archive/0709-daily-arxiv.mp3" length="4512333" type="audio/mpeg" />
      <itunes:duration>08:23</itunes:duration>
      <itunes:explicit>false</itunes:explicit>
    </item>
    <item>
      <title>0703 MLSYS 论文简报：顺着长上下文，从 KV cache 到 agent 记忆的三层省法</title>
      <description><![CDATA[# 0703 MLSYS 论文简报：顺着长上下文，从 KV cache 到 agent 记忆的三层省法
Audio: 09:31

> 三篇顺着「长上下文 / 长推理」这条线，从下往上各出一招：serving 层压 KV cache、推理层决定"想多久"、agent 层学"怎么记"。
> 音频不口播 arXiv 编号，编号见下方链接。

## 内容时间戳
- 00:00 开场 · 三篇顺着长上下文 / 长推理，从下往上各出一招
- 00:23 ① MosaicKV：serving 层同时压 KV cache 的两个维度（系统 / 长上下文服务）
- 03:53 ② CAT：用模型自信度决定"想多久"，省 token 还涨精度（token economy）
- 06:28 ③ AutoMem：把记忆管理学成一门可训练技能（agent 记忆 / 探索）
- 09:05 收尾 · 三篇小结

## 本期主讲

### ① MosaicKV · serving / KV cache · 评级：夯
- **MosaicKV: Serving Long-Context LLM with Dynamic Two-D KV Cache Compression** — arXiv 2607.00760 · 上海交通大学 IPADS
- 亮点：长上下文 serving 里 KV cache 是头号成本（8 并发 × 128K 用 LLaMA-3.1-8B 要 128GB＝权重的 8×，1M 时 64×）。现有方法只压一个维度（序列如 Quest，或通道如 ThinK），天真叠加会崩（反例：通道压 30% 掉 24.5%、70% 掉 82.8%）。MosaicKV 同时压两维、且贯穿整个 decode：靠 per-vector 选元素 + per-segment 自适应策略保精度；又发现 decode attention 是带宽瓶颈（带宽利用率 90%、CUDA core 仅 10%、CPU 闲置），把稀疏 attention 塞进闲置的 CUDA core/CPU。
- 数字：相比不压缩基线，attention 最高 16×、解码延迟降到约 1/4.8、吞吐最高 7.3×，显存 3×，精度平均只掉 1.76%（LongBench + RULER）。
- 诚实声明：以上是峰值；平均约解码 3.8× / 吞吐 5.5×；个别模型（Ministral）RULER 掉 3.55%；>512K 的部分数字为按层采样外推；仅加速 decode（prefill 是未来工作）。

### ② CAT · token economy / adaptive compute · 评级：人上人
- **CAT: Confidence-Adaptive Thinking for Efficient Reasoning of Large Reasoning Models** — arXiv 2607.00862 · 电子科技大学（UESTC）
- 亮点：大推理模型对简单题"过度思考"浪费 token；现有方法要么一刀切砍长度（伤难题）、要么用粗粒度难度估计。CAT 用模型自己的自信度（每步 token 分布离均匀分布多远）当细粒度难度信号——它能分开答对/答错轨迹且对长度不敏感——据此构造偏好对（对的偏短"简洁对"、错的偏长"深思对"）+ 置信度加权的偏好优化。
- 数字：R1-Distill-Qwen-7B 在 MATH-500 从 91.7→93.9 且省约 1/3 token；AIME24 53.3→58.9；GPQA 49.2→54.0。罕见地在压缩同时还涨精度。
- 诚实声明：其压缩率其实低于更激进的方法，卖点是"精度-压缩折得最好"而非砍最狠；只报 token 下降、没有墙钟加速；仅 STEM 任务、训练仍依赖 ground-truth 正确性。

### ③ AutoMem · agent 记忆（探索性） · 评级：夯
- **AutoMem: Automated Learning of Memory as a Cognitive Skill** — arXiv 2607.01224 · Stanford University
- 亮点：长程 agent（游戏，几千到十万步）远超上下文，一个坏的记忆决定会潜伏几百步才发作、人无法逐条 review。AutoMem 把文件操作（读/写/搜索/追加）提升成与任务动作平级的一等动作——每个记忆决定都可追溯，一个前沿元模型就能像 code review 一样看完整条轨迹、指出错在哪一步。两个外层循环：元模型重写记忆结构/schema；再用 LoRA 把"记忆专家"小模型在 agent 自己的好决定上微调出来。
- 数字：底座 Qwen2.5-32B，只优化记忆就拿 2–4× 提升：Crafter 25→51%、MiniHack 7.5→30%、NetHack 0.42→1.85%，据称让 32B 开源模型在这些游戏上追平 Claude Opus 4.5 / Gemini-3.1-Pro；NetHack 每步记忆从 138 字符压到 6（−95%），冗余写入降 68–83%。
- 诚实声明：记忆一局一清、无跨局持久化；仅 3 个程序生成游戏、无真实/工具任务；第二个循环（LoRA 记忆专家）的增益误差棒重叠、统计不显著；强依赖前沿元模型（Claude Opus）当 reviewer。

## 制作元信息
- 文稿：双人对谈（Jeff 主讲 serving 一篇 + Ada 主讲推理/agent 两篇并互相质询）。
- 音频：本地 Qwen3-TTS（mlx-audio）合成，约 09:31。
- 主持：Jeff（系统）· Ada（算法）。
- 口径：论文数字均据原文，每篇附诚实声明；arXiv 编号不口播、仅留链接。
]]></description>
      <content:encoded><![CDATA[# 0703 MLSYS 论文简报：顺着长上下文，从 KV cache 到 agent 记忆的三层省法
Audio: 09:31

> 三篇顺着「长上下文 / 长推理」这条线，从下往上各出一招：serving 层压 KV cache、推理层决定"想多久"、agent 层学"怎么记"。
> 音频不口播 arXiv 编号，编号见下方链接。

## 内容时间戳
- 00:00 开场 · 三篇顺着长上下文 / 长推理，从下往上各出一招
- 00:23 ① MosaicKV：serving 层同时压 KV cache 的两个维度（系统 / 长上下文服务）
- 03:53 ② CAT：用模型自信度决定"想多久"，省 token 还涨精度（token economy）
- 06:28 ③ AutoMem：把记忆管理学成一门可训练技能（agent 记忆 / 探索）
- 09:05 收尾 · 三篇小结

## 本期主讲

### ① MosaicKV · serving / KV cache · 评级：夯
- **MosaicKV: Serving Long-Context LLM with Dynamic Two-D KV Cache Compression** — arXiv 2607.00760 · 上海交通大学 IPADS
- 亮点：长上下文 serving 里 KV cache 是头号成本（8 并发 × 128K 用 LLaMA-3.1-8B 要 128GB＝权重的 8×，1M 时 64×）。现有方法只压一个维度（序列如 Quest，或通道如 ThinK），天真叠加会崩（反例：通道压 30% 掉 24.5%、70% 掉 82.8%）。MosaicKV 同时压两维、且贯穿整个 decode：靠 per-vector 选元素 + per-segment 自适应策略保精度；又发现 decode attention 是带宽瓶颈（带宽利用率 90%、CUDA core 仅 10%、CPU 闲置），把稀疏 attention 塞进闲置的 CUDA core/CPU。
- 数字：相比不压缩基线，attention 最高 16×、解码延迟降到约 1/4.8、吞吐最高 7.3×，显存 3×，精度平均只掉 1.76%（LongBench + RULER）。
- 诚实声明：以上是峰值；平均约解码 3.8× / 吞吐 5.5×；个别模型（Ministral）RULER 掉 3.55%；>512K 的部分数字为按层采样外推；仅加速 decode（prefill 是未来工作）。

### ② CAT · token economy / adaptive compute · 评级：人上人
- **CAT: Confidence-Adaptive Thinking for Efficient Reasoning of Large Reasoning Models** — arXiv 2607.00862 · 电子科技大学（UESTC）
- 亮点：大推理模型对简单题"过度思考"浪费 token；现有方法要么一刀切砍长度（伤难题）、要么用粗粒度难度估计。CAT 用模型自己的自信度（每步 token 分布离均匀分布多远）当细粒度难度信号——它能分开答对/答错轨迹且对长度不敏感——据此构造偏好对（对的偏短"简洁对"、错的偏长"深思对"）+ 置信度加权的偏好优化。
- 数字：R1-Distill-Qwen-7B 在 MATH-500 从 91.7→93.9 且省约 1/3 token；AIME24 53.3→58.9；GPQA 49.2→54.0。罕见地在压缩同时还涨精度。
- 诚实声明：其压缩率其实低于更激进的方法，卖点是"精度-压缩折得最好"而非砍最狠；只报 token 下降、没有墙钟加速；仅 STEM 任务、训练仍依赖 ground-truth 正确性。

### ③ AutoMem · agent 记忆（探索性） · 评级：夯
- **AutoMem: Automated Learning of Memory as a Cognitive Skill** — arXiv 2607.01224 · Stanford University
- 亮点：长程 agent（游戏，几千到十万步）远超上下文，一个坏的记忆决定会潜伏几百步才发作、人无法逐条 review。AutoMem 把文件操作（读/写/搜索/追加）提升成与任务动作平级的一等动作——每个记忆决定都可追溯，一个前沿元模型就能像 code review 一样看完整条轨迹、指出错在哪一步。两个外层循环：元模型重写记忆结构/schema；再用 LoRA 把"记忆专家"小模型在 agent 自己的好决定上微调出来。
- 数字：底座 Qwen2.5-32B，只优化记忆就拿 2–4× 提升：Crafter 25→51%、MiniHack 7.5→30%、NetHack 0.42→1.85%，据称让 32B 开源模型在这些游戏上追平 Claude Opus 4.5 / Gemini-3.1-Pro；NetHack 每步记忆从 138 字符压到 6（−95%），冗余写入降 68–83%。
- 诚实声明：记忆一局一清、无跨局持久化；仅 3 个程序生成游戏、无真实/工具任务；第二个循环（LoRA 记忆专家）的增益误差棒重叠、统计不显著；强依赖前沿元模型（Claude Opus）当 reviewer。

## 制作元信息
- 文稿：双人对谈（Jeff 主讲 serving 一篇 + Ada 主讲推理/agent 两篇并互相质询）。
- 音频：本地 Qwen3-TTS（mlx-audio）合成，约 09:31。
- 主持：Jeff（系统）· Ada（算法）。
- 口径：论文数字均据原文，每篇附诚实声明；arXiv 编号不口播、仅留链接。
]]></content:encoded>
      <pubDate>Fri, 03 Jul 2026 00:30:00 GMT</pubDate>
      <guid isPermaLink="false">mlsys-feed-2026-07-03</guid>
      <enclosure url="https://github.com/baihuajun24/baihuajun24.github.io/releases/download/audio-archive/0703-daily-arxiv.mp3" length="5063589" type="audio/mpeg" />
      <itunes:duration>09:31</itunes:duration>
      <itunes:explicit>false</itunes:explicit>
    </item>
    <item>
      <title>0702 MLSYS 论文简报：给长思维链省 token 的三种打法</title>
      <description><![CDATA[# 0702 MLSYS 论文简报：给长思维链省 token 的三种打法

> 本期三篇论文盯着同一个敌人——长思维链（long CoT）动辄上万 token 带来的延迟与显存开销，从调度、KV cache、推理表征三个层面各出一招。
> 音频不口播 arXiv 编号，编号见下方链接。

## 内容时间戳
- 00:00 开场 · 今日三篇导览（三篇都在砍长思维链的 token 开销）
- 01:01 ① LASER：负载感知 early-exit，边缘 serving 按实时负载动态决定"想多深"（系统/调度）
- 04:12 ② EpiKV：不看 attention、从 residual stream 打分的 KV cache 驱逐（推理系统）
- 07:58 ③ CLSR：多 agent 自主进化符号语言，精度不变、token 降 3–6×（多智能体/token economy）
- 11:10 📌 引用观察 · 投机解码"草稿何时被接受"的理论
- 11:45 收尾 · 三篇小结

## 本期主讲

### ① LASER · 边缘 serving / early-exit 调度 · 评级：人上人
- **Load-Aware Serving with Early-Exit for Reasoning LLMs at the Edge** — arXiv 2606.31580 · 北京师范大学（珠海）+ 澳门大学
- 亮点：把 reasoning 模型的 confidence-based early-exit 从"单请求、固定阈值"升级成"负载感知的可调度变量"。两个机制：(1) 用 tanh(EMA 负载) 在一个事先验证过的安全区间里在线微调 exit 阈值——负载高早停、负载低多想；(2) 按题目难度 + 当前负载给每个请求预分一个 token 预算作为硬上限。
- 数字：平均延迟降 17–38%、SLO 达成率 +3–6pp，平均精度代价约 1%（注意是平均，个别 benchmark 掉到约 5pp）；token 压缩 42–80%；突发流量下延迟砍约 22%。
- 诚实声明：系统级数字来自离散事件仿真（单张 RTX 4090、两个 4–7B 小模型），非线上真部署。

### ② EpiKV · KV cache 驱逐 / 推理系统 · 评级：人上人（偏夯）
- **Epiphany-Aware KV Cache Eviction Without the Attention Matrix** — arXiv 2606.26472 · Carnegie Mellon University
- 亮点：现有 KV cache eviction 几乎都按 attention 权重排 token 重要性——信号噪声大，还逼模型物化 n×n attention 矩阵、用不了 FlashAttention。EpiKV 改用 epiphany score：token 前后 residual stream（隐藏状态）的 L2 变化量，直接从前向传播读出，不碰 attention 矩阵、FlashAttention 兼容、免训练。背后有可解释性支撑（中间层与偏上层变化方向相反的两个 band，取差值）。
- 数字：MATH-500、缓存压到 4096 时准确率 72%（H2O 67%），离无损天花板 75% 仅差约 3 点；比最快的 attention 基线快约 1.6×；FlashAttention 让可行上下文从 eager 8192 就 OOM 撑到 65,536 token；缓存极小（1024）时 H2O 崩到 5%，EpiKV 仍站得住。
- 诚实声明：单模型（DeepSeek-R1-Distill-LLaMA-8B）验证；AIME 仅 30 题，作者明确说属方向性证据；主打"近无损省显存/提吞吐"，非宣称精度大涨；部分吞吐数字为投影。

### ③ CLSR · 多智能体 / token economy（探索性） · 评级：人上人
- **When LLMs Develop Languages: Symbolic Communication for Efficient Multi-Agent Reasoning** — arXiv 2606.29354 · 中国科学院计算技术研究所 + 国科大
- 亮点：自然语言 CoT 对机器不是信息密度最高的表达。CLSR 让多个 black-box LLM agent 自主发明、演化、共享一套紧凑符号语言（LSF：符号表+语法+使用规则），离线用 Pareto 准则（先对错、再省 token）一代代进化出一批，在线由一个 latent-free router 按 query 挑选/组合。等于"给机器造方言并让方言优胜劣汰"。
- 数字：保持精度基本不变下生成 token 降 3–6×（约省 3/4）。例：8B 模型 GPQA 从 73.2%/5380 token → 73.1%/1326 token；Qwen3-32B 在 MATH-500 从 845 → 206 token、精度纹丝不动。
- 诚实声明：离线语言进化很贵（8×RTX 4090 跑数天、需带标准答案的样例）；最亮眼的精度数字来自较费 token 的模式，默认 router 模式有时以少量精度换 token。（注：论文文件套用了会议模板，接收与否未独立核实，本节目不据此背书。）

## 📌 引用观察
- **When Is a Draft Accepted? A Theory of Acceptance in Speculative Decoding** — arXiv 2606.30265。给贪心解码 / 放松接受准则 / 树状候选这些实际系统常用、但过去理论没覆盖好的设定，补了一个"草稿何时被接受"的理论刻画。

## 制作元信息
- 文稿：双人对谈（Jeff 主讲系统两篇 + Ada 主讲多智能体一篇并负责质询）。
- 音频：本地 Qwen3-TTS 合成，约 12:09。
- 主持：Jeff（系统）· Ada（算法）。
- 口径：论文数字均据原文，每篇附诚实声明；arXiv 编号不口播、仅留链接。
]]></description>
      <content:encoded><![CDATA[# 0702 MLSYS 论文简报：给长思维链省 token 的三种打法

> 本期三篇论文盯着同一个敌人——长思维链（long CoT）动辄上万 token 带来的延迟与显存开销，从调度、KV cache、推理表征三个层面各出一招。
> 音频不口播 arXiv 编号，编号见下方链接。

## 内容时间戳
- 00:00 开场 · 今日三篇导览（三篇都在砍长思维链的 token 开销）
- 01:01 ① LASER：负载感知 early-exit，边缘 serving 按实时负载动态决定"想多深"（系统/调度）
- 04:12 ② EpiKV：不看 attention、从 residual stream 打分的 KV cache 驱逐（推理系统）
- 07:58 ③ CLSR：多 agent 自主进化符号语言，精度不变、token 降 3–6×（多智能体/token economy）
- 11:10 📌 引用观察 · 投机解码"草稿何时被接受"的理论
- 11:45 收尾 · 三篇小结

## 本期主讲

### ① LASER · 边缘 serving / early-exit 调度 · 评级：人上人
- **Load-Aware Serving with Early-Exit for Reasoning LLMs at the Edge** — arXiv 2606.31580 · 北京师范大学（珠海）+ 澳门大学
- 亮点：把 reasoning 模型的 confidence-based early-exit 从"单请求、固定阈值"升级成"负载感知的可调度变量"。两个机制：(1) 用 tanh(EMA 负载) 在一个事先验证过的安全区间里在线微调 exit 阈值——负载高早停、负载低多想；(2) 按题目难度 + 当前负载给每个请求预分一个 token 预算作为硬上限。
- 数字：平均延迟降 17–38%、SLO 达成率 +3–6pp，平均精度代价约 1%（注意是平均，个别 benchmark 掉到约 5pp）；token 压缩 42–80%；突发流量下延迟砍约 22%。
- 诚实声明：系统级数字来自离散事件仿真（单张 RTX 4090、两个 4–7B 小模型），非线上真部署。

### ② EpiKV · KV cache 驱逐 / 推理系统 · 评级：人上人（偏夯）
- **Epiphany-Aware KV Cache Eviction Without the Attention Matrix** — arXiv 2606.26472 · Carnegie Mellon University
- 亮点：现有 KV cache eviction 几乎都按 attention 权重排 token 重要性——信号噪声大，还逼模型物化 n×n attention 矩阵、用不了 FlashAttention。EpiKV 改用 epiphany score：token 前后 residual stream（隐藏状态）的 L2 变化量，直接从前向传播读出，不碰 attention 矩阵、FlashAttention 兼容、免训练。背后有可解释性支撑（中间层与偏上层变化方向相反的两个 band，取差值）。
- 数字：MATH-500、缓存压到 4096 时准确率 72%（H2O 67%），离无损天花板 75% 仅差约 3 点；比最快的 attention 基线快约 1.6×；FlashAttention 让可行上下文从 eager 8192 就 OOM 撑到 65,536 token；缓存极小（1024）时 H2O 崩到 5%，EpiKV 仍站得住。
- 诚实声明：单模型（DeepSeek-R1-Distill-LLaMA-8B）验证；AIME 仅 30 题，作者明确说属方向性证据；主打"近无损省显存/提吞吐"，非宣称精度大涨；部分吞吐数字为投影。

### ③ CLSR · 多智能体 / token economy（探索性） · 评级：人上人
- **When LLMs Develop Languages: Symbolic Communication for Efficient Multi-Agent Reasoning** — arXiv 2606.29354 · 中国科学院计算技术研究所 + 国科大
- 亮点：自然语言 CoT 对机器不是信息密度最高的表达。CLSR 让多个 black-box LLM agent 自主发明、演化、共享一套紧凑符号语言（LSF：符号表+语法+使用规则），离线用 Pareto 准则（先对错、再省 token）一代代进化出一批，在线由一个 latent-free router 按 query 挑选/组合。等于"给机器造方言并让方言优胜劣汰"。
- 数字：保持精度基本不变下生成 token 降 3–6×（约省 3/4）。例：8B 模型 GPQA 从 73.2%/5380 token → 73.1%/1326 token；Qwen3-32B 在 MATH-500 从 845 → 206 token、精度纹丝不动。
- 诚实声明：离线语言进化很贵（8×RTX 4090 跑数天、需带标准答案的样例）；最亮眼的精度数字来自较费 token 的模式，默认 router 模式有时以少量精度换 token。（注：论文文件套用了会议模板，接收与否未独立核实，本节目不据此背书。）

## 📌 引用观察
- **When Is a Draft Accepted? A Theory of Acceptance in Speculative Decoding** — arXiv 2606.30265。给贪心解码 / 放松接受准则 / 树状候选这些实际系统常用、但过去理论没覆盖好的设定，补了一个"草稿何时被接受"的理论刻画。

## 制作元信息
- 文稿：双人对谈（Jeff 主讲系统两篇 + Ada 主讲多智能体一篇并负责质询）。
- 音频：本地 Qwen3-TTS 合成，约 12:09。
- 主持：Jeff（系统）· Ada（算法）。
- 口径：论文数字均据原文，每篇附诚实声明；arXiv 编号不口播、仅留链接。
]]></content:encoded>
      <pubDate>Thu, 02 Jul 2026 00:30:00 GMT</pubDate>
      <guid isPermaLink="false">mlsys-feed-2026-07-02</guid>
      <enclosure url="https://github.com/baihuajun24/baihuajun24.github.io/releases/download/audio-archive/0702-daily-arxiv.mp3" length="6386805" type="audio/mpeg" />
      <itunes:duration>12:09</itunes:duration>
      <itunes:explicit>false</itunes:explicit>
    </item>
    <item>
      <title>0701 MLSYS 论文简报：让 agent 自己管上下文，正确率翻倍</title>
      <description><![CDATA[# 0701 MLSYS 论文简报：让 agent 自己管上下文，正确率翻倍
Audio: 10:07

> 本期从过去几天（06-25→06-30）的论文里合并打分挑出三篇，覆盖 token 经济、serving 系统、agent 上下文三块。
> 音频不口播 arXiv 编号，编号见下方链接。

## 内容时间戳
- 00:00 开场 · 今日三篇导览
- 01:18 ① EntMTP：用 entropy 动态调 multi-token prediction 深度（推理提速 / token 经济）
- 02:48 ② Festina：serverless LLM serving 的能耗优先联合调度（系统 / serving）
- 06:25 ③ VISTA：让 agent 看见并自己管理 context（agent 上下文 / 记忆）
- 09:29 收尾 · 三篇小结

## 本期主讲

### ① EntMTP · 推理提速 / token 经济 · 评级：夯
- **EntMTP: Accelerating LLM Inference with Entropy Guided Multi Token Prediction** — arXiv 2606.27550
- 亮点：现有带 MTP 头的模型把 speculative decoding 的深度写死，与自然语言变化的 entropy 不匹配。EntMTP 是一个 training-free 的 scheduler，按实时 local entropy 在一组 pareto-optimal 的 tree 拓扑间切换——低 entropy 多草拟、高 entropy 保守。
- 数字：相比 Hydra 稳定快约 1.15×，相比 Medusa 峰值 1.36×（Humaneval / ShareGPT / GSM8k / Litbench）。

### ② Festina · serving 系统 / 能耗 · 评级：夯
- **Energy-Aware Scheduling for Serverless LLM Serving on Shared GPUs** — arXiv 2606.30391
- 亮点：serverless serving 让多模型共享 GPU，但也让能耗优化变难。Festina 是 power-aware 的 control plane，做 energy-first 决策，把 request placement、SM partitioning、GPU operating point 三层在 TTFT/TBT SLO 下联合调度（global 查表 + per-GPU phase-aware 本地调度 + SLO-aware migration 合并负载）。
- 数字：对比 4 个 SOTA serving 系统 + 1 个 DVFS，能耗最高降 56%，SLO 达成基本持平（2% 以内）。

### ③ VISTA · agent 上下文 / 记忆 · 评级：夯（接近顶级）
- **LLM Agents Are Latent Context Managers: Eliciting Self-Managed Context via a Proprioceptive Dashboard** — arXiv 2606.30005
- 亮点：长程 tool agent 的瓶颈是 context 顶到上限；论文指出模型对自己的 context 是 "proprioceptively blind"。VISTA 是 training-free、model-agnostic 的一层：把 working memory 表示成有类型、可寻址的 block，给一个显示每块 token 用量 / recency / access history 的 runtime dashboard，并把 block 归档成可完整恢复的 payload——假设是"管理能力本就 latent，缺的是接口"。
- 数字：LOCA-Bench / BrowseComp-Plus / GAIA 上跨百万→十万→一万 token 迁移；LOCA-Bench 上把 Gemini-3-Flash 从 22.7% 提到 50.7%，context 压力越大提升越多，且跨 backbone。ablation 确认 dashboard 本身才是关键。

## 制作元信息
- 文稿：双人对谈（Jeff 主讲系统 + Ada 提问）。
- 音频：本地 Qwen3-TTS 合成，约 10:07。
- 主持：Jeff（系统）· Ada（算法）。
- 口径：论文数字均据原文；arXiv 编号不口播、仅留链接。
]]></description>
      <content:encoded><![CDATA[# 0701 MLSYS 论文简报：让 agent 自己管上下文，正确率翻倍
Audio: 10:07

> 本期从过去几天（06-25→06-30）的论文里合并打分挑出三篇，覆盖 token 经济、serving 系统、agent 上下文三块。
> 音频不口播 arXiv 编号，编号见下方链接。

## 内容时间戳
- 00:00 开场 · 今日三篇导览
- 01:18 ① EntMTP：用 entropy 动态调 multi-token prediction 深度（推理提速 / token 经济）
- 02:48 ② Festina：serverless LLM serving 的能耗优先联合调度（系统 / serving）
- 06:25 ③ VISTA：让 agent 看见并自己管理 context（agent 上下文 / 记忆）
- 09:29 收尾 · 三篇小结

## 本期主讲

### ① EntMTP · 推理提速 / token 经济 · 评级：夯
- **EntMTP: Accelerating LLM Inference with Entropy Guided Multi Token Prediction** — arXiv 2606.27550
- 亮点：现有带 MTP 头的模型把 speculative decoding 的深度写死，与自然语言变化的 entropy 不匹配。EntMTP 是一个 training-free 的 scheduler，按实时 local entropy 在一组 pareto-optimal 的 tree 拓扑间切换——低 entropy 多草拟、高 entropy 保守。
- 数字：相比 Hydra 稳定快约 1.15×，相比 Medusa 峰值 1.36×（Humaneval / ShareGPT / GSM8k / Litbench）。

### ② Festina · serving 系统 / 能耗 · 评级：夯
- **Energy-Aware Scheduling for Serverless LLM Serving on Shared GPUs** — arXiv 2606.30391
- 亮点：serverless serving 让多模型共享 GPU，但也让能耗优化变难。Festina 是 power-aware 的 control plane，做 energy-first 决策，把 request placement、SM partitioning、GPU operating point 三层在 TTFT/TBT SLO 下联合调度（global 查表 + per-GPU phase-aware 本地调度 + SLO-aware migration 合并负载）。
- 数字：对比 4 个 SOTA serving 系统 + 1 个 DVFS，能耗最高降 56%，SLO 达成基本持平（2% 以内）。

### ③ VISTA · agent 上下文 / 记忆 · 评级：夯（接近顶级）
- **LLM Agents Are Latent Context Managers: Eliciting Self-Managed Context via a Proprioceptive Dashboard** — arXiv 2606.30005
- 亮点：长程 tool agent 的瓶颈是 context 顶到上限；论文指出模型对自己的 context 是 "proprioceptively blind"。VISTA 是 training-free、model-agnostic 的一层：把 working memory 表示成有类型、可寻址的 block，给一个显示每块 token 用量 / recency / access history 的 runtime dashboard，并把 block 归档成可完整恢复的 payload——假设是"管理能力本就 latent，缺的是接口"。
- 数字：LOCA-Bench / BrowseComp-Plus / GAIA 上跨百万→十万→一万 token 迁移；LOCA-Bench 上把 Gemini-3-Flash 从 22.7% 提到 50.7%，context 压力越大提升越多，且跨 backbone。ablation 确认 dashboard 本身才是关键。

## 制作元信息
- 文稿：双人对谈（Jeff 主讲系统 + Ada 提问）。
- 音频：本地 Qwen3-TTS 合成，约 10:07。
- 主持：Jeff（系统）· Ada（算法）。
- 口径：论文数字均据原文；arXiv 编号不口播、仅留链接。
]]></content:encoded>
      <pubDate>Wed, 01 Jul 2026 00:30:00 GMT</pubDate>
      <guid isPermaLink="false">mlsys-feed-2026-07-01</guid>
      <enclosure url="https://github.com/baihuajun24/baihuajun24.github.io/releases/download/audio-archive/0701-daily-arxiv.mp3" length="5440773" type="audio/mpeg" />
      <itunes:duration>10:07</itunes:duration>
      <itunes:explicit>false</itunes:explicit>
    </item>
    <item>
      <title>0624 MLSYS 论文简报：JIT 持久内核检查点、学习搜索聚合与自压实 Agent</title>
      <description><![CDATA[# 0624 MLSYS 论文简报：JIT 持久内核检查点、学习搜索聚合与自压实 Agent
Audio: 14:44

## 内容时间戳
- 00:00 开场与导览
- 00:28 第一篇 · Concordia：JIT 编译持久化内核检查点（系统 / 容错推理）
- 05:30 第二篇 · SPIRAL：学习搜索与聚合（test-time scaling 算法）
- 09:11 第三篇 · Self-Compacting Language Model Agents（自压实 Agent，探索方向）
- 12:56 快速提及 · Draft-Agreement Routing、StateKV / Linear Scaling Video VLMs
- 14:13 收尾

## 本期主讲

### 1. systems_champion / Jeff / 夯
- **Concordia: JIT-Compiled Persistent-Kernel Checkpointing** (arxiv:2606.23521)
- 机构：待确认
- 亮点：JIT 编译持久化内核检查点，系统侧 serving/推理优化。
- Link: https://arxiv.org/abs/2606.23521

### 2. algorithm_champion / Ada / 夯
- **SPIRAL: Learning to Search and Aggregate** (arxiv:2606.23595)
- 机构：待确认
- 亮点：学习搜索与聚合，agent/算法侧。
- Link: https://arxiv.org/abs/2606.23595

### 3. exploratory_champion / Ada / 夯
- **Self-Compacting Language Model Agents** (arxiv:2606.23525)
- 机构：待确认
- 亮点：自压实语言模型 agent，探索性方向。
- Link: https://arxiv.org/abs/2606.23525

## 快速提及
- **Draft-Agreement Routing for Training-Free Speculative Decoding** — 免训练的投机解码草稿一致性路由，推理加速方向。
- **StateKV: Linear Scaling Video VLMs for Long Video Understanding** — 面向长视频理解、对 KV 状态做线性扩展压缩的 VLM。

## 制作元信息
- 论文召回：24h 窗口，286 fresh → 37 judged → 本期主讲 3 篇。
- Judge：gemini-3.5-flash（新方向 profile：token economy + 大小模型协同 + 多智能体，弱化 RL）。
- 卡片：glm-5.2（3/3 一次成功，html/pdf provenance）。
- 脚本：gemini-3.5-flash，32 turns。
- TTS：本地离线合成（Mac M4 Pro）。中文主播用 Higgs Audio v2（克隆音色）Jeff=`dylan` / Ada=`vivian`；英文论文标题改由专属英文音色 Qwen3-TTS `ryan` 朗读；语速约 279 字/分；arXiv 编号不口播，仅保留 ShowNotes 链接。

## 本期工作流改进
- 新方向 profile 持续生效（token economy / 大小模型协同 / 多智能体，弱化 RL）。
- digest + 播客候选合并为一文件推送（不再分两次 Feishu）。
- 自动排除历史 champion + special 已讲论文（本期 3 篇均无重复）。
- 音频改为本地离线合成（Higgs v2 + Qwen3-TTS 混音色）：中文主播 + 英文标题专属音色；arXiv 编号从口播移除、仅留 ShowNotes 链接。
]]></description>
      <content:encoded><![CDATA[# 0624 MLSYS 论文简报：JIT 持久内核检查点、学习搜索聚合与自压实 Agent
Audio: 14:44

## 内容时间戳
- 00:00 开场与导览
- 00:28 第一篇 · Concordia：JIT 编译持久化内核检查点（系统 / 容错推理）
- 05:30 第二篇 · SPIRAL：学习搜索与聚合（test-time scaling 算法）
- 09:11 第三篇 · Self-Compacting Language Model Agents（自压实 Agent，探索方向）
- 12:56 快速提及 · Draft-Agreement Routing、StateKV / Linear Scaling Video VLMs
- 14:13 收尾

## 本期主讲

### 1. systems_champion / Jeff / 夯
- **Concordia: JIT-Compiled Persistent-Kernel Checkpointing** (arxiv:2606.23521)
- 机构：待确认
- 亮点：JIT 编译持久化内核检查点，系统侧 serving/推理优化。
- Link: https://arxiv.org/abs/2606.23521

### 2. algorithm_champion / Ada / 夯
- **SPIRAL: Learning to Search and Aggregate** (arxiv:2606.23595)
- 机构：待确认
- 亮点：学习搜索与聚合，agent/算法侧。
- Link: https://arxiv.org/abs/2606.23595

### 3. exploratory_champion / Ada / 夯
- **Self-Compacting Language Model Agents** (arxiv:2606.23525)
- 机构：待确认
- 亮点：自压实语言模型 agent，探索性方向。
- Link: https://arxiv.org/abs/2606.23525

## 快速提及
- **Draft-Agreement Routing for Training-Free Speculative Decoding** — 免训练的投机解码草稿一致性路由，推理加速方向。
- **StateKV: Linear Scaling Video VLMs for Long Video Understanding** — 面向长视频理解、对 KV 状态做线性扩展压缩的 VLM。

## 制作元信息
- 论文召回：24h 窗口，286 fresh → 37 judged → 本期主讲 3 篇。
- Judge：gemini-3.5-flash（新方向 profile：token economy + 大小模型协同 + 多智能体，弱化 RL）。
- 卡片：glm-5.2（3/3 一次成功，html/pdf provenance）。
- 脚本：gemini-3.5-flash，32 turns。
- TTS：本地离线合成（Mac M4 Pro）。中文主播用 Higgs Audio v2（克隆音色）Jeff=`dylan` / Ada=`vivian`；英文论文标题改由专属英文音色 Qwen3-TTS `ryan` 朗读；语速约 279 字/分；arXiv 编号不口播，仅保留 ShowNotes 链接。

## 本期工作流改进
- 新方向 profile 持续生效（token economy / 大小模型协同 / 多智能体，弱化 RL）。
- digest + 播客候选合并为一文件推送（不再分两次 Feishu）。
- 自动排除历史 champion + special 已讲论文（本期 3 篇均无重复）。
- 音频改为本地离线合成（Higgs v2 + Qwen3-TTS 混音色）：中文主播 + 英文标题专属音色；arXiv 编号从口播移除、仅留 ShowNotes 链接。
]]></content:encoded>
      <pubDate>Wed, 24 Jun 2026 00:30:00 GMT</pubDate>
      <guid isPermaLink="false">mlsys-feed-2026-06-24</guid>
      <enclosure url="https://github.com/baihuajun24/baihuajun24.github.io/releases/download/audio-archive/0624-daily-arxiv.mp3" length="7435533" type="audio/mpeg" />
      <itunes:duration>14:44</itunes:duration>
      <itunes:explicit>false</itunes:explicit>
    </item>
    <item>
      <title>0623 MLSYS 论文简报：执行态检查点、token 级解耦与 agent 4-bit KV 缓存</title>
      <description><![CDATA[# 0623 MLSYS 论文简报：执行态检查点、token 级解耦与 agent 4-bit KV 缓存
Audio: 11:21

> 基于 2026-06-22 晚间完成的 arXiv 论文召回与筛选；音频不朗读链接。

## 内容时间戳
- 00:00 开场 · 0623 MLSYS 论文简报
- 00:26 ① Execution-State Capsules：图绑定执行态检查点与恢复（系统 / 低延迟设备端推理）
- 04:09 ② ADaPT：面向高效大推理模型的 token 级解耦（算法 / 推理开销）
- 07:12 ③ UltraQuant：长上下文 agent 的 4-bit KV 缓存（算法 + 系统，探索方向）
- 11:00 收尾 · 三篇小结与阅读优先级

## 本期主讲

### ① Execution-State Capsules · 系统 · 评级：夯（Jeff champion）
- **Execution-State Capsules: Graph-Bound Execution-State Checkpoint and Restore for Low-Latency, Small-Batch, On-Device Physical-AI Serving** — arXiv 2606.20537
- 亮点：系统方向最佳论文，提出一种图绑定的执行态检查点与恢复机制，面向低延迟、小批量、设备端的 Physical-AI serving。

### ② ADaPT · 算法 · 评级：顶级（Ada champion）
- **ADaPT: Token-Level Decoupling for Efficient Large Reasoning Models** — arXiv 2606.19919
- 亮点：直指大推理模型（如 o1 / DeepSeek-R1）的推理开销问题，做 token 级解耦以提效。

### ③ UltraQuant · 算法 + 系统（探索） · 评级：夯（Jeff champion）
- **UltraQuant: 4-bit KV Caching for Context-Heavy Agents** — arXiv 2606.20474
- 亮点：长上下文 agent 场景下的 4-bit KV cache，算法与系统结合得很好，是当前竞争激烈的方向。

## 制作元信息
- 文稿：双人对谈（Jeff 系统 · Ada 算法）。
- 音频：本地 Qwen3-TTS（mlx-audio）合成，约 11:21。
- 主持：Jeff（voice `ryan`）· Ada（voice `vivian`）。
- 口径：arXiv 编号不口播、仅留链接。
]]></description>
      <content:encoded><![CDATA[# 0623 MLSYS 论文简报：执行态检查点、token 级解耦与 agent 4-bit KV 缓存
Audio: 11:21

> 基于 2026-06-22 晚间完成的 arXiv 论文召回与筛选；音频不朗读链接。

## 内容时间戳
- 00:00 开场 · 0623 MLSYS 论文简报
- 00:26 ① Execution-State Capsules：图绑定执行态检查点与恢复（系统 / 低延迟设备端推理）
- 04:09 ② ADaPT：面向高效大推理模型的 token 级解耦（算法 / 推理开销）
- 07:12 ③ UltraQuant：长上下文 agent 的 4-bit KV 缓存（算法 + 系统，探索方向）
- 11:00 收尾 · 三篇小结与阅读优先级

## 本期主讲

### ① Execution-State Capsules · 系统 · 评级：夯（Jeff champion）
- **Execution-State Capsules: Graph-Bound Execution-State Checkpoint and Restore for Low-Latency, Small-Batch, On-Device Physical-AI Serving** — arXiv 2606.20537
- 亮点：系统方向最佳论文，提出一种图绑定的执行态检查点与恢复机制，面向低延迟、小批量、设备端的 Physical-AI serving。

### ② ADaPT · 算法 · 评级：顶级（Ada champion）
- **ADaPT: Token-Level Decoupling for Efficient Large Reasoning Models** — arXiv 2606.19919
- 亮点：直指大推理模型（如 o1 / DeepSeek-R1）的推理开销问题，做 token 级解耦以提效。

### ③ UltraQuant · 算法 + 系统（探索） · 评级：夯（Jeff champion）
- **UltraQuant: 4-bit KV Caching for Context-Heavy Agents** — arXiv 2606.20474
- 亮点：长上下文 agent 场景下的 4-bit KV cache，算法与系统结合得很好，是当前竞争激烈的方向。

## 制作元信息
- 文稿：双人对谈（Jeff 系统 · Ada 算法）。
- 音频：本地 Qwen3-TTS（mlx-audio）合成，约 11:21。
- 主持：Jeff（voice `ryan`）· Ada（voice `vivian`）。
- 口径：arXiv 编号不口播、仅留链接。
]]></content:encoded>
      <pubDate>Tue, 23 Jun 2026 00:30:00 GMT</pubDate>
      <guid isPermaLink="false">mlsys-feed-2026-06-23</guid>
      <enclosure url="https://github.com/baihuajun24/baihuajun24.github.io/releases/download/audio-archive/0623-daily-arxiv.mp3" length="6660141" type="audio/mpeg" />
      <itunes:duration>11:21</itunes:duration>
      <itunes:explicit>false</itunes:explicit>
    </item>
    <item>
      <title>0620 MLSYS 论文简报：CXL 稀疏 KV 池、RL 乘性信用分配与对抗式深度研究智能体</title>
      <description><![CDATA[# 0620 MLSYS 论文简报：CXL 稀疏 KV 池、RL 乘性信用分配与对抗式深度研究智能体
Audio: 15:04
## 内容时间戳
- 00:00 Opening: 0620 MLSYS 论文简报
  - 基于 2026-06-19 晚间完成的 arXiv 论文召回与筛选；音频不朗读链接。
- 00:37 SAC: Disaggregated KV Cache System for Sparse Attention LLMs with CXL
  - 夯到拉评价：顶级（Jeff champion）
  - 亮点：没错，今天我要重点推荐的第一篇系统方向论文叫做 SAC: Disaggregated KV Cache System for Sparse Attention LLMs with CXL。这篇论文针对的是一个非常切中痛点的问题。
  - Link: https://arxiv.org/abs/2606.19746

- 04:59 Learning from Own Solutions: Self-Conditioned Credit Assignment for Reinforcement Learning with Verifiable Rewards
  - 夯到拉评价：顶级（Ada champion）
  - 亮点：我今天挑出的算法 champion 论文标题是 Learning from Own Solutions: Self-Conditioned Credit Assignment for Reinforcement Learning with Verifiable Rewards。这篇工作聚焦在可验证奖励强化学习，也就是 RLVR 场景下的信用分配问题。
  - Link: https://arxiv.org/abs/2606.18810

- 08:59 MetaResearcher: Scaling Deep Research via Self-Reflective Reinforcement Learning in Adversarial Virtual Environments
  - 夯到拉评价：夯（Ada champion）
  - 亮点：这篇论文叫 MetaResearcher: Scaling Deep Research via Self-Reflective Reinforcement Learning in Adversarial Virtual Environments。之前有一个叫 LiteResearcher 的系统，仅仅用四B参数的模型在 GAIA 评测上就拿到了 71.3%，超越了 GPT-4o。
  - Link: https://arxiv.org/abs/2606.19893

- 14:34 Wrap-up
  - 总结本期重点论文和后续阅读优先级。

## 制作元信息
- 论文召回：原始 JSONL 记录 273 篇；新论文 273 篇；带入 backlog 10 篇。
- 筛选链路：新候选 215 篇；backlog 候选 23 篇；粗排 238 篇；LLM 精评 38 篇；本期播客主讲 3 篇；快速提及 3 篇。
- LLM：gemini-3.5-flash；input 7811 tokens，output 3136 tokens，总计 10947 tokens。
- TTS：seed-tts-2.0；Jeff voice `zh_male_m191_uranus_bigtts`，Ada voice `zh_female_vv_uranus_bigtts`；43 turns，输入 5259 字符，计费文本 5259 words。

## 本期工作流改进
- 等 arXiv 当日批次：晨跑 24h 窗口返回 0 篇（arXiv 06-17 后无新公告），等到 06-18 批次上线后 24h 抓到 273 篇，避免产出过期选题。
- 修复脚本生成 null-crash：_generate_script_openai_native 现按 llm_judge 同款 null-safe + glm-5.2 fallback（gemini reasoning 耗尽 9000 预算返回 message:null 时不再崩溃）。
- 卡片改用 glm-5.2（3/3 一次成功，html provenance），脚本用 gemini-3.5-flash（长文完成度更好）。
]]></description>
      <content:encoded><![CDATA[# 0620 MLSYS 论文简报：CXL 稀疏 KV 池、RL 乘性信用分配与对抗式深度研究智能体
Audio: 15:04
## 内容时间戳
- 00:00 Opening: 0620 MLSYS 论文简报
  - 基于 2026-06-19 晚间完成的 arXiv 论文召回与筛选；音频不朗读链接。
- 00:37 SAC: Disaggregated KV Cache System for Sparse Attention LLMs with CXL
  - 夯到拉评价：顶级（Jeff champion）
  - 亮点：没错，今天我要重点推荐的第一篇系统方向论文叫做 SAC: Disaggregated KV Cache System for Sparse Attention LLMs with CXL。这篇论文针对的是一个非常切中痛点的问题。
  - Link: https://arxiv.org/abs/2606.19746

- 04:59 Learning from Own Solutions: Self-Conditioned Credit Assignment for Reinforcement Learning with Verifiable Rewards
  - 夯到拉评价：顶级（Ada champion）
  - 亮点：我今天挑出的算法 champion 论文标题是 Learning from Own Solutions: Self-Conditioned Credit Assignment for Reinforcement Learning with Verifiable Rewards。这篇工作聚焦在可验证奖励强化学习，也就是 RLVR 场景下的信用分配问题。
  - Link: https://arxiv.org/abs/2606.18810

- 08:59 MetaResearcher: Scaling Deep Research via Self-Reflective Reinforcement Learning in Adversarial Virtual Environments
  - 夯到拉评价：夯（Ada champion）
  - 亮点：这篇论文叫 MetaResearcher: Scaling Deep Research via Self-Reflective Reinforcement Learning in Adversarial Virtual Environments。之前有一个叫 LiteResearcher 的系统，仅仅用四B参数的模型在 GAIA 评测上就拿到了 71.3%，超越了 GPT-4o。
  - Link: https://arxiv.org/abs/2606.19893

- 14:34 Wrap-up
  - 总结本期重点论文和后续阅读优先级。

## 制作元信息
- 论文召回：原始 JSONL 记录 273 篇；新论文 273 篇；带入 backlog 10 篇。
- 筛选链路：新候选 215 篇；backlog 候选 23 篇；粗排 238 篇；LLM 精评 38 篇；本期播客主讲 3 篇；快速提及 3 篇。
- LLM：gemini-3.5-flash；input 7811 tokens，output 3136 tokens，总计 10947 tokens。
- TTS：seed-tts-2.0；Jeff voice `zh_male_m191_uranus_bigtts`，Ada voice `zh_female_vv_uranus_bigtts`；43 turns，输入 5259 字符，计费文本 5259 words。

## 本期工作流改进
- 等 arXiv 当日批次：晨跑 24h 窗口返回 0 篇（arXiv 06-17 后无新公告），等到 06-18 批次上线后 24h 抓到 273 篇，避免产出过期选题。
- 修复脚本生成 null-crash：_generate_script_openai_native 现按 llm_judge 同款 null-safe + glm-5.2 fallback（gemini reasoning 耗尽 9000 预算返回 message:null 时不再崩溃）。
- 卡片改用 glm-5.2（3/3 一次成功，html provenance），脚本用 gemini-3.5-flash（长文完成度更好）。
]]></content:encoded>
      <pubDate>Sat, 20 Jun 2026 00:30:00 GMT</pubDate>
      <guid isPermaLink="false">mlsys-feed-2026-06-20</guid>
      <enclosure url="https://github.com/baihuajun24/baihuajun24.github.io/releases/download/audio-archive/0620-daily-arxiv.mp3" length="14480685" type="audio/mpeg" />
      <itunes:duration>15:05</itunes:duration>
      <itunes:explicit>false</itunes:explicit>
    </item>
    <item>
      <title>0619 MLSYS 论文简报：RL Rollout 投机解码、NPU 推理延迟预测与并行树状草稿</title>
      <description><![CDATA[# 0619 MLSYS 论文简报：RL Rollout 投机解码、NPU 推理延迟预测与并行树状草稿
Audio: 10:01
## 内容时间戳
- 00:00 Opening: 0619 MLSYS 论文简报
  - 基于 2026-06-18 晚间完成的 arXiv 论文召回与筛选；音频不朗读链接。
- 00:25 EfficientRollout: System-Aware Self-Speculative Decoding for RL Rollouts
  - 夯到拉评价：夯（Jeff champion）
  - 亮点：这篇论文叫 EfficientRollout: System-Aware Self-Speculative Decoding for RL Rollouts，来自飞瑞傲 AI。它直击了目前大语言模型强化学习训练中最大的痛点，也就是 Rollout 阶段的延迟。
  - Link: https://arxiv.org/abs/2606.18967

- 03:40 Latency Prediction for LLM Inference on NPU Systems
  - 夯到拉评价：顶级（Ada champion）
  - 亮点：我要分享的第二篇论文叫 Latency Prediction for LLM Inference on NPU Systems。 现在的 LLM 部署在 GPU 之外，确实越来越多地采用 NPU 了。
  - Link: https://arxiv.org/abs/2606.18042

- 06:15 JetFlow: Breaking the Scaling Ceiling of Speculative Decoding with Parallel Tree Drafting
  - 夯到拉评价：夯（Jeff champion）
  - 亮点：既然聊到推理加速，那我们再来看第三篇探索性的工作：JetFlow: Breaking the Scaling Ceiling of Speculative Decoding with Parallel Tree Drafting，来自加州大学圣迭戈分校郝张老师的团队。 郝张老师团队在投机解码上的工作一直很受关注。
  - Link: https://arxiv.org/abs/2606.18394

- 09:31 Wrap-up
  - 总结本期重点论文和后续阅读优先级。

## 制作元信息
- 论文召回：原始 JSONL 记录 434 篇；新论文 434 篇；带入 backlog 10 篇。
- 筛选链路：新候选 361 篇；backlog 候选 28 篇；粗排 389 篇；LLM 精评 24 篇；本期播客主讲 3 篇；快速提及 4 篇。
- LLM：gemini-3.5-flash；input 8748 tokens，output 2123 tokens，总计 10871 tokens。
- TTS：seed-tts-2.0；Jeff voice `zh_male_m191_uranus_bigtts`，Ada voice `zh_female_vv_uranus_bigtts`；32 turns，输入 3663 字符，计费文本 3663 words。

## 本期工作流改进
- 96h catch-up 窗口：上次 digest 06-15，本次跨周末补抓 434 篇新论文。
- 修复 gemini judge：null-message（reasoning 耗尽 max_tokens）现 fallback 到 glm-5.2；shared-AppId 20 RPM 改 15 RPM + 15s/30s 429 退避。
- 算法主讲位经 PI review 由 ZPPO 换为 Latency Prediction (NPU/LENS)；LENS 卡片因 gemini 间歇 JSON 解析失败，重抽得到 html 级 grounding。
]]></description>
      <content:encoded><![CDATA[# 0619 MLSYS 论文简报：RL Rollout 投机解码、NPU 推理延迟预测与并行树状草稿
Audio: 10:01
## 内容时间戳
- 00:00 Opening: 0619 MLSYS 论文简报
  - 基于 2026-06-18 晚间完成的 arXiv 论文召回与筛选；音频不朗读链接。
- 00:25 EfficientRollout: System-Aware Self-Speculative Decoding for RL Rollouts
  - 夯到拉评价：夯（Jeff champion）
  - 亮点：这篇论文叫 EfficientRollout: System-Aware Self-Speculative Decoding for RL Rollouts，来自飞瑞傲 AI。它直击了目前大语言模型强化学习训练中最大的痛点，也就是 Rollout 阶段的延迟。
  - Link: https://arxiv.org/abs/2606.18967

- 03:40 Latency Prediction for LLM Inference on NPU Systems
  - 夯到拉评价：顶级（Ada champion）
  - 亮点：我要分享的第二篇论文叫 Latency Prediction for LLM Inference on NPU Systems。 现在的 LLM 部署在 GPU 之外，确实越来越多地采用 NPU 了。
  - Link: https://arxiv.org/abs/2606.18042

- 06:15 JetFlow: Breaking the Scaling Ceiling of Speculative Decoding with Parallel Tree Drafting
  - 夯到拉评价：夯（Jeff champion）
  - 亮点：既然聊到推理加速，那我们再来看第三篇探索性的工作：JetFlow: Breaking the Scaling Ceiling of Speculative Decoding with Parallel Tree Drafting，来自加州大学圣迭戈分校郝张老师的团队。 郝张老师团队在投机解码上的工作一直很受关注。
  - Link: https://arxiv.org/abs/2606.18394

- 09:31 Wrap-up
  - 总结本期重点论文和后续阅读优先级。

## 制作元信息
- 论文召回：原始 JSONL 记录 434 篇；新论文 434 篇；带入 backlog 10 篇。
- 筛选链路：新候选 361 篇；backlog 候选 28 篇；粗排 389 篇；LLM 精评 24 篇；本期播客主讲 3 篇；快速提及 4 篇。
- LLM：gemini-3.5-flash；input 8748 tokens，output 2123 tokens，总计 10871 tokens。
- TTS：seed-tts-2.0；Jeff voice `zh_male_m191_uranus_bigtts`，Ada voice `zh_female_vv_uranus_bigtts`；32 turns，输入 3663 字符，计费文本 3663 words。

## 本期工作流改进
- 96h catch-up 窗口：上次 digest 06-15，本次跨周末补抓 434 篇新论文。
- 修复 gemini judge：null-message（reasoning 耗尽 max_tokens）现 fallback 到 glm-5.2；shared-AppId 20 RPM 改 15 RPM + 15s/30s 429 退避。
- 算法主讲位经 PI review 由 ZPPO 换为 Latency Prediction (NPU/LENS)；LENS 卡片因 gemini 间歇 JSON 解析失败，重抽得到 html 级 grounding。
]]></content:encoded>
      <pubDate>Fri, 19 Jun 2026 00:30:00 GMT</pubDate>
      <guid isPermaLink="false">mlsys-feed-2026-06-19</guid>
      <enclosure url="https://github.com/baihuajun24/baihuajun24.github.io/releases/download/audio-archive/0619-daily-arxiv.mp3" length="9626541" type="audio/mpeg" />
      <itunes:duration>10:01</itunes:duration>
      <itunes:explicit>false</itunes:explicit>
    </item>
    <item>
      <title>0617 MLSYS 论文简报：编码 Agent 的 KV 缓存管理、Agent 上下文缓存压缩、可迁移技能树搜索</title>
      <description><![CDATA[# 0617 MLSYS 论文简报：编码 Agent 的 KV 缓存管理、Agent 上下文缓存压缩、可迁移技能树搜索
Audio: 13:31

## 内容时间戳
- 00:00 开场
  - 基于 2026-06-16 晚间完成的 arXiv 论文召回与筛选；音频不朗读链接。
- 00:34 CacheWise: Understanding Workloads and Optimizing KVCache Management for Efficiently Serving LLM Coding Agents
  - 机构：华盛顿大学、弗吉尼亚大学
  - 夯到拉评价：人上人（Jeff 主讲）
  - 亮点：编码 Agent 是长程闭环会话，prefill/decode 比例约 21 倍、KV 缓存压力大；传统先来先服务 + LRU 会在等工具返回的间隙误删缓存，导致抖动重算。CacheWise 在 vLLM 上做前缀感知调度 + 复用感知驱逐（用工具调用元数据做轻量预测），KVCache 驱逐次数降 2.0–2.6 倍、会话完成时间快约 3.5 倍。
  - Link: https://arxiv.org/abs/2606.16824

- 05:23 TokenPilot: Cache-Efficient Context Management for LLM Agents
  - 机构：浙江大学、HomologyAI
  - 夯到拉评价：人上人（Ada 主讲）
  - 亮点：长程 Agent 上下文不断累积推高推理成本，但文本裁剪 / 记忆驱逐会打乱布局、造成前缀失配与缓存失效。TokenPilot 用双粒度管理——全局 Ingestion-Aware Compaction 稳定前缀、本地 Lifecycle-Aware Eviction 按任务相关性过期再卸载，成本降约 56%–87% 且性能基本不掉。
  - Link: https://arxiv.org/abs/2606.17016

- 09:23 OpenClaw-Skill: Collective Skill Tree Search for Agentic Large Language Models
  - 机构：香港理工大学、南洋理工大学
  - 夯到拉评价：顶级（Ada 主讲，探索性）
  - 亮点：Agent 学到的技能换个底座常常失效。提出 Collective Skill Tree Search（CSTS）：用多模型协同生成多样候选技能、再由多模型按质量与跨模型迁移性评分筛选，自动构造结构化、可迁移、可复用的技能树。（论文正文未给出可核实的量化结果，本期只讲思路。）
  - Link: https://arxiv.org/abs/2606.16774

- 快速提及：Skill-to-LoRA（把技能提示词换成可动态加载的 LoRA 适配器省 token）、KVEraser（学习引导 KV cache）、Context-Aware RL for Agentic and Multimodal LLMs、SpInfer（香港科技大学，稀疏 GEMM 推理）。
- 13:01 收尾
  - 总结本期重点与后续阅读优先级。

## 制作元信息
- 论文召回：原始 JSONL 记录 281 篇；新论文 281 篇；带入 backlog 10 篇。
- 筛选链路：新候选 219 篇；backlog 候选 24 篇；粗排 243 篇；LLM 精评 40 篇；本期播客主讲 3 篇；快速提及若干。
- LLM（脚本）：gemini-3.5-flash；input 8767 tokens，output 2807 tokens，总计 11574 tokens。
- TTS：seed-tts-2.0（doubao-ws-v3）；Jeff voice `zh_male_m191_uranus_bigtts`，Ada voice `zh_female_vv_uranus_bigtts`；49 turns，4565 字符；自然语速、未做 atempo。

## 本期工作流改进
- 走完整的 PI 候选 review gate：把数字接地性写进候选清单（CacheWise 有正文数字，ExpRL / OpenClaw 正文截断无数字），PI 据此把 Ada 的算法主讲从 ExpRL 换成正文有 56%–87% 成本数字、更扎实的 TokenPilot。
- 首次用本会话新落地的可复用工具 `post-xiaoyuzhou/tools/pin_episode_plan.py` + `gen_episode_script.py`（pins.json 驱动）把 PI 钦定阵容固定进 plan、再就地生成脚本，避免 `--plan-only/--script-only` 重建覆盖钦定。
- 排重：Harness-1、SWITCH 因 0616 已讲，本期不再讲。
]]></description>
      <content:encoded><![CDATA[# 0617 MLSYS 论文简报：编码 Agent 的 KV 缓存管理、Agent 上下文缓存压缩、可迁移技能树搜索
Audio: 13:31

## 内容时间戳
- 00:00 开场
  - 基于 2026-06-16 晚间完成的 arXiv 论文召回与筛选；音频不朗读链接。
- 00:34 CacheWise: Understanding Workloads and Optimizing KVCache Management for Efficiently Serving LLM Coding Agents
  - 机构：华盛顿大学、弗吉尼亚大学
  - 夯到拉评价：人上人（Jeff 主讲）
  - 亮点：编码 Agent 是长程闭环会话，prefill/decode 比例约 21 倍、KV 缓存压力大；传统先来先服务 + LRU 会在等工具返回的间隙误删缓存，导致抖动重算。CacheWise 在 vLLM 上做前缀感知调度 + 复用感知驱逐（用工具调用元数据做轻量预测），KVCache 驱逐次数降 2.0–2.6 倍、会话完成时间快约 3.5 倍。
  - Link: https://arxiv.org/abs/2606.16824

- 05:23 TokenPilot: Cache-Efficient Context Management for LLM Agents
  - 机构：浙江大学、HomologyAI
  - 夯到拉评价：人上人（Ada 主讲）
  - 亮点：长程 Agent 上下文不断累积推高推理成本，但文本裁剪 / 记忆驱逐会打乱布局、造成前缀失配与缓存失效。TokenPilot 用双粒度管理——全局 Ingestion-Aware Compaction 稳定前缀、本地 Lifecycle-Aware Eviction 按任务相关性过期再卸载，成本降约 56%–87% 且性能基本不掉。
  - Link: https://arxiv.org/abs/2606.17016

- 09:23 OpenClaw-Skill: Collective Skill Tree Search for Agentic Large Language Models
  - 机构：香港理工大学、南洋理工大学
  - 夯到拉评价：顶级（Ada 主讲，探索性）
  - 亮点：Agent 学到的技能换个底座常常失效。提出 Collective Skill Tree Search（CSTS）：用多模型协同生成多样候选技能、再由多模型按质量与跨模型迁移性评分筛选，自动构造结构化、可迁移、可复用的技能树。（论文正文未给出可核实的量化结果，本期只讲思路。）
  - Link: https://arxiv.org/abs/2606.16774

- 快速提及：Skill-to-LoRA（把技能提示词换成可动态加载的 LoRA 适配器省 token）、KVEraser（学习引导 KV cache）、Context-Aware RL for Agentic and Multimodal LLMs、SpInfer（香港科技大学，稀疏 GEMM 推理）。
- 13:01 收尾
  - 总结本期重点与后续阅读优先级。

## 制作元信息
- 论文召回：原始 JSONL 记录 281 篇；新论文 281 篇；带入 backlog 10 篇。
- 筛选链路：新候选 219 篇；backlog 候选 24 篇；粗排 243 篇；LLM 精评 40 篇；本期播客主讲 3 篇；快速提及若干。
- LLM（脚本）：gemini-3.5-flash；input 8767 tokens，output 2807 tokens，总计 11574 tokens。
- TTS：seed-tts-2.0（doubao-ws-v3）；Jeff voice `zh_male_m191_uranus_bigtts`，Ada voice `zh_female_vv_uranus_bigtts`；49 turns，4565 字符；自然语速、未做 atempo。

## 本期工作流改进
- 走完整的 PI 候选 review gate：把数字接地性写进候选清单（CacheWise 有正文数字，ExpRL / OpenClaw 正文截断无数字），PI 据此把 Ada 的算法主讲从 ExpRL 换成正文有 56%–87% 成本数字、更扎实的 TokenPilot。
- 首次用本会话新落地的可复用工具 `post-xiaoyuzhou/tools/pin_episode_plan.py` + `gen_episode_script.py`（pins.json 驱动）把 PI 钦定阵容固定进 plan、再就地生成脚本，避免 `--plan-only/--script-only` 重建覆盖钦定。
- 排重：Harness-1、SWITCH 因 0616 已讲，本期不再讲。
]]></content:encoded>
      <pubDate>Tue, 17 Jun 2026 00:30:00 GMT</pubDate>
      <guid isPermaLink="false">mlsys-feed-2026-06-17</guid>
      <enclosure url="https://github.com/baihuajun24/baihuajun24.github.io/releases/download/audio-archive/0617-daily-arxiv.mp3" length="12982316" type="audio/mpeg" />
      <itunes:duration>13:31</itunes:duration>
      <itunes:explicit>false</itunes:explicit>
    </item>
    <item>
      <title>0616 MLSYS 论文简报：并行 KV 合成、隐状态推理、Agent 状态外置</title>
      <description><![CDATA[# 0616 MLSYS 论文简报：并行 KV 合成、隐状态推理、Agent 状态外置
Audio: 11:53
## 内容时间戳
- 00:00 Opening: 0616 MLSYS 论文简报
  - 基于 2026-06-15 晚间完成的 arXiv 论文召回与筛选；音频不朗读链接。
- 00:24 Towards Direct Latent-Space Synthesis for Parallel Branches in LLM-Agent Workflows
  - 机构：佐治亚理工学院、Meta
  - 夯到拉评价：顶级（Jeff champion）
  - 亮点：并行 Agent 工作流里，让合成器直接消费各分支 worker 的 KV Cache（Cache Mapper 对齐 + Synthesizer LoRA），免去文本重拼与重复 Prefill；9 个下游数据集中 7 个达到或超过文本拼接基线，首字延迟（TTFT）降低 2.5–11×。约束：所有 worker 与合成器需共享同一自回归骨干，跨模型暂不适用。
  - Link: https://arxiv.org/abs/2606.14672

- 04:05 Demystifying Hidden-State Recurrence: Switchable Latent Reasoning with On-Policy Reinforcement Learning (SWITCH)
  - 机构：香港科技大学（广州）、剑桥大学
  - 夯到拉评价：顶级（Ada champion）
  - 亮点：用一对显式边界 token `<swi>`/`</swi>` 把隐状态推理显式切出来，既让标准 on-policy RL（GRPO）在文本位置上可定义概率、又为机制分析提供离散锚点；MATH-500 上比同规模最强 Coconut 式基线高 25.7 个百分点，GRPO 后隐式推理调用率减半且准确率再 +12.6 个百分点。
  - Link: https://arxiv.org/abs/2606.13106

- 08:09 Harness-1: Reinforcement Learning for Search Agents with State-Externalizing Harnesses
  - 机构：伊利诺伊大学厄巴纳-香槟分校、UC Berkeley
  - 夯到拉评价：人上人（Ada champion）
  - 亮点：把候选池管理、去重、状态摘要、证据整理等"机械记账"从策略剥离、卸到环境侧 harness，让 RL 只学"搜什么、留什么、何时停"的语义决策——关注点分离换样本效率。（注：本期卡片取自摘要，正文具体数字未核实，节目中未作事实陈述。）
  - Link: https://arxiv.org/abs/2606.02373

- 11:23 Wrap-up
  - 三篇共同主题：重新切分"策略该做什么、环境/接口该做什么"——KV 接口聚合、边界 token 显式化、状态记账外置。
  - 快速提及：AdaSR（东方理工高等研究院（宁波）、上海交通大学），用层次化相对策略优化 HRPO 在流式/部分观测下动态分配推理算力、管理延迟。https://arxiv.org/abs/2606.14694

## 制作元信息
- 论文召回：原始 JSONL 记录 141 篇；新论文 141 篇；带入 backlog 10 篇。
- 筛选链路：新候选 105 篇；backlog 候选 15 篇；粗排 120 篇；LLM 精评 40 篇；本期播客主讲 3 篇；快速提及 1 篇。
- LLM：aws.claude-opus-4.7；input 13401 tokens，output 4249 tokens，总计 17650 tokens。
- TTS：seed-tts-2.0；Jeff voice `zh_male_m191_uranus_bigtts`，Ada voice `zh_female_vv_uranus_bigtts`；38 turns，输入 4499 字符，计费文本 4340 words。
]]></description>
      <content:encoded><![CDATA[# 0616 MLSYS 论文简报：并行 KV 合成、隐状态推理、Agent 状态外置
Audio: 11:53
## 内容时间戳
- 00:00 Opening: 0616 MLSYS 论文简报
  - 基于 2026-06-15 晚间完成的 arXiv 论文召回与筛选；音频不朗读链接。
- 00:24 Towards Direct Latent-Space Synthesis for Parallel Branches in LLM-Agent Workflows
  - 机构：佐治亚理工学院、Meta
  - 夯到拉评价：顶级（Jeff champion）
  - 亮点：并行 Agent 工作流里，让合成器直接消费各分支 worker 的 KV Cache（Cache Mapper 对齐 + Synthesizer LoRA），免去文本重拼与重复 Prefill；9 个下游数据集中 7 个达到或超过文本拼接基线，首字延迟（TTFT）降低 2.5–11×。约束：所有 worker 与合成器需共享同一自回归骨干，跨模型暂不适用。
  - Link: https://arxiv.org/abs/2606.14672

- 04:05 Demystifying Hidden-State Recurrence: Switchable Latent Reasoning with On-Policy Reinforcement Learning (SWITCH)
  - 机构：香港科技大学（广州）、剑桥大学
  - 夯到拉评价：顶级（Ada champion）
  - 亮点：用一对显式边界 token `<swi>`/`</swi>` 把隐状态推理显式切出来，既让标准 on-policy RL（GRPO）在文本位置上可定义概率、又为机制分析提供离散锚点；MATH-500 上比同规模最强 Coconut 式基线高 25.7 个百分点，GRPO 后隐式推理调用率减半且准确率再 +12.6 个百分点。
  - Link: https://arxiv.org/abs/2606.13106

- 08:09 Harness-1: Reinforcement Learning for Search Agents with State-Externalizing Harnesses
  - 机构：伊利诺伊大学厄巴纳-香槟分校、UC Berkeley
  - 夯到拉评价：人上人（Ada champion）
  - 亮点：把候选池管理、去重、状态摘要、证据整理等"机械记账"从策略剥离、卸到环境侧 harness，让 RL 只学"搜什么、留什么、何时停"的语义决策——关注点分离换样本效率。（注：本期卡片取自摘要，正文具体数字未核实，节目中未作事实陈述。）
  - Link: https://arxiv.org/abs/2606.02373

- 11:23 Wrap-up
  - 三篇共同主题：重新切分"策略该做什么、环境/接口该做什么"——KV 接口聚合、边界 token 显式化、状态记账外置。
  - 快速提及：AdaSR（东方理工高等研究院（宁波）、上海交通大学），用层次化相对策略优化 HRPO 在流式/部分观测下动态分配推理算力、管理延迟。https://arxiv.org/abs/2606.14694

## 制作元信息
- 论文召回：原始 JSONL 记录 141 篇；新论文 141 篇；带入 backlog 10 篇。
- 筛选链路：新候选 105 篇；backlog 候选 15 篇；粗排 120 篇；LLM 精评 40 篇；本期播客主讲 3 篇；快速提及 1 篇。
- LLM：aws.claude-opus-4.7；input 13401 tokens，output 4249 tokens，总计 17650 tokens。
- TTS：seed-tts-2.0；Jeff voice `zh_male_m191_uranus_bigtts`，Ada voice `zh_female_vv_uranus_bigtts`；38 turns，输入 4499 字符，计费文本 4340 words。
]]></content:encoded>
      <pubDate>Tue, 16 Jun 2026 00:30:00 GMT</pubDate>
      <guid isPermaLink="false">mlsys-feed-2026-06-16</guid>
      <enclosure url="https://github.com/baihuajun24/baihuajun24.github.io/releases/download/audio-archive/0616-daily-arxiv.mp3" length="11423276" type="audio/mpeg" />
      <itunes:duration>11:53</itunes:duration>
      <itunes:explicit>false</itunes:explicit>
    </item>
    <item>
      <title>0613 MLSYS 论文简报：MiniPIC 位置无关缓存、ESPO 早停 RL 与 SearchSwarm 委派智能体</title>
      <description><![CDATA[# 0613 MLSYS 论文简报
Audio: 11:06
## 内容时间戳
- 00:00 Opening: 0613 MLSYS 论文简报
  - 基于 2026-06-12 晚间完成的 arXiv 论文召回与筛选；音频不朗读链接。
- 00:29 MiniPIC: Flexible Position-Independent Caching in <100LOC
  - 机构：IBM 研究院（苏黎世）
  - 夯到拉评价：夯（Jeff champion）
  - 亮点：没错，这篇论文叫 MiniPIC: Flexible Position-Independent Caching in <100LOC，来自 IBM 研究院（苏黎世）。它解决的是目前大语言模型在 Agent 和检索增强生成，也就是 RAG 场景下一个非常痛的系统瓶颈：重复输入片段的 KV 缓存复用。
  - Link: https://arxiv.org/abs/2606.13126

- 03:41 ESPO: Early-Stopping Proximal Policy Optimization
  - 机构：通义实验室（阿里巴巴）; 北京大学
  - 夯到拉评价：夯（Ada champion）
  - 亮点：我选的是 ESPO: Early-Stopping Proximal Policy Optimization，来自通义实验室（阿里巴巴）和北京大学。这篇论文直击大模型在进行强化学习，特别是做复杂推理和 Agent 任务时的训练算力浪费问题。

- 06:57 SearchSwarm: Towards Delegation Intelligence in Agentic LLMs for Long-Horizon Deep Research
  - 机构：清华大学; 蚂蚁集团
  - 夯到拉评价：顶级（Jeff champion）
  - 亮点：你说的是 SearchSwarm: Towards Delegation Intelligence in Agentic LLMs for Long-Horizon Deep Research 吧。这篇论文确实很有意思，它提出了一种委派智能，也就是 Delegation Intelligence 的新范式，专门用来解决超长程深度研究任务中，主 Agent 上下文窗口装不下的问题。

- 10:36 Wrap-up
  - 总结本期重点论文和后续阅读优先级。

## 制作元信息
- 论文召回：原始 JSONL 记录 251 篇；新论文 251 篇；带入 backlog 10 篇。
- 筛选链路：新候选 188 篇；backlog 候选 27 篇；粗排 215 篇；LLM 精评 20 篇；本期播客主讲 3 篇；快速提及 4 篇。
- LLM：gemini-3.5-flash；input 6080 tokens，output 2253 tokens，总计 8333 tokens。
- TTS：seed-tts-2.0；Jeff voice `zh_male_m191_uranus_bigtts`，Ada voice `zh_female_vv_uranus_bigtts`；35 turns，输入 3998 字符，计费文本 3998 words。
]]></description>
      <content:encoded><![CDATA[# 0613 MLSYS 论文简报
Audio: 11:06
## 内容时间戳
- 00:00 Opening: 0613 MLSYS 论文简报
  - 基于 2026-06-12 晚间完成的 arXiv 论文召回与筛选；音频不朗读链接。
- 00:29 MiniPIC: Flexible Position-Independent Caching in <100LOC
  - 机构：IBM 研究院（苏黎世）
  - 夯到拉评价：夯（Jeff champion）
  - 亮点：没错，这篇论文叫 MiniPIC: Flexible Position-Independent Caching in <100LOC，来自 IBM 研究院（苏黎世）。它解决的是目前大语言模型在 Agent 和检索增强生成，也就是 RAG 场景下一个非常痛的系统瓶颈：重复输入片段的 KV 缓存复用。
  - Link: https://arxiv.org/abs/2606.13126

- 03:41 ESPO: Early-Stopping Proximal Policy Optimization
  - 机构：通义实验室（阿里巴巴）; 北京大学
  - 夯到拉评价：夯（Ada champion）
  - 亮点：我选的是 ESPO: Early-Stopping Proximal Policy Optimization，来自通义实验室（阿里巴巴）和北京大学。这篇论文直击大模型在进行强化学习，特别是做复杂推理和 Agent 任务时的训练算力浪费问题。

- 06:57 SearchSwarm: Towards Delegation Intelligence in Agentic LLMs for Long-Horizon Deep Research
  - 机构：清华大学; 蚂蚁集团
  - 夯到拉评价：顶级（Jeff champion）
  - 亮点：你说的是 SearchSwarm: Towards Delegation Intelligence in Agentic LLMs for Long-Horizon Deep Research 吧。这篇论文确实很有意思，它提出了一种委派智能，也就是 Delegation Intelligence 的新范式，专门用来解决超长程深度研究任务中，主 Agent 上下文窗口装不下的问题。

- 10:36 Wrap-up
  - 总结本期重点论文和后续阅读优先级。

## 制作元信息
- 论文召回：原始 JSONL 记录 251 篇；新论文 251 篇；带入 backlog 10 篇。
- 筛选链路：新候选 188 篇；backlog 候选 27 篇；粗排 215 篇；LLM 精评 20 篇；本期播客主讲 3 篇；快速提及 4 篇。
- LLM：gemini-3.5-flash；input 6080 tokens，output 2253 tokens，总计 8333 tokens。
- TTS：seed-tts-2.0；Jeff voice `zh_male_m191_uranus_bigtts`，Ada voice `zh_female_vv_uranus_bigtts`；35 turns，输入 3998 字符，计费文本 3998 words。
]]></content:encoded>
      <pubDate>Sat, 13 Jun 2026 00:30:00 GMT</pubDate>
      <guid isPermaLink="false">mlsys-feed-2026-06-13</guid>
      <enclosure url="https://github.com/baihuajun24/baihuajun24.github.io/releases/download/audio-archive/0613-daily-arxiv.mp3" length="10659884" type="audio/mpeg" />
      <itunes:duration>11:06</itunes:duration>
      <itunes:explicit>false</itunes:explicit>
    </item>
    <item>
      <title>0612 MLSYS 论文简报：MTP 加速 RL 训练、Agentic RL 过程级信用分配与扩散投机解码</title>
      <description><![CDATA[# 0612 MLSYS 论文简报：MTP 加速 RL 训练、Agentic RL 过程级信用分配与扩散投机解码
Audio: 12:13
## 内容时间戳
- 00:00 Opening: 0612 MLSYS 论文简报
  - 基于 2026-06-11 晚间完成的 arXiv 论文召回与筛选；音频不朗读链接。
- 00:39 Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling
  - 机构：阿里巴巴通义千问团队
  - 夯到拉评价：夯（Jeff champion）
  - 亮点：我今天选出的系统方向重磅论文标题是 Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling。这篇论文来自阿里巴巴通义千问团队，arXiv 编号是 2606.12370。
  - Link: https://arxiv.org/abs/2606.12370

- 04:24 APPO: Agentic Procedural Policy Optimization
  - 机构：中国科学技术大学; 阿里巴巴高德
  - 夯到拉评价：夯（Ada champion）
  - 亮点：好，我挑的这篇是关于智能体强化学习的，标题叫 APPO: Agentic Procedural Policy Optimization。它来自中国科学技术大学和阿里巴巴高德团队，arXiv 编号是 2606.12384。
  - Link: https://arxiv.org/abs/2606.12384

- 07:33 Teaching Diffusion to Speculate Left-to-Right
  - 机构：SB Intuitions（日本）
  - 夯到拉评价：夯（Ada champion）
  - 亮点：接下来我们看第三篇，这是一篇非常有探索性、上限极高的论文，标题叫 Teaching Diffusion to Speculate Left-to-Right。它来自日本的 SB Intuitions，arXiv 编号是 2606.11552。
  - Link: https://arxiv.org/abs/2606.11552

- 11:43 Wrap-up
  - 总结本期重点论文和后续阅读优先级。

## 制作元信息
- 论文召回：原始 JSONL 记录 359 篇；新论文 359 篇；带入 backlog 10 篇。
- 筛选链路：新候选 288 篇；backlog 候选 10 篇；粗排 298 篇；LLM 精评 20 篇；本期播客主讲 3 篇；快速提及 3 篇。
- LLM：gemini-3.5-flash；input 5717 tokens，output 2457 tokens，总计 8174 tokens。
- TTS：seed-tts-2.0；Jeff voice `zh_male_m191_uranus_bigtts`，Ada voice `zh_female_yingyujiaoxue_uranus_bigtts`；34 turns，输入 4065 字符，计费文本 4065 words。

## 本期工作流改进
- 落地 PI 候选评审 gate：合成音频前先推送 Top 3 主讲 + 主题分组候选池，由 PI 拍板/替换后再进入脚本与音频。
- 标题改为主题式，不再用日期或「每日新闻」式占位。
- 机构信息统一改用 arXiv PDF 首页核验（六月新论文尚未进入 Semantic Scholar/OpenAlex）。
- 新增对外部声明的事实核查：本期据 PDF 移除了一处未经证实的会议录用说法。

]]></description>
      <content:encoded><![CDATA[# 0612 MLSYS 论文简报：MTP 加速 RL 训练、Agentic RL 过程级信用分配与扩散投机解码
Audio: 12:13
## 内容时间戳
- 00:00 Opening: 0612 MLSYS 论文简报
  - 基于 2026-06-11 晚间完成的 arXiv 论文召回与筛选；音频不朗读链接。
- 00:39 Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling
  - 机构：阿里巴巴通义千问团队
  - 夯到拉评价：夯（Jeff champion）
  - 亮点：我今天选出的系统方向重磅论文标题是 Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling。这篇论文来自阿里巴巴通义千问团队，arXiv 编号是 2606.12370。
  - Link: https://arxiv.org/abs/2606.12370

- 04:24 APPO: Agentic Procedural Policy Optimization
  - 机构：中国科学技术大学; 阿里巴巴高德
  - 夯到拉评价：夯（Ada champion）
  - 亮点：好，我挑的这篇是关于智能体强化学习的，标题叫 APPO: Agentic Procedural Policy Optimization。它来自中国科学技术大学和阿里巴巴高德团队，arXiv 编号是 2606.12384。
  - Link: https://arxiv.org/abs/2606.12384

- 07:33 Teaching Diffusion to Speculate Left-to-Right
  - 机构：SB Intuitions（日本）
  - 夯到拉评价：夯（Ada champion）
  - 亮点：接下来我们看第三篇，这是一篇非常有探索性、上限极高的论文，标题叫 Teaching Diffusion to Speculate Left-to-Right。它来自日本的 SB Intuitions，arXiv 编号是 2606.11552。
  - Link: https://arxiv.org/abs/2606.11552

- 11:43 Wrap-up
  - 总结本期重点论文和后续阅读优先级。

## 制作元信息
- 论文召回：原始 JSONL 记录 359 篇；新论文 359 篇；带入 backlog 10 篇。
- 筛选链路：新候选 288 篇；backlog 候选 10 篇；粗排 298 篇；LLM 精评 20 篇；本期播客主讲 3 篇；快速提及 3 篇。
- LLM：gemini-3.5-flash；input 5717 tokens，output 2457 tokens，总计 8174 tokens。
- TTS：seed-tts-2.0；Jeff voice `zh_male_m191_uranus_bigtts`，Ada voice `zh_female_yingyujiaoxue_uranus_bigtts`；34 turns，输入 4065 字符，计费文本 4065 words。

## 本期工作流改进
- 落地 PI 候选评审 gate：合成音频前先推送 Top 3 主讲 + 主题分组候选池，由 PI 拍板/替换后再进入脚本与音频。
- 标题改为主题式，不再用日期或「每日新闻」式占位。
- 机构信息统一改用 arXiv PDF 首页核验（六月新论文尚未进入 Semantic Scholar/OpenAlex）。
- 新增对外部声明的事实核查：本期据 PDF 移除了一处未经证实的会议录用说法。

]]></content:encoded>
      <pubDate>Fri, 12 Jun 2026 00:30:00 GMT</pubDate>
      <guid isPermaLink="false">mlsys-feed-2026-06-12</guid>
      <enclosure url="https://github.com/baihuajun24/baihuajun24.github.io/releases/download/audio-archive/0612-daily-arxiv.mp3" length="11737772" type="audio/mpeg" />
      <itunes:duration>12:13</itunes:duration>
    </item>
    <item>
      <title>0611 MLSYS 论文简报：解码期 KV 预算、Agentic RL Rollout 分配与测试期自进化</title>
      <description><![CDATA[# 0611 MLSYS 论文简报：解码期 KV 预算、Agentic RL Rollout 分配与测试期自进化
Audio: 09:17
## 内容时间戳
- 00:00 Opening: 0611 MLSYS 论文简报
  - 基于 2026-06-10 晚间完成的 arXiv 论文召回与筛选；音频不朗读链接。
- 00:29 ReasonAlloc: Hierarchical Decoding-Time KV Cache Budget Allocation for Reasoning Models
  - 机构：清华大学; 香港城市大学
  - 夯到拉评价：夯（Jeff champion）
  - 亮点：对，我挑的这篇 System Champion 论文绝对是当前的及时雨，标题是 ReasonAlloc: Hierarchical Decoding-Time KV Cache Budget Allocation for Reasoning Models。来自清华大学和香港城市大学。
  - Link: https://arxiv.org/abs/2606.11164

- 03:15 TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning
  - 机构：清华大学; 腾讯
  - 夯到拉评价：夯（Ada champion）
  - 亮点：我挑的这篇是 TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning。由清华大学和腾讯联合发表。
  - Link: https://arxiv.org/abs/2606.11119

- 06:00 EEVEE: Towards Test-time Prompt Learning in the Real World for Self-Improving Agents
  - 机构：上海交通大学; 普林斯顿大学
  - 夯到拉评价：顶级（Ada champion）
  - 亮点：标题是 EEVEE: Towards Test-time Prompt Learning in the Real World for Self-Improving Agents。由上海交通大学和普林斯顿大学合作，作者里包括了我们熟知的 Mengdi Wang 教授。
  - Link: https://arxiv.org/abs/2606.11182

- 08:47 Wrap-up
  - 总结本期重点论文和后续阅读优先级。

## 制作元信息
- 论文召回：原始 JSONL 记录 225 篇；新论文 225 篇；带入 backlog 10 篇。
- 筛选链路：新候选 168 篇；backlog 候选 10 篇；粗排 178 篇；LLM 精评 20 篇；本期播客主讲 3 篇；快速提及 2 篇。
- LLM：gemini-3.5-flash；input 5169 tokens，output 1860 tokens，总计 7029 tokens。
- TTS：seed-tts-2.0；Jeff voice `zh_male_m191_uranus_bigtts`，Ada voice `zh_female_yingyujiaoxue_uranus_bigtts`；34 turns，输入 3195 字符，计费文本 3195 words。
]]></description>
      <content:encoded><![CDATA[# 0611 MLSYS 论文简报：解码期 KV 预算、Agentic RL Rollout 分配与测试期自进化
Audio: 09:17
## 内容时间戳
- 00:00 Opening: 0611 MLSYS 论文简报
  - 基于 2026-06-10 晚间完成的 arXiv 论文召回与筛选；音频不朗读链接。
- 00:29 ReasonAlloc: Hierarchical Decoding-Time KV Cache Budget Allocation for Reasoning Models
  - 机构：清华大学; 香港城市大学
  - 夯到拉评价：夯（Jeff champion）
  - 亮点：对，我挑的这篇 System Champion 论文绝对是当前的及时雨，标题是 ReasonAlloc: Hierarchical Decoding-Time KV Cache Budget Allocation for Reasoning Models。来自清华大学和香港城市大学。
  - Link: https://arxiv.org/abs/2606.11164

- 03:15 TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning
  - 机构：清华大学; 腾讯
  - 夯到拉评价：夯（Ada champion）
  - 亮点：我挑的这篇是 TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning。由清华大学和腾讯联合发表。
  - Link: https://arxiv.org/abs/2606.11119

- 06:00 EEVEE: Towards Test-time Prompt Learning in the Real World for Self-Improving Agents
  - 机构：上海交通大学; 普林斯顿大学
  - 夯到拉评价：顶级（Ada champion）
  - 亮点：标题是 EEVEE: Towards Test-time Prompt Learning in the Real World for Self-Improving Agents。由上海交通大学和普林斯顿大学合作，作者里包括了我们熟知的 Mengdi Wang 教授。
  - Link: https://arxiv.org/abs/2606.11182

- 08:47 Wrap-up
  - 总结本期重点论文和后续阅读优先级。

## 制作元信息
- 论文召回：原始 JSONL 记录 225 篇；新论文 225 篇；带入 backlog 10 篇。
- 筛选链路：新候选 168 篇；backlog 候选 10 篇；粗排 178 篇；LLM 精评 20 篇；本期播客主讲 3 篇；快速提及 2 篇。
- LLM：gemini-3.5-flash；input 5169 tokens，output 1860 tokens，总计 7029 tokens。
- TTS：seed-tts-2.0；Jeff voice `zh_male_m191_uranus_bigtts`，Ada voice `zh_female_yingyujiaoxue_uranus_bigtts`；34 turns，输入 3195 字符，计费文本 3195 words。
]]></content:encoded>
      <pubDate>Thu, 11 Jun 2026 00:30:00 GMT</pubDate>
      <guid isPermaLink="false">mlsys-feed-2026-06-11</guid>
      <enclosure url="https://github.com/baihuajun24/baihuajun24.github.io/releases/download/audio-archive/0611-daily-arxiv.mp3" length="8915756" type="audio/mpeg" />
      <itunes:duration>09:17</itunes:duration>
      <itunes:explicit>false</itunes:explicit>
    </item>
    <item>
      <title>0610 MLSYS 论文简报：LLM Agent 服务仿真、开放世界自进化与 RLVR 奖励瓶颈</title>
      <description><![CDATA[# 0610 MLSYS 论文简报：LLM Agent 服务仿真、开放世界自进化与 RLVR 奖励瓶颈
Audio: 09:11
## 内容时间戳
- 00:00 Opening: 0610 MLSYS 论文简报
  - 基于 2026-06-09 晚间完成的 arXiv 论文召回与筛选；音频不朗读链接。
- 00:24 AGENTSERVESIM: A Hardware-aware Simulator for Multi-Turn LLM Agent Serving
  - 机构：中佛罗里达大学
  - 夯到拉评价：顶级（Jeff champion）
  - 亮点：这篇论文叫 AGENTSERVESIM: A Hardware-aware Simulator for Multi-Turn LLM Agent Serving，来自中佛罗里达大学。它解决的是多轮大模型 Agent 服务评估的痛点。
  - Link: https://arxiv.org/abs/2606.09613

- 03:17 OpenSkill: Open-World Self-Evolution for LLM Agents
  - 机构：利哈伊大学; 伊利诺伊大学芝加哥分校
  - 夯到拉评价：人上人（Ada champion）
  - 亮点：我挑选的是 OpenSkill: Open-World Self-Evolution for LLM Agents，合作机构包括利哈伊大学和伊利诺伊大学芝加哥分校。我们一直在谈 Agent 的自进化，但以往的研究都假设存在一个现成的反馈闭环，比如有一套准备好的技能库、成功的轨迹样本或者可靠的自动校验器。
  - Link: https://arxiv.org/abs/2606.06741

- 05:59 Reasoning Arena: Trace Tournaments When Verifiable Rewards Fall Short
  - 机构：剑桥大学; Mistral AI
  - 夯到拉评价：NPC（Ada champion）
  - 亮点：第三篇是探索性工作，叫 Reasoning Arena: Trace Tournaments When Verifiable Rewards Fall Short，由剑桥大学和 Mistral AI 联合发表。它针对 RLVR 在 group 内奖励无差别时梯度消失的问题，把这些轨迹路由到裁判模型做 trace tournament。
  - Link: https://arxiv.org/abs/2606.09380

- 08:41 Wrap-up
  - 总结本期重点论文和后续阅读优先级。

## 制作元信息
- 论文召回：原始 JSONL 记录 262 篇；新论文 262 篇；带入 backlog 9 篇。
- 筛选链路：新候选 199 篇；backlog 候选 9 篇；粗排 208 篇；LLM 精评 19 篇；本期播客主讲 3 篇；快速提及 0 篇。
- LLM：gemini-3.5-flash；input 3536 tokens，output 1836 tokens，总计 5372 tokens。
- TTS：seed-tts-2.0；Jeff voice `zh_male_m191_uranus_bigtts`，Ada voice `zh_female_yingyujiaoxue_uranus_bigtts`；26 turns，输入 2974 字符，计费文本 2974 words。

## 本期变更
- 双主播对白改用 gemini-3.5-flash 生成：解释更清晰、夯到拉评分更严格。
- 当日新论文批次偏弱，算法 champion 由人工复核后选定 OpenSkill。
]]></description>
      <content:encoded><![CDATA[# 0610 MLSYS 论文简报：LLM Agent 服务仿真、开放世界自进化与 RLVR 奖励瓶颈
Audio: 09:11
## 内容时间戳
- 00:00 Opening: 0610 MLSYS 论文简报
  - 基于 2026-06-09 晚间完成的 arXiv 论文召回与筛选；音频不朗读链接。
- 00:24 AGENTSERVESIM: A Hardware-aware Simulator for Multi-Turn LLM Agent Serving
  - 机构：中佛罗里达大学
  - 夯到拉评价：顶级（Jeff champion）
  - 亮点：这篇论文叫 AGENTSERVESIM: A Hardware-aware Simulator for Multi-Turn LLM Agent Serving，来自中佛罗里达大学。它解决的是多轮大模型 Agent 服务评估的痛点。
  - Link: https://arxiv.org/abs/2606.09613

- 03:17 OpenSkill: Open-World Self-Evolution for LLM Agents
  - 机构：利哈伊大学; 伊利诺伊大学芝加哥分校
  - 夯到拉评价：人上人（Ada champion）
  - 亮点：我挑选的是 OpenSkill: Open-World Self-Evolution for LLM Agents，合作机构包括利哈伊大学和伊利诺伊大学芝加哥分校。我们一直在谈 Agent 的自进化，但以往的研究都假设存在一个现成的反馈闭环，比如有一套准备好的技能库、成功的轨迹样本或者可靠的自动校验器。
  - Link: https://arxiv.org/abs/2606.06741

- 05:59 Reasoning Arena: Trace Tournaments When Verifiable Rewards Fall Short
  - 机构：剑桥大学; Mistral AI
  - 夯到拉评价：NPC（Ada champion）
  - 亮点：第三篇是探索性工作，叫 Reasoning Arena: Trace Tournaments When Verifiable Rewards Fall Short，由剑桥大学和 Mistral AI 联合发表。它针对 RLVR 在 group 内奖励无差别时梯度消失的问题，把这些轨迹路由到裁判模型做 trace tournament。
  - Link: https://arxiv.org/abs/2606.09380

- 08:41 Wrap-up
  - 总结本期重点论文和后续阅读优先级。

## 制作元信息
- 论文召回：原始 JSONL 记录 262 篇；新论文 262 篇；带入 backlog 9 篇。
- 筛选链路：新候选 199 篇；backlog 候选 9 篇；粗排 208 篇；LLM 精评 19 篇；本期播客主讲 3 篇；快速提及 0 篇。
- LLM：gemini-3.5-flash；input 3536 tokens，output 1836 tokens，总计 5372 tokens。
- TTS：seed-tts-2.0；Jeff voice `zh_male_m191_uranus_bigtts`，Ada voice `zh_female_yingyujiaoxue_uranus_bigtts`；26 turns，输入 2974 字符，计费文本 2974 words。

## 本期变更
- 双主播对白改用 gemini-3.5-flash 生成：解释更清晰、夯到拉评分更严格。
- 当日新论文批次偏弱，算法 champion 由人工复核后选定 OpenSkill。
]]></content:encoded>
      <pubDate>Wed, 10 Jun 2026 00:30:00 GMT</pubDate>
      <guid isPermaLink="false">mlsys-feed-2026-06-10</guid>
      <enclosure url="https://github.com/baihuajun24/baihuajun24.github.io/releases/download/audio-archive/0610-daily-arxiv.mp3" length="8830508" type="audio/mpeg" />
      <itunes:duration>09:11</itunes:duration>
      <itunes:explicit>false</itunes:explicit>
    </item>
    <item>
      <title>0609 MLSYS 论文简报</title>
      <description><![CDATA[# 0609 MLSYS 论文简报
Audio: 09:22
## 内容时间戳
- 00:00 Opening: 0609 MLSYS 论文简报
  - 基于 2026-06-08 晚间完成的 arXiv 论文召回与筛选；音频不朗读链接。
- 00:16 Clairvoyant: Predictive SJF Scheduling to Mitigate Head-of-Line Blocking in Serial LLM Backends
  - 机构：独立研究者
  - 夯到拉评价：顶级（Jeff champion）
  - 亮点：这篇叫 Clairvoyant: Predictive SJF Scheduling to Mitigate Head-of-Line Blocking in Serial LLM Backends，作者是一位独立研究者。问题背景非常具体：像 Ollama、llama.cpp 这种串行的 LLM 推理后端，本质上是 FCFS 准入，一次只跑一个请求。
  - Link: https://arxiv.org/abs/2606.07248

- 03:07 Self-evolving LLM agents with in-distribution Optimization
  - 机构：埃因霍温理工大学; 利物浦大学
  - 夯到拉评价：人上人（Ada champion）
  - 亮点：我这篇是算法侧的 champion，叫 Self-evolving LLM agents with in-distribution Optimization，作者是埃因霍温理工大学和利物浦大学的团队，方法名叫 Q-Evolve，已经被 ICML 2026 收了。问题是 LLM agent 做长程决策时的 credit assignment：奖励通常只在 episode 末尾给一次，sparse reward 让策略学习非常不稳。
  - Link: https://arxiv.org/abs/2606.07367

- 05:45 SlimSearcher: Training Efficiency-Aware Web Agents via Adaptive Reward Gating
  - 机构：浙江大学; 蚂蚁集团
  - 夯到拉评价：顶级（Ada champion）
  - 亮点：论文叫 SlimSearcher: Training Efficiency-Aware Web Agents via Adaptive Reward Gating，作者来自浙江大学和蚂蚁集团。问题很直接：现在的 deep research agent 在 GAIA、BrowseComp 这种长程信息检索任务上能力很强，但都是暴力解法——盲目调工具、堆冗长 reasoning，token 和 tool call 都极度浪费。
  - Link: https://arxiv.org/abs/2606.07074

- 08:52 Wrap-up
  - 总结本期重点论文和后续阅读优先级。

## 制作元信息
- 论文召回：原始 JSONL 记录 356 篇；新论文 356 篇；带入 backlog 8 篇。
- 筛选链路：新候选 295 篇；backlog 候选 5 篇；粗排 300 篇；LLM 精评 15 篇；本期播客主讲 3 篇；快速提及 3 篇。
- LLM：aws.claude-opus-4.7；input 9564 tokens，output 3219 tokens，总计 12783 tokens。
- TTS：seed-tts-2.0；Jeff voice `zh_male_m191_uranus_bigtts`，Ada voice `zh_female_yingyujiaoxue_uranus_bigtts`；25 turns，输入 3848 字符，计费文本 3848 words。
]]></description>
      <content:encoded><![CDATA[# 0609 MLSYS 论文简报
Audio: 09:22
## 内容时间戳
- 00:00 Opening: 0609 MLSYS 论文简报
  - 基于 2026-06-08 晚间完成的 arXiv 论文召回与筛选；音频不朗读链接。
- 00:16 Clairvoyant: Predictive SJF Scheduling to Mitigate Head-of-Line Blocking in Serial LLM Backends
  - 机构：独立研究者
  - 夯到拉评价：顶级（Jeff champion）
  - 亮点：这篇叫 Clairvoyant: Predictive SJF Scheduling to Mitigate Head-of-Line Blocking in Serial LLM Backends，作者是一位独立研究者。问题背景非常具体：像 Ollama、llama.cpp 这种串行的 LLM 推理后端，本质上是 FCFS 准入，一次只跑一个请求。
  - Link: https://arxiv.org/abs/2606.07248

- 03:07 Self-evolving LLM agents with in-distribution Optimization
  - 机构：埃因霍温理工大学; 利物浦大学
  - 夯到拉评价：人上人（Ada champion）
  - 亮点：我这篇是算法侧的 champion，叫 Self-evolving LLM agents with in-distribution Optimization，作者是埃因霍温理工大学和利物浦大学的团队，方法名叫 Q-Evolve，已经被 ICML 2026 收了。问题是 LLM agent 做长程决策时的 credit assignment：奖励通常只在 episode 末尾给一次，sparse reward 让策略学习非常不稳。
  - Link: https://arxiv.org/abs/2606.07367

- 05:45 SlimSearcher: Training Efficiency-Aware Web Agents via Adaptive Reward Gating
  - 机构：浙江大学; 蚂蚁集团
  - 夯到拉评价：顶级（Ada champion）
  - 亮点：论文叫 SlimSearcher: Training Efficiency-Aware Web Agents via Adaptive Reward Gating，作者来自浙江大学和蚂蚁集团。问题很直接：现在的 deep research agent 在 GAIA、BrowseComp 这种长程信息检索任务上能力很强，但都是暴力解法——盲目调工具、堆冗长 reasoning，token 和 tool call 都极度浪费。
  - Link: https://arxiv.org/abs/2606.07074

- 08:52 Wrap-up
  - 总结本期重点论文和后续阅读优先级。

## 制作元信息
- 论文召回：原始 JSONL 记录 356 篇；新论文 356 篇；带入 backlog 8 篇。
- 筛选链路：新候选 295 篇；backlog 候选 5 篇；粗排 300 篇；LLM 精评 15 篇；本期播客主讲 3 篇；快速提及 3 篇。
- LLM：aws.claude-opus-4.7；input 9564 tokens，output 3219 tokens，总计 12783 tokens。
- TTS：seed-tts-2.0；Jeff voice `zh_male_m191_uranus_bigtts`，Ada voice `zh_female_yingyujiaoxue_uranus_bigtts`；25 turns，输入 3848 字符，计费文本 3848 words。
]]></content:encoded>
      <pubDate>Tue, 09 Jun 2026 00:30:00 GMT</pubDate>
      <guid isPermaLink="false">mlsys-feed-2026-06-09</guid>
      <enclosure url="https://github.com/baihuajun24/baihuajun24.github.io/releases/download/audio-archive/0609-daily-arxiv.mp3" length="8994860" type="audio/mpeg" />
      <itunes:duration>09:22</itunes:duration>
      <itunes:explicit>false</itunes:explicit>
    </item>
    <item>
      <title>CVPR 2026 特别篇：为什么 10 年后，ResNet 仍在改写 AI</title>
      <description><![CDATA[# CVPR 2026 特别篇：为什么 10 年后，ResNet 仍在改写 AI

## 评论

这期我们不是按获奖名单逐篇报菜名，而是把 ResNet、D4RT、draft-and-verify 和 cache 串成一条方法论主线：真正持久的 AI 进步，常常来自对信息路径和计算路径的重写。

10 年后的 ResNet 仍然重要，是因为它教会了深度模型一个朴素但耐用的原则：先保留稳定通路，再让模型学习必要的增量。

## 本期重点

这期不是单纯盘点 CVPR 2026 获奖论文，而是抓住一条更耐看的主线：AI 的很多关键进步，不只是把模型做大，而是重新设计信息、计算和推理的默认路径。

从十年前的 ResNet residual path，到今年 CVPR Best Paper D4RT 的 4D query path，再到长视频里的 draft-and-verify、扩散模型里的 cache path，这些工作共同指向一个启发：真正经得起时间考验的 idea，往往会从一个架构 trick，变成跨模型、跨系统的设计语言。

## 时间线

00:00 开场：从 ResNet 作为 Test-of-Time 锚点切入，说明 CVF 奖项档案已列出 ResNet 和 YOLO 为 2026 Longuet-Higgins Prize 论文。

00:31 CVPR 2026 背景：Denver 会场、16,092 投稿、4,089 接收、141 oral、578 highlight、74 篇 award candidate；最终 Best Paper 为 D4RT。

01:11 Deep Residual Learning for Image Recognition

ResNet 主线：为什么 identity path / residual path 改变了深层网络默认信息路径，并继续影响 Transformer residual stream、adapter、U-Net skip connection、cache reuse 和 speculative decoding。

03:17 Efficiently Reconstructing Dynamic Scenes One D4RT at a Time

CVPR 2026 Best Paper。节目重点解释 D4RT 如何把动态 4D reconstruction 从密集逐帧输出改成统一表示上的时空点查询，并把它连接到“改路径，而不是只堆 decoder”的系统设计思想。

05:17 NitroGen: An Open Foundation Model for Generalist Gaming Agents

官方 Award Candidate / Oral。用 1000 多个游戏、4 万小时 gameplay video 训练通用 vision-action foundation model，代表从静态观察语料到 action-conditioned rollout 的预训练路径变化。

06:29 Thinking with Drafts: Speculative Temporal Reasoning for Efficient Long Video Understanding

官方 Award Candidate / Oral。用轻量 draft MLLM 选择证据帧，再由 target MLLM 验证和推理，作为长视频理解里的 draft-and-verify 路径。

07:40 快速补充：SeaCache 与 VGGT-Ω

SeaCache 讨论扩散模型缓存有效性与频谱演化；VGGT-Ω 代表 feed-forward 3D reconstruction 的基础模型接口与内存路径设计。

08:54 3DReflecNet 一线对照

保留为复杂材质数据集的简短背景，不再作为主线段落。

09:11 Takeaways

核心启发：ResNet 的 identity path，D4RT 的 query path，NitroGen 的 trajectory pretraining path，Thinking with Drafts 的 draft/verify path，SeaCache 的 cache path，以及 VGGT-Ω 的几何接口路径，都在回答同一个问题：系统默认让信息怎么走，往往决定了模型能走多远。

## 论文与链接

- PI-approved WeChat report
  - Link: https://mp.weixin.qq.com/s/KieRMknWe2ZJx2BNw_0BmA
- CVF Computer Vision Awards archive
  - Link: https://www.thecvf.com/?page_id=413
- Deep Residual Learning for Image Recognition
  - CVF paper: https://openaccess.thecvf.com/content_cvpr_2016/html/He_Deep_Residual_Learning_CVPR_2016_paper.html
- Efficiently Reconstructing Dynamic Scenes One D4RT at a Time
  - CVF paper: https://openaccess.thecvf.com/content/CVPR2026/html/Zhang_Efficiently_Reconstructing_Dynamic_Scenes_One_D4RT_at_a_Time_CVPR_2026_paper.html
  - Project page: https://d4rt-paper.github.io/
- NitroGen: An Open Foundation Model for Generalist Gaming Agents
  - CVPR poster: https://cvpr.thecvf.com/virtual/2026/poster/39333
  - CVF paper: https://openaccess.thecvf.com/content/CVPR2026/html/Magne_NitroGen_An_Open_Foundation_Model_for_Generalist_Gaming_Agents_CVPR_2026_paper.html
- Thinking with Drafts: Speculative Temporal Reasoning for Efficient Long Video Understanding
  - CVPR poster: https://cvpr.thecvf.com/virtual/2026/poster/37426
  - CVF paper: https://openaccess.thecvf.com/content/CVPR2026/html/Hu_Thinking_with_Drafts_Speculative_Temporal_Reasoning_for_Efficient_Long_Video_CVPR_2026_paper.html
- SeaCache: Spectral-Evolution-Aware Cache for Accelerating Diffusion Models
  - CVPR poster: https://cvpr.thecvf.com/virtual/2026/poster/38909
  - CVF paper: https://openaccess.thecvf.com/content/CVPR2026/html/Chung_SeaCache_Spectral-Evolution-Aware_Cache_for_Accelerating_Diffusion_Models_CVPR_2026_paper.html
- VGGT-Ω
  - CVPR poster: https://cvpr.thecvf.com/virtual/2026/poster/39730
  - CVF paper: https://openaccess.thecvf.com/content/CVPR2026/html/Wang_VGGT-ohm_CVPR_2026_paper.html
- 3DReflecNet: A Large-Scale Dataset for 3D Reconstruction of Reflective, Transparent, and Low-Texture Objects
  - CVPR poster: https://cvpr.thecvf.com/virtual/2026/poster/37703
  - CVF paper: https://openaccess.thecvf.com/content/CVPR2026/html/Liang_3DReflecNet_A_Large-Scale_Dataset_for_3D_Reconstruction_of_Reflective_Transparent_CVPR_2026_paper.html

## 制作元信息

- 状态：送审草稿。音频已重新生成，时长 10:18。
- 来源说明：本版按 PI 确认的微信报道重写叙事，奖项和论文事实用 CVPR/CVF 官方页面、CVF Open Access 页面、CVF Computer Vision Awards archive、D4RT project page 交叉核对。
- 微信直读限制：WeChat 页面返回环境/CAPTCHA gate，本地 Camoufox reader 目录缺失，`miku_ai` 未安装。因此本稿记录为“PI-approved WeChat report via snippets/secondary evidence”，不声称已完整抓取原文。
- 奖项来源：CVF awards archive 确认 D4RT 为 CVPR 2026 Best Paper，确认 ResNet 与 YOLO 为 2026 Longuet-Higgins Prize 论文。
- 脚本：29 turns；口播文本 4,305 字符；无口播 URL、Markdown footnote、反引号或 citation clutter。
- TTS：seed-tts-2.0；Jeff voice `zh_male_m191_uranus_bigtts`，Ada voice `zh_female_yingyujiaoxue_uranus_bigtts`；29 turns，输入 4,305 字符，计费文本 4,305 words。
- 音频处理：原始合成 `audio_raw_11m45s.mp3` 为 11:45，经 `atempo=1.14` 和 loudnorm 处理后得到最终 `audio.mp3`，时长 10:18，24 kHz mono，约 128 kbps。
]]></description>
      <content:encoded><![CDATA[# CVPR 2026 特别篇：为什么 10 年后，ResNet 仍在改写 AI

## 评论

这期我们不是按获奖名单逐篇报菜名，而是把 ResNet、D4RT、draft-and-verify 和 cache 串成一条方法论主线：真正持久的 AI 进步，常常来自对信息路径和计算路径的重写。

10 年后的 ResNet 仍然重要，是因为它教会了深度模型一个朴素但耐用的原则：先保留稳定通路，再让模型学习必要的增量。

## 本期重点

这期不是单纯盘点 CVPR 2026 获奖论文，而是抓住一条更耐看的主线：AI 的很多关键进步，不只是把模型做大，而是重新设计信息、计算和推理的默认路径。

从十年前的 ResNet residual path，到今年 CVPR Best Paper D4RT 的 4D query path，再到长视频里的 draft-and-verify、扩散模型里的 cache path，这些工作共同指向一个启发：真正经得起时间考验的 idea，往往会从一个架构 trick，变成跨模型、跨系统的设计语言。

## 时间线

00:00 开场：从 ResNet 作为 Test-of-Time 锚点切入，说明 CVF 奖项档案已列出 ResNet 和 YOLO 为 2026 Longuet-Higgins Prize 论文。

00:31 CVPR 2026 背景：Denver 会场、16,092 投稿、4,089 接收、141 oral、578 highlight、74 篇 award candidate；最终 Best Paper 为 D4RT。

01:11 Deep Residual Learning for Image Recognition

ResNet 主线：为什么 identity path / residual path 改变了深层网络默认信息路径，并继续影响 Transformer residual stream、adapter、U-Net skip connection、cache reuse 和 speculative decoding。

03:17 Efficiently Reconstructing Dynamic Scenes One D4RT at a Time

CVPR 2026 Best Paper。节目重点解释 D4RT 如何把动态 4D reconstruction 从密集逐帧输出改成统一表示上的时空点查询，并把它连接到“改路径，而不是只堆 decoder”的系统设计思想。

05:17 NitroGen: An Open Foundation Model for Generalist Gaming Agents

官方 Award Candidate / Oral。用 1000 多个游戏、4 万小时 gameplay video 训练通用 vision-action foundation model，代表从静态观察语料到 action-conditioned rollout 的预训练路径变化。

06:29 Thinking with Drafts: Speculative Temporal Reasoning for Efficient Long Video Understanding

官方 Award Candidate / Oral。用轻量 draft MLLM 选择证据帧，再由 target MLLM 验证和推理，作为长视频理解里的 draft-and-verify 路径。

07:40 快速补充：SeaCache 与 VGGT-Ω

SeaCache 讨论扩散模型缓存有效性与频谱演化；VGGT-Ω 代表 feed-forward 3D reconstruction 的基础模型接口与内存路径设计。

08:54 3DReflecNet 一线对照

保留为复杂材质数据集的简短背景，不再作为主线段落。

09:11 Takeaways

核心启发：ResNet 的 identity path，D4RT 的 query path，NitroGen 的 trajectory pretraining path，Thinking with Drafts 的 draft/verify path，SeaCache 的 cache path，以及 VGGT-Ω 的几何接口路径，都在回答同一个问题：系统默认让信息怎么走，往往决定了模型能走多远。

## 论文与链接

- PI-approved WeChat report
  - Link: https://mp.weixin.qq.com/s/KieRMknWe2ZJx2BNw_0BmA
- CVF Computer Vision Awards archive
  - Link: https://www.thecvf.com/?page_id=413
- Deep Residual Learning for Image Recognition
  - CVF paper: https://openaccess.thecvf.com/content_cvpr_2016/html/He_Deep_Residual_Learning_CVPR_2016_paper.html
- Efficiently Reconstructing Dynamic Scenes One D4RT at a Time
  - CVF paper: https://openaccess.thecvf.com/content/CVPR2026/html/Zhang_Efficiently_Reconstructing_Dynamic_Scenes_One_D4RT_at_a_Time_CVPR_2026_paper.html
  - Project page: https://d4rt-paper.github.io/
- NitroGen: An Open Foundation Model for Generalist Gaming Agents
  - CVPR poster: https://cvpr.thecvf.com/virtual/2026/poster/39333
  - CVF paper: https://openaccess.thecvf.com/content/CVPR2026/html/Magne_NitroGen_An_Open_Foundation_Model_for_Generalist_Gaming_Agents_CVPR_2026_paper.html
- Thinking with Drafts: Speculative Temporal Reasoning for Efficient Long Video Understanding
  - CVPR poster: https://cvpr.thecvf.com/virtual/2026/poster/37426
  - CVF paper: https://openaccess.thecvf.com/content/CVPR2026/html/Hu_Thinking_with_Drafts_Speculative_Temporal_Reasoning_for_Efficient_Long_Video_CVPR_2026_paper.html
- SeaCache: Spectral-Evolution-Aware Cache for Accelerating Diffusion Models
  - CVPR poster: https://cvpr.thecvf.com/virtual/2026/poster/38909
  - CVF paper: https://openaccess.thecvf.com/content/CVPR2026/html/Chung_SeaCache_Spectral-Evolution-Aware_Cache_for_Accelerating_Diffusion_Models_CVPR_2026_paper.html
- VGGT-Ω
  - CVPR poster: https://cvpr.thecvf.com/virtual/2026/poster/39730
  - CVF paper: https://openaccess.thecvf.com/content/CVPR2026/html/Wang_VGGT-ohm_CVPR_2026_paper.html
- 3DReflecNet: A Large-Scale Dataset for 3D Reconstruction of Reflective, Transparent, and Low-Texture Objects
  - CVPR poster: https://cvpr.thecvf.com/virtual/2026/poster/37703
  - CVF paper: https://openaccess.thecvf.com/content/CVPR2026/html/Liang_3DReflecNet_A_Large-Scale_Dataset_for_3D_Reconstruction_of_Reflective_Transparent_CVPR_2026_paper.html

## 制作元信息

- 状态：送审草稿。音频已重新生成，时长 10:18。
- 来源说明：本版按 PI 确认的微信报道重写叙事，奖项和论文事实用 CVPR/CVF 官方页面、CVF Open Access 页面、CVF Computer Vision Awards archive、D4RT project page 交叉核对。
- 微信直读限制：WeChat 页面返回环境/CAPTCHA gate，本地 Camoufox reader 目录缺失，`miku_ai` 未安装。因此本稿记录为“PI-approved WeChat report via snippets/secondary evidence”，不声称已完整抓取原文。
- 奖项来源：CVF awards archive 确认 D4RT 为 CVPR 2026 Best Paper，确认 ResNet 与 YOLO 为 2026 Longuet-Higgins Prize 论文。
- 脚本：29 turns；口播文本 4,305 字符；无口播 URL、Markdown footnote、反引号或 citation clutter。
- TTS：seed-tts-2.0；Jeff voice `zh_male_m191_uranus_bigtts`，Ada voice `zh_female_yingyujiaoxue_uranus_bigtts`；29 turns，输入 4,305 字符，计费文本 4,305 words。
- 音频处理：原始合成 `audio_raw_11m45s.mp3` 为 11:45，经 `atempo=1.14` 和 loudnorm 处理后得到最终 `audio.mp3`，时长 10:18，24 kHz mono，约 128 kbps。
]]></content:encoded>
      <pubDate>Mon, 08 Jun 2026 00:30:00 GMT</pubDate>
      <guid isPermaLink="false">mlsys-feed-2026-06-08-cvpr-special</guid>
      <enclosure url="https://github.com/baihuajun24/baihuajun24.github.io/releases/download/audio-archive/0608-cvpr2026-resnet-d4rt.mp3" length="9896492" type="audio/mpeg" />
      <itunes:duration>10:18</itunes:duration>
      <itunes:explicit>false</itunes:explicit>
    </item>
    <item>
      <title>0606 MLSYS 论文简报</title>
      <description><![CDATA[# 0606 MLSYS 论文简报
Audio: 10:50
## 内容时间戳
- 00:00 Opening: 0606 MLSYS 论文简报
  - 基于 2026-06-05 晚间完成的 arXiv 论文召回与筛选；音频不朗读链接。
- 00:29 Tangram: Unlocking Non-Uniform KV Cache for Efficient Multi-turn LLM Serving
  - 机构：汉阳大学; Rebellions
  - 夯到拉评价：顶级（Jeff champion）
  - 亮点：对，我的 champion 是来自汉阳大学和 Rebellions 的 Tangram，全名是 Tangram: Unlocking Non-Uniform KV Cache for Efficient Multi-turn LLM Serving。背景是这样的：多轮对话场景里，KV cache 会随着对话轮数线性膨胀，对显存和带宽都是巨大压力。
  - Link: https://arxiv.org/abs/2606.06302

- 03:15 Rethinking Continual Experience Internalization for Self-Evolving LLM Agents
  - 机构：中国人民大学高瓴人工智能学院; 北京航空航天大学
  - 夯到拉评价：人上人（Ada champion）
  - 亮点：我选了中国人民大学高瓴人工智能学院和北京航空航天大学的 Rethinking Continual Experience Internalization for Self-Evolving LLM Agents。背景是 self-evolving agent 的一个长期梦想：把过去交互里的 contextual experience，蒸馏成模型权重里的能力，这样 agent 就能持续变强。
  - Link: https://arxiv.org/abs/2606.04703

- 05:57 LatentSkill: From In-Context Textual Skills to In-Weight Latent Skills for LLM Agents
  - 机构：上海交通大学; 中山大学
  - 夯到拉评价：人上人（Jeff champion）
  - 亮点：好，第三篇是上海交通大学和中山大学的 LatentSkill: From In-Context Textual Skills to In-Weight Latent Skills for LLM Agents。问题背景挺有意思：现在很多 agent 系统会维护一堆 textual skills，就是可复用的任务流程片段，每次调用都塞进 prompt。
  - Link: https://arxiv.org/abs/2606.06087

- 10:20 Wrap-up
  - 总结本期重点论文和后续阅读优先级。

## 制作元信息
- 论文召回：原始 JSONL 记录 305 篇；新论文 305 篇；带入 backlog 10 篇。
- 筛选链路：新候选 236 篇；backlog 候选 10 篇；粗排 246 篇；LLM 精评 20 篇；本期播客主讲 3 篇；快速提及 6 篇。
- LLM：aws.claude-opus-4.7；input 10756 tokens，output 3359 tokens，总计 14115 tokens。
- TTS：seed-tts-2.0；Jeff voice `zh_male_m191_uranus_bigtts`，Ada voice `zh_female_yingyujiaoxue_uranus_bigtts`；26 turns，输入 4873 字符，计费文本 4873 words。
]]></description>
      <content:encoded><![CDATA[# 0606 MLSYS 论文简报
Audio: 10:50
## 内容时间戳
- 00:00 Opening: 0606 MLSYS 论文简报
  - 基于 2026-06-05 晚间完成的 arXiv 论文召回与筛选；音频不朗读链接。
- 00:29 Tangram: Unlocking Non-Uniform KV Cache for Efficient Multi-turn LLM Serving
  - 机构：汉阳大学; Rebellions
  - 夯到拉评价：顶级（Jeff champion）
  - 亮点：对，我的 champion 是来自汉阳大学和 Rebellions 的 Tangram，全名是 Tangram: Unlocking Non-Uniform KV Cache for Efficient Multi-turn LLM Serving。背景是这样的：多轮对话场景里，KV cache 会随着对话轮数线性膨胀，对显存和带宽都是巨大压力。
  - Link: https://arxiv.org/abs/2606.06302

- 03:15 Rethinking Continual Experience Internalization for Self-Evolving LLM Agents
  - 机构：中国人民大学高瓴人工智能学院; 北京航空航天大学
  - 夯到拉评价：人上人（Ada champion）
  - 亮点：我选了中国人民大学高瓴人工智能学院和北京航空航天大学的 Rethinking Continual Experience Internalization for Self-Evolving LLM Agents。背景是 self-evolving agent 的一个长期梦想：把过去交互里的 contextual experience，蒸馏成模型权重里的能力，这样 agent 就能持续变强。
  - Link: https://arxiv.org/abs/2606.04703

- 05:57 LatentSkill: From In-Context Textual Skills to In-Weight Latent Skills for LLM Agents
  - 机构：上海交通大学; 中山大学
  - 夯到拉评价：人上人（Jeff champion）
  - 亮点：好，第三篇是上海交通大学和中山大学的 LatentSkill: From In-Context Textual Skills to In-Weight Latent Skills for LLM Agents。问题背景挺有意思：现在很多 agent 系统会维护一堆 textual skills，就是可复用的任务流程片段，每次调用都塞进 prompt。
  - Link: https://arxiv.org/abs/2606.06087

- 10:20 Wrap-up
  - 总结本期重点论文和后续阅读优先级。

## 制作元信息
- 论文召回：原始 JSONL 记录 305 篇；新论文 305 篇；带入 backlog 10 篇。
- 筛选链路：新候选 236 篇；backlog 候选 10 篇；粗排 246 篇；LLM 精评 20 篇；本期播客主讲 3 篇；快速提及 6 篇。
- LLM：aws.claude-opus-4.7；input 10756 tokens，output 3359 tokens，总计 14115 tokens。
- TTS：seed-tts-2.0；Jeff voice `zh_male_m191_uranus_bigtts`，Ada voice `zh_female_yingyujiaoxue_uranus_bigtts`；26 turns，输入 4873 字符，计费文本 4873 words。
]]></content:encoded>
      <pubDate>Sat, 06 Jun 2026 00:30:00 GMT</pubDate>
      <guid isPermaLink="false">mlsys-feed-2026-06-06</guid>
      <enclosure url="https://github.com/baihuajun24/baihuajun24.github.io/releases/download/audio-archive/0606-daily-arxiv.mp3" length="10414892" type="audio/mpeg" />
      <itunes:duration>10:50</itunes:duration>
      <itunes:explicit>false</itunes:explicit>
    </item>
    <item>
      <title>0605 MLSYS 论文简报</title>
      <description><![CDATA[# 0605 MLSYS 论文简报
Audio: 09:48
## 内容时间戳
- 00:00 Opening: 0605 MLSYS 论文简报
  - 基于 2026-06-04 晚间完成的 arXiv 论文召回与筛选；音频不朗读链接。
- 00:33 D^2SD: Accelerating Speculative Decoding with Dual Diffusion Draft Models
  - 机构：北京大学; 清华大学
  - 亮点：这篇全名是 D²SD: Accelerating Speculative Decoding with Dual Diffusion Draft Models，第一作者来自北京大学，合作单位还有清华大学。它瞄准的是现在比较流行的 diffusion-based drafter 路线——也就是用扩散模型一次性并行生成一整块 draft token，然后丢给 target model 一次 forward 验证。
  - Link: https://arxiv.org/abs/2606.04446

- 03:33 RUBAS: Rubric-Based Reinforcement Learning for Agent Safety
  - 机构：清华大学; 华为诺亚方舟实验室
  - 亮点：下一篇是清华那边出来的 RUBAS: Rubric-Based Reinforcement Learning for Agent Safety，第一作者来自清华大学，合作单位还有华为诺亚方舟实验室。 这是 agent safety 方向？
  - Link: https://arxiv.org/abs/2606.04051

- 05:25 Not All Errors Are Equal: A Systematic Study of Error Propagation in Large Language Model Inference
  - 机构：爱荷华大学; 阿贡国家实验室
  - 亮点：下面这篇我想聊一下，叫 Not All Errors Are Equal: A Systematic Study of Error Propagation in Large Language Model Inference，第一作者来自爱荷华大学，合作单位还有阿贡国家实验室。已经被 ICS'26 接收。
  - Link: https://arxiv.org/abs/2606.02430

- 07:33 Language Models Need Sleep: Learning to Self-Modify and Consolidate Memories
  - 机构：谷歌研究院; 康奈尔大学
  - 亮点：一篇是谷歌研究院和康奈尔大学的 Language Models Need Sleep: Learning to Self-Modify and Consolidate Memories。它提了一个"睡眠"范式，让模型把短期 in-context 记忆通过两个阶段固化进长期参数：一个叫 Memory Consolidation，用 on-policy distillation 加 RL imitation 把小模型的知识"播种"到大模型；
  - Link: https://arxiv.org/abs/2606.03979

- 08:12 Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning
  - 机构：纽约大学; 谷歌 DeepMind
  - 亮点：最后一篇是纽约大学和谷歌 DeepMind 合作的 Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning。核心论点是：行为多样性不应该靠 entropy bonus 这种硬塞，而应该作为"对 reward 不确定性的理性回应"自然涌现。
  - Link: https://arxiv.org/abs/2606.03962

- 09:18 Wrap-up
  - 总结本期重点论文和后续阅读优先级。

## 制作元信息
- 论文召回：原始 JSONL 记录 276 篇；新论文 276 篇；带入 backlog 10 篇。
- 筛选链路：新候选 246 篇；backlog 候选 10 篇；粗排 256 篇；LLM 精评 20 篇；本期播客选讲 5 篇。
- LLM：aws.claude-opus-4.7；input 5420 tokens，output 3569 tokens，总计 8989 tokens。
- TTS：seed-tts-2.0；Jeff voice `zh_male_m191_uranus_bigtts`，Ada voice `zh_female_vv_uranus_bigtts`；34 turns，输入 4405 字符，计费文本 4405 words。
]]></description>
      <content:encoded><![CDATA[# 0605 MLSYS 论文简报
Audio: 09:48
## 内容时间戳
- 00:00 Opening: 0605 MLSYS 论文简报
  - 基于 2026-06-04 晚间完成的 arXiv 论文召回与筛选；音频不朗读链接。
- 00:33 D^2SD: Accelerating Speculative Decoding with Dual Diffusion Draft Models
  - 机构：北京大学; 清华大学
  - 亮点：这篇全名是 D²SD: Accelerating Speculative Decoding with Dual Diffusion Draft Models，第一作者来自北京大学，合作单位还有清华大学。它瞄准的是现在比较流行的 diffusion-based drafter 路线——也就是用扩散模型一次性并行生成一整块 draft token，然后丢给 target model 一次 forward 验证。
  - Link: https://arxiv.org/abs/2606.04446

- 03:33 RUBAS: Rubric-Based Reinforcement Learning for Agent Safety
  - 机构：清华大学; 华为诺亚方舟实验室
  - 亮点：下一篇是清华那边出来的 RUBAS: Rubric-Based Reinforcement Learning for Agent Safety，第一作者来自清华大学，合作单位还有华为诺亚方舟实验室。 这是 agent safety 方向？
  - Link: https://arxiv.org/abs/2606.04051

- 05:25 Not All Errors Are Equal: A Systematic Study of Error Propagation in Large Language Model Inference
  - 机构：爱荷华大学; 阿贡国家实验室
  - 亮点：下面这篇我想聊一下，叫 Not All Errors Are Equal: A Systematic Study of Error Propagation in Large Language Model Inference，第一作者来自爱荷华大学，合作单位还有阿贡国家实验室。已经被 ICS'26 接收。
  - Link: https://arxiv.org/abs/2606.02430

- 07:33 Language Models Need Sleep: Learning to Self-Modify and Consolidate Memories
  - 机构：谷歌研究院; 康奈尔大学
  - 亮点：一篇是谷歌研究院和康奈尔大学的 Language Models Need Sleep: Learning to Self-Modify and Consolidate Memories。它提了一个"睡眠"范式，让模型把短期 in-context 记忆通过两个阶段固化进长期参数：一个叫 Memory Consolidation，用 on-policy distillation 加 RL imitation 把小模型的知识"播种"到大模型；
  - Link: https://arxiv.org/abs/2606.03979

- 08:12 Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning
  - 机构：纽约大学; 谷歌 DeepMind
  - 亮点：最后一篇是纽约大学和谷歌 DeepMind 合作的 Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning。核心论点是：行为多样性不应该靠 entropy bonus 这种硬塞，而应该作为"对 reward 不确定性的理性回应"自然涌现。
  - Link: https://arxiv.org/abs/2606.03962

- 09:18 Wrap-up
  - 总结本期重点论文和后续阅读优先级。

## 制作元信息
- 论文召回：原始 JSONL 记录 276 篇；新论文 276 篇；带入 backlog 10 篇。
- 筛选链路：新候选 246 篇；backlog 候选 10 篇；粗排 256 篇；LLM 精评 20 篇；本期播客选讲 5 篇。
- LLM：aws.claude-opus-4.7；input 5420 tokens，output 3569 tokens，总计 8989 tokens。
- TTS：seed-tts-2.0；Jeff voice `zh_male_m191_uranus_bigtts`，Ada voice `zh_female_vv_uranus_bigtts`；34 turns，输入 4405 字符，计费文本 4405 words。
]]></content:encoded>
      <pubDate>Fri, 05 Jun 2026 00:30:00 GMT</pubDate>
      <guid isPermaLink="false">mlsys-feed-2026-06-05</guid>
      <enclosure url="https://github.com/baihuajun24/baihuajun24.github.io/releases/download/audio-archive/0605-daily-arxiv.mp3" length="9421868" type="audio/mpeg" />
      <itunes:duration>09:48</itunes:duration>
      <itunes:explicit>false</itunes:explicit>
    </item>
    <item>
      <title>0604 Daily arXiv: Agentic RL, Runtime, SpecDecoding</title>
      <description><![CDATA[# 0604 Daily arXiv Podcast: Agentic RL Systems, Agent Runtime, and Speculative Decoding

Audio: 08:40

## 内容时间戳

- 00:00 Opening: 0603 daily arXiv feed
  - 今日主线是 agentic RL 系统、LLM agent 运行时，以及两篇引用 PARD 的 speculative decoding 新论文。

- 00:21 Libra: Efficient Resource Management for Agentic RL Post-Training
  - 作者团队来自 The Chinese University of Hong Kong 和 The Hang Seng University of Hong Kong。
  - 重点：agentic RL rollout 会产生长尾、非平稳的工具调用轨迹，静态 GPU 切分会很快失效。
  - 方法：全局资源 planner 在 rollout/training 之间动态分配 GPU；C-MLFQ 用工具返回的因果信号做 rollout bucket 路由。
  - 亮点：48 张 A800 上最高 3.0x 吞吐提升、2.5x reward 收敛加速，是今天最值得读的系统论文。

- 02:13 Agent libOS: A Library-OS-Inspired Runtime for Long-Running, Capability-Controlled LLM Agents
  - 作者来自 Tsinghua University。
  - 重点：把长跑型 LLM agent 抽象成 AgentProcess，用 capability 和 runtime primitive 管理权限。
  - 亮点：不是提升 planner 准确率，而是为 agent 提供可调度、可授权、可恢复、可审计的运行时底座。

- 03:25 DriftSched: Adaptive QoS-Aware Scheduling under Runtime Token Drift for Multi-Tenant GPU Inference
  - 作者是 independent researcher，University of Colorado Colorado Springs alumni。
  - 重点：多租户 LLM serving 中，admission-time 输出长度估计和实际输出长度经常漂移，导致队列失衡和尾延迟恶化。
  - 亮点：用 runtime feedback 修正 token-budget bias；对 inference serving 调度有参考价值，和 speculative decoding 是正交但可叠加的方向。

- 04:15 Cost-Aware Diffusion Draft Trees for Speculative Decoding
  - 作者团队来自 Zhejiang University 和 Westlake University。
  - Citation watch: cites PARD: Accelerating LLM Inference with Low-Cost Parallel Draft Model Adaptation。
  - 重点：传统 diffusion draft tree 只最大化 acceptance length，会自然偏向更大 tree，缺少 budget 选择原则。
  - 方法：CaDDTree 直接优化 token throughput，显式建模 draft 和 verification 延迟，并用 unimodal 性质做高效 budget 搜索。
  - 亮点：把 speculative decoding 的预算选择变成运行时自适应优化问题。

- 05:48 Hybrid Verified Decoding: Learning to Allocate Verification in Speculative Decoding
  - 作者团队来自 Thoughtworks 和 Nvidia。
  - Citation watch: cites PARD: Accelerating LLM Inference with Low-Cost Parallel Draft Model Adaptation。
  - 重点：agentic workload 中，cache/n-gram 等 parameter-free draft source 很便宜，但 payoff 会随生成步骤变化。
  - 方法：verification 前预测 accepted length，在 cache draft 和 model-based drafter 之间做选择。
  - 亮点：agentic workflow 上平均 2.73x speedup，提示下一步 speculative decoding 需要 runtime draft-source selection。

- 07:18 Other papers: DenoiseRL, RLVR sample difficulty, and FluxMem
  - DenoiseRL: Bootstrapping Reasoning Models to Recover from Noisy Prefixes
    - 来自 Fudan University 和 Shanghai Innovation Institute；关注从弱模型错误轨迹中 bootstrap 推理能力。
  - Mechanistically Interpreting the Role of Sample Difficulty in RLVR for LLMs
    - 来自 Beijing Jiaotong University、Ant Group、Northwestern Polytechnical University、University of Leeds、University of Southampton；关注 RLVR 中样本难度的机制解释。
  - Rethinking Memory as Continuously Evolving Connectivity
    - 来自 Zhejiang University、Alibaba Group、MemTensor、Tongji University；把 agent memory 建模为持续演化的连接图。

- 08:12 Wrap-up
  - 今日重点：Libra 是 agentic RL 资源管理必读；Agent libOS 提供 capability-based runtime 视角；两篇引用 PARD 的工作都指向 runtime adaptive speculative decoding。]]></description>
      <content:encoded><![CDATA[# 0604 Daily arXiv Podcast: Agentic RL Systems, Agent Runtime, and Speculative Decoding

Audio: 08:40

## 内容时间戳

- 00:00 Opening: 0603 daily arXiv feed
  - 今日主线是 agentic RL 系统、LLM agent 运行时，以及两篇引用 PARD 的 speculative decoding 新论文。

- 00:21 Libra: Efficient Resource Management for Agentic RL Post-Training
  - 作者团队来自 The Chinese University of Hong Kong 和 The Hang Seng University of Hong Kong。
  - 重点：agentic RL rollout 会产生长尾、非平稳的工具调用轨迹，静态 GPU 切分会很快失效。
  - 方法：全局资源 planner 在 rollout/training 之间动态分配 GPU；C-MLFQ 用工具返回的因果信号做 rollout bucket 路由。
  - 亮点：48 张 A800 上最高 3.0x 吞吐提升、2.5x reward 收敛加速，是今天最值得读的系统论文。

- 02:13 Agent libOS: A Library-OS-Inspired Runtime for Long-Running, Capability-Controlled LLM Agents
  - 作者来自 Tsinghua University。
  - 重点：把长跑型 LLM agent 抽象成 AgentProcess，用 capability 和 runtime primitive 管理权限。
  - 亮点：不是提升 planner 准确率，而是为 agent 提供可调度、可授权、可恢复、可审计的运行时底座。

- 03:25 DriftSched: Adaptive QoS-Aware Scheduling under Runtime Token Drift for Multi-Tenant GPU Inference
  - 作者是 independent researcher，University of Colorado Colorado Springs alumni。
  - 重点：多租户 LLM serving 中，admission-time 输出长度估计和实际输出长度经常漂移，导致队列失衡和尾延迟恶化。
  - 亮点：用 runtime feedback 修正 token-budget bias；对 inference serving 调度有参考价值，和 speculative decoding 是正交但可叠加的方向。

- 04:15 Cost-Aware Diffusion Draft Trees for Speculative Decoding
  - 作者团队来自 Zhejiang University 和 Westlake University。
  - Citation watch: cites PARD: Accelerating LLM Inference with Low-Cost Parallel Draft Model Adaptation。
  - 重点：传统 diffusion draft tree 只最大化 acceptance length，会自然偏向更大 tree，缺少 budget 选择原则。
  - 方法：CaDDTree 直接优化 token throughput，显式建模 draft 和 verification 延迟，并用 unimodal 性质做高效 budget 搜索。
  - 亮点：把 speculative decoding 的预算选择变成运行时自适应优化问题。

- 05:48 Hybrid Verified Decoding: Learning to Allocate Verification in Speculative Decoding
  - 作者团队来自 Thoughtworks 和 Nvidia。
  - Citation watch: cites PARD: Accelerating LLM Inference with Low-Cost Parallel Draft Model Adaptation。
  - 重点：agentic workload 中，cache/n-gram 等 parameter-free draft source 很便宜，但 payoff 会随生成步骤变化。
  - 方法：verification 前预测 accepted length，在 cache draft 和 model-based drafter 之间做选择。
  - 亮点：agentic workflow 上平均 2.73x speedup，提示下一步 speculative decoding 需要 runtime draft-source selection。

- 07:18 Other papers: DenoiseRL, RLVR sample difficulty, and FluxMem
  - DenoiseRL: Bootstrapping Reasoning Models to Recover from Noisy Prefixes
    - 来自 Fudan University 和 Shanghai Innovation Institute；关注从弱模型错误轨迹中 bootstrap 推理能力。
  - Mechanistically Interpreting the Role of Sample Difficulty in RLVR for LLMs
    - 来自 Beijing Jiaotong University、Ant Group、Northwestern Polytechnical University、University of Leeds、University of Southampton；关注 RLVR 中样本难度的机制解释。
  - Rethinking Memory as Continuously Evolving Connectivity
    - 来自 Zhejiang University、Alibaba Group、MemTensor、Tongji University；把 agent memory 建模为持续演化的连接图。

- 08:12 Wrap-up
  - 今日重点：Libra 是 agentic RL 资源管理必读；Agent libOS 提供 capability-based runtime 视角；两篇引用 PARD 的工作都指向 runtime adaptive speculative decoding。]]></content:encoded>
      <pubDate>Thu, 04 Jun 2026 00:30:00 GMT</pubDate>
      <guid isPermaLink="false">huajun-daily-arxiv-2026-06-04</guid>
      <enclosure url="https://github.com/baihuajun24/baihuajun24.github.io/releases/download/audio-archive/0604-daily-arxiv.mp3" length="8321324" type="audio/mpeg" />
      <itunes:duration>08:40</itunes:duration>
      <itunes:explicit>false</itunes:explicit>
    </item>
  </channel>
</rss>
