← 博客 播客精读 42章经 × Evolvent AI 59:29
Podcast field notes / 2026.08.12

蒸馏、合成数据和 RSI,是怎么连到一起的?

整理这期节目时,我原本以为重点会是蒸馏。顺着对谈往下看,问题慢慢变成了:训练越来越方便以后,模型研究员到底还在研究什么?

精读:42章经嘉宾:孟繁青主题:POST-TRAINING · DATA · RSI
原节目:从蒸馏到合成数据到 RSI,模型竞争的下一个焦点是什么?

42章经对谈 Evolvent AI 联合创始人孟繁青,发布于 2026 年 8 月 8 日。下面是我基于节目内容和公开资料做的整理,不是逐字稿。

在小宇宙收听 ↗
我给这期划的重点

模型怎么变强,越来越取决于一套实验循环:找到它不会的东西,想办法造出合适的数据,训一版,再看它到底学会了没有。

整理这期时,我最想弄清的是那个有点敏感的问题:国内模型到底有多依赖蒸馏?这段对谈没有在「蒸还是不蒸」上纠缠太久。孟繁青把问题往前推了一步。模型厂的训练平台已经很成熟,提交数据、发起训练、拿回 checkpoint,逐渐像调用内部服务。既然如此,研究员每天最花心思的工作是什么?他的答案很朴素:做数据。

沿着这个答案往下走,蒸馏、合成数据、Benchmark 和 RSI 就串起来了。蒸馏借别人的能力造数据,合成数据解决「该让模型学什么」,RSI 则想把发现问题、造数据和验证结果这套循环继续自动化。节目聊了将近一小时,我最后留下的主线就这么一条。

我为什么把这三个词画在一条线上

蒸馏最直接。一个更强的模型已经会做某件事,就让目标模型学习它给出的答案、推理轨迹或工具操作过程。这当然也会产生合成数据,但合成数据的范围更大。团队还得决定出什么题、出多难、哪些轨迹该扔掉,以及一批数据训完会不会让模型在别的任务上变笨。

RSI(Recursive Self-Improvement)又多了一层。系统要看懂上轮为什么失败,提出下一批数据的做法,训练候选模型,然后从评估结果里决定下一步。走到这里,麻烦已经不在「能不能生成数据」了,而在它有没有判断力。

后训练的人,怎么每天都在做数据

孟繁青在节目里描述了模型厂内部的一种工作方式:SFT、推理和评估都有现成平台。研究员提交请求,远端服务完成训练,最后把结果交回来。找 GPU、配环境、拉训练仓库这些事情,已经由基础设施团队消化掉了。

顺着他的描述,很容易冒出一个误解:那训练模型岂不是没什么门槛了?训练动作的门槛确实低了。但有人替你修好了厨房,不代表你突然会做菜。研究员还是要判断模型缺什么、喂什么、数据难度是否合适。更麻烦的是,很多数据在训练前根本看不出好坏,最后还得真训一轮才知道。

以前更像考试

给一道题,核对一个答案

数学题和早期代码题比较适合这样测。模型像坐在考场里,答完以后看对错。

现在更像上班

给一套工具,看事情有没有办成

Agent 要操作 Notion、终端或代码仓库。评估器得检查中间状态,还要防着模型钻规则的空子。

这也解释了为什么做 Post-training 的人创业时常常去做 Agent 环境和 Benchmark。一个像样的 Agent Benchmark 要重建软件、状态和验证器,做着做着就已经很接近一个可用产品了。相比之下,单纯出一套问答题离实际工作还很远。

训练平台越成熟,研究员越像是在设计实验。模型能不能训起来不再稀奇,知道下一轮该试什么才稀奇。

国内模型的优势,可能不在我们以为的地方

这一段和我原先想的刚好相反。通常的说法是,国内团队工程能力强,所以更擅长 Post-training;预训练则吃算法人才和算力,海外优势更大。孟繁青的观察刚好倒过来。他觉得国内模型最有特色的地方,恰恰是算力紧张逼出来的预训练架构创新。后训练这边,海外公司开始得早,数据和经验多积累了几个月,时间差反而更难抹平。

这是受访者的行业观察,公开信息还不足以把它证明成一条普遍规律。不过它让我意识到,大家说「追赶模型」时,经常把几件速度完全不同的事混在一起。我按自己的理解拆了个表:

竞争层核心问题追赶方式难复制之处
算力能跑多大规模、多少实验资本投入与资源调度供给、集群稳定性、长期预算
架构每单位算力能换来多少能力论文、开源与人才流动规模化验证和工程细节
数据模型应该学习什么蒸馏、合成、采集与标注失败经验、课程设计、质量判断
组织能否把新认知快速变成新版本流程调整与团队协作决策速度、反馈链路、隐性知识

那蒸馏到底算什么

孟繁青把它叫作加速手段,我基本同意。强模型已经会的东西,可以很快变成后训练材料,数据冷启动会省事很多。但一个团队仍然得有自己的基础模型,知道该测什么,也要有办法判断迁移过来的能力是真是假。

所以我更在意另一个问题:如果有一天外部教师都不能用了,这家公司还能不能靠自己的模型、环境和反馈继续造数据?能,说明蒸馏帮它跑得更快。不能,那它缺的恐怕不只是一条 API。

RSI 已经能跑了,只是经常越跑越偏

RSI 这个词很容易把人带到「模型无限自我进化」的想象里。把它落到这期节目讨论的数据场景,其实就是下面这几步:

诊断能力缺口
提出数据假设
生成并验证数据
训练候选模型
评估并选择

步骤写出来很简单,跑起来却不会自动变好。Agent 可能一开始就看错了失败原因,造出一批和真实任务对不上的数据;也可能中途已经训出最好版本,却不肯停,继续折腾几轮后交了一个更差的。

Evolvent AI 公开的 RSIBench-Data 论文专门测这件事。实验固定基础模型、训练服务、评估环境和预算,只让研究 Agent 改数据策略。这样才能看清:进步到底来自 Agent 的研究判断,还是碰巧换了训练配置和评估条件。

58.33%在 24 个 Agent×任务设置中,有 14 个通过后续迭代超过了第一次有效尝试。
78.26%在达到峰值后仍继续搜索的设置中,最终一次尝试低于历史最佳;其余也只是回到同一峰值。

我看到这两个数字时,想到的是一个刚开始独立做研究的实习生:偶尔真能冒出好点子,但不知道什么时候该停,也不一定记得保住目前最好的结果。当前 Agent 已经会发现一些有效改进,离稳定管理整个研究过程还有距离。

我目前的判断:短期内,RSI 更像研究基础设施的一次升级。它可以替团队生成候选、跑验证、整理失败记录,在明确边界里多试几种数据策略。至于一个模型自己把自己越训越强,先别急着跳到那一步。

我最后留下的判断

训练服务化以后,研究不会消失,只会换地方。过去的难题是把模型训起来,现在的难题是知道下一轮该喂什么。数据质量也没法只靠清洗规则提前判定,很多时候必须付出一次训练成本,才能知道想法对不对。

Benchmark 也比我原先理解的更接近产品。为了测试一个办公 Agent,你得造出它工作的软件、任务状态和检查机制。环境做得越像真的,评估才越有用;可一旦把这些都做好,它离实际业务也没多远了。

至于蒸馏,我不会再把问题简化成「用了多少」。更值得问的是,一家公司有没有自己的判断:知道模型缺什么,知道老师教来的东西有没有学会,也能在没有老师时接着往下走。

RSI 眼下最现实的价值,还是帮研究团队多做一些靠谱实验。它已经能找到惊喜,暂时还管不好惊喜。这个状态其实挺有意思,比「马上递归起飞」也更值得研究。

有几处我还没完全被说服

「预训练学知识,后训练搬分布」说得太整齐了

这个说法适合解释大方向,拿来划能力来源就有点勉强。持续预训练、中期训练、长上下文扩展和大规模 RL 已经搅在一起,基础能力很难只记到某一个阶段头上。

在模拟环境里做对,进公司后未必也能做对

环境越复杂,验证器越容易漏掉没有写进规则的要求。Agent 能操作一个模拟 Notion,当然比答选择题更接近工作,但真实组织还有权限、沟通和各种临时变化。Benchmark 永远只测出了被写下来的那一部分。

没人能算清蒸馏到底贡献了多少

各家的训练数据、教师调用和内部评估都不透明。「蒸馏只是加速器」是孟繁青的判断,我觉得有道理,却没法从公开资料算出一个占比。现阶段最多能说,它很重要,但它代替不了预训练、架构和自己的数据积累。

节目时间轴

如果只想听重点,可以沿着下面四段进入原节目:

  1. 后训练与模型竞争。从模型厂到创业公司,Post-training、Benchmark 与数据工作的变化。
  2. RSI。Self-Evolving、AI for AI 与 Auto-Research 的关系,以及闭环为何很难转起来。
  3. 数据。模型对数据需求的几轮变化,外采价值,以及合成数据与蒸馏的区别。
  4. 展望。AI4S、模型公司的组织形态、蒸馏对国内追赶的意义与 Evolvent AI 的方向。

打开完整节目与官方文稿 ↗

资料与出处

文章目录8
Silent Star约 8 分钟