蒸馏、合成数据和 RSI,是怎么连到一起的?
整理这期节目时,我原本以为重点会是蒸馏。顺着对谈往下看,问题慢慢变成了:训练越来越方便以后,模型研究员到底还在研究什么?
42章经对谈 Evolvent AI 联合创始人孟繁青,发布于 2026 年 8 月 8 日。下面是我基于节目内容和公开资料做的整理,不是逐字稿。
模型怎么变强,越来越取决于一套实验循环:找到它不会的东西,想办法造出合适的数据,训一版,再看它到底学会了没有。
整理这期时,我最想弄清的是那个有点敏感的问题:国内模型到底有多依赖蒸馏?这段对谈没有在「蒸还是不蒸」上纠缠太久。孟繁青把问题往前推了一步。模型厂的训练平台已经很成熟,提交数据、发起训练、拿回 checkpoint,逐渐像调用内部服务。既然如此,研究员每天最花心思的工作是什么?他的答案很朴素:做数据。
沿着这个答案往下走,蒸馏、合成数据、Benchmark 和 RSI 就串起来了。蒸馏借别人的能力造数据,合成数据解决「该让模型学什么」,RSI 则想把发现问题、造数据和验证结果这套循环继续自动化。节目聊了将近一小时,我最后留下的主线就这么一条。
我为什么把这三个词画在一条线上
蒸馏
先找一个更强的老师,借它的回答和轨迹教目标模型。
合成数据
开始自己出题,还要管难度、轨迹、反馈和答案是否可信。
RSI
再把出题、训练、考试和复盘交给系统自己安排。
这不是行业里的标准分法,只是我听完节目后做的一张关系图。
蒸馏最直接。一个更强的模型已经会做某件事,就让目标模型学习它给出的答案、推理轨迹或工具操作过程。这当然也会产生合成数据,但合成数据的范围更大。团队还得决定出什么题、出多难、哪些轨迹该扔掉,以及一批数据训完会不会让模型在别的任务上变笨。
RSI(Recursive Self-Improvement)又多了一层。系统要看懂上轮为什么失败,提出下一批数据的做法,训练候选模型,然后从评估结果里决定下一步。走到这里,麻烦已经不在「能不能生成数据」了,而在它有没有判断力。
后训练的人,怎么每天都在做数据
孟繁青在节目里描述了模型厂内部的一种工作方式:SFT、推理和评估都有现成平台。研究员提交请求,远端服务完成训练,最后把结果交回来。找 GPU、配环境、拉训练仓库这些事情,已经由基础设施团队消化掉了。
顺着他的描述,很容易冒出一个误解:那训练模型岂不是没什么门槛了?训练动作的门槛确实低了。但有人替你修好了厨房,不代表你突然会做菜。研究员还是要判断模型缺什么、喂什么、数据难度是否合适。更麻烦的是,很多数据在训练前根本看不出好坏,最后还得真训一轮才知道。
给一道题,核对一个答案
数学题和早期代码题比较适合这样测。模型像坐在考场里,答完以后看对错。
给一套工具,看事情有没有办成
Agent 要操作 Notion、终端或代码仓库。评估器得检查中间状态,还要防着模型钻规则的空子。
这也解释了为什么做 Post-training 的人创业时常常去做 Agent 环境和 Benchmark。一个像样的 Agent Benchmark 要重建软件、状态和验证器,做着做着就已经很接近一个可用产品了。相比之下,单纯出一套问答题离实际工作还很远。
训练平台越成熟,研究员越像是在设计实验。模型能不能训起来不再稀奇,知道下一轮该试什么才稀奇。
国内模型的优势,可能不在我们以为的地方
这一段和我原先想的刚好相反。通常的说法是,国内团队工程能力强,所以更擅长 Post-training;预训练则吃算法人才和算力,海外优势更大。孟繁青的观察刚好倒过来。他觉得国内模型最有特色的地方,恰恰是算力紧张逼出来的预训练架构创新。后训练这边,海外公司开始得早,数据和经验多积累了几个月,时间差反而更难抹平。
这是受访者的行业观察,公开信息还不足以把它证明成一条普遍规律。不过它让我意识到,大家说「追赶模型」时,经常把几件速度完全不同的事混在一起。我按自己的理解拆了个表:
| 竞争层 | 核心问题 | 追赶方式 | 难复制之处 |
|---|---|---|---|
| 算力 | 能跑多大规模、多少实验 | 资本投入与资源调度 | 供给、集群稳定性、长期预算 |
| 架构 | 每单位算力能换来多少能力 | 论文、开源与人才流动 | 规模化验证和工程细节 |
| 数据 | 模型应该学习什么 | 蒸馏、合成、采集与标注 | 失败经验、课程设计、质量判断 |
| 组织 | 能否把新认知快速变成新版本 | 流程调整与团队协作 | 决策速度、反馈链路、隐性知识 |
那蒸馏到底算什么
孟繁青把它叫作加速手段,我基本同意。强模型已经会的东西,可以很快变成后训练材料,数据冷启动会省事很多。但一个团队仍然得有自己的基础模型,知道该测什么,也要有办法判断迁移过来的能力是真是假。
所以我更在意另一个问题:如果有一天外部教师都不能用了,这家公司还能不能靠自己的模型、环境和反馈继续造数据?能,说明蒸馏帮它跑得更快。不能,那它缺的恐怕不只是一条 API。
RSI 已经能跑了,只是经常越跑越偏
RSI 这个词很容易把人带到「模型无限自我进化」的想象里。把它落到这期节目讨论的数据场景,其实就是下面这几步:
步骤写出来很简单,跑起来却不会自动变好。Agent 可能一开始就看错了失败原因,造出一批和真实任务对不上的数据;也可能中途已经训出最好版本,却不肯停,继续折腾几轮后交了一个更差的。
Evolvent AI 公开的 RSIBench-Data 论文专门测这件事。实验固定基础模型、训练服务、评估环境和预算,只让研究 Agent 改数据策略。这样才能看清:进步到底来自 Agent 的研究判断,还是碰巧换了训练配置和评估条件。
我看到这两个数字时,想到的是一个刚开始独立做研究的实习生:偶尔真能冒出好点子,但不知道什么时候该停,也不一定记得保住目前最好的结果。当前 Agent 已经会发现一些有效改进,离稳定管理整个研究过程还有距离。
我最后留下的判断
训练服务化以后,研究不会消失,只会换地方。过去的难题是把模型训起来,现在的难题是知道下一轮该喂什么。数据质量也没法只靠清洗规则提前判定,很多时候必须付出一次训练成本,才能知道想法对不对。
Benchmark 也比我原先理解的更接近产品。为了测试一个办公 Agent,你得造出它工作的软件、任务状态和检查机制。环境做得越像真的,评估才越有用;可一旦把这些都做好,它离实际业务也没多远了。
至于蒸馏,我不会再把问题简化成「用了多少」。更值得问的是,一家公司有没有自己的判断:知道模型缺什么,知道老师教来的东西有没有学会,也能在没有老师时接着往下走。
RSI 眼下最现实的价值,还是帮研究团队多做一些靠谱实验。它已经能找到惊喜,暂时还管不好惊喜。这个状态其实挺有意思,比「马上递归起飞」也更值得研究。
有几处我还没完全被说服
「预训练学知识,后训练搬分布」说得太整齐了
这个说法适合解释大方向,拿来划能力来源就有点勉强。持续预训练、中期训练、长上下文扩展和大规模 RL 已经搅在一起,基础能力很难只记到某一个阶段头上。
在模拟环境里做对,进公司后未必也能做对
环境越复杂,验证器越容易漏掉没有写进规则的要求。Agent 能操作一个模拟 Notion,当然比答选择题更接近工作,但真实组织还有权限、沟通和各种临时变化。Benchmark 永远只测出了被写下来的那一部分。
没人能算清蒸馏到底贡献了多少
各家的训练数据、教师调用和内部评估都不透明。「蒸馏只是加速器」是孟繁青的判断,我觉得有道理,却没法从公开资料算出一个占比。现阶段最多能说,它很重要,但它代替不了预训练、架构和自己的数据积累。
节目时间轴
如果只想听重点,可以沿着下面四段进入原节目:
- 后训练与模型竞争。从模型厂到创业公司,Post-training、Benchmark 与数据工作的变化。
- RSI。Self-Evolving、AI for AI 与 Auto-Research 的关系,以及闭环为何很难转起来。
- 数据。模型对数据需求的几轮变化,外采价值,以及合成数据与蒸馏的区别。
- 展望。AI4S、模型公司的组织形态、蒸馏对国内追赶的意义与 Evolvent AI 的方向。