
中国AI的RSI先行者:StartLux把70%实验执行交给AI
训练一个 27B 的大模型,有多少研发工作可以交给 AI?上海原点星辉科学技术有限公司(下简称 StartLux)给出的答案是:约 70%。在其本地 Agent 模型 StartLux-V1.0-27B-Preview 的后训练过程中,约 70% 的实验研发工作由 AI 独立完成——包含提出实验假设、生成或筛选数据、启动训练和 Eval、分析失败轨迹,再根据结果决定下一轮试什么。人类研究员主要负责最关键的那件事:决定研究方向和关键取舍。
用这套方法训练出来的模型,成绩单刚刚出炉。工信部中国信息通信研究院人工智能研究所(以下简称中国信通院)公布的检验报告显示,StartLux 研发的本地大模型 StartLux-V1.0-27B-Preview,在中国信通院“可信AI大模型基准测试——MCP 专项测试”中取得综合性能排名第二的成绩:综合得分 39.25,超过了 284B 的 DeepSeek-V4-Flash-0731 与 198B 的 Step-3.7-Flash;在同等参数规模下,较 Qwen-3.6-27B 高出 5.34 个百分点,成为参测 27B 模型中的最优者,仅次于 1.6T 参数的 DeepSeek-V4-Pro。在位置导航任务上,StartLux-V1.0-27B-Preview 排名第一;浏览器自动化、金融分析等单项任务上,更与 1.6T 参数的 DeepSeek-V4-Pro 并列或独占第一——这意味着其 Agent 能力范围已进入万亿参数模型所代表的能力区间。


模型训练的过程中,团队采用AI 训练 AI(Auto Research)的方法,自主开展训练实验,并通过反馈持续优化训练策略。StartLux 联合创始人兼CTO 郭权玮表示:“Auto Research的定义很简单:AI看完上一轮实验结果以后,能不能自己判断下一步值得试什么。如果只是批量生成Synthetic Data,或者自动搜一组超参数,我会把它叫自动化,而不是Research。真正的 Auto Research 应该能形成“假设—实验—验证—新假设”的闭环。”
例如金融分析,早期模型拿到一个看似合理的数据就容易直接算,但环境反馈会暴露日期、交易日或原始数据不一致的问题。Auto Research 会从这类失败轨迹里归纳问题,再补充“回查原始数据—确认目标条件—再计算”的任务和轨迹。它不是 AI 凭空发明一个新算法,而是 AI 自己从失败里决定下一轮该补什么。AI 当然也会跑偏,所以只要出现某一类 Eval 涨了但泛化变差,或者明显在钻评分机制的漏洞,StartLux就会人为干预。
这套 Auto Research 方法,也指向当前全球 AI 研发正在探索的一个更前沿方向——RSI。RSI,即 Recursive Self-Improvement,通常译为“递归式自我改进”,核心是让 AI 更深地参与自身研发与改进,并最终让更强的 AI 参与创造下一代更强的 AI。Auto Research 本身并不等同于 RSI,但它可以被看作通往 RSI 的一条工程路径:先让 AI 参与提出假设、执行实验、分析结果和决定下一轮尝试,再逐步把这种能力延伸到更受控的参数更新、训练策略甚至模型结构改进。
如果说 Transformer、Diffusion 更多是在模型架构和生成范式层面推动 AI 能力演进,那么 RSI 关注的则是另一个层面的问题:一个已经存在的 AI 系统,能否进一步参与设计、实验、评估和优化下一轮 AI 系统,并让这个改进过程本身持续增强?
RSI之所以正在成为全球 AI 研发的前沿探索方向之一,是因为传统研发路径正面临多重瓶颈。过去,大模型迭代高度依赖研究员设计假设、准备数据、调度训练和分析 Eval;但随着预训练规模继续扩大,数据、算力和成本约束都在增强,更稀缺的资源则是高水平研究人员的时间——GPU 可以持续扩容,研究员的时间很难同比例扩张。与此同时,当模型在部分任务上逐渐接近甚至达到专家水平后,如何持续构造更难、同时又可验证的新训练任务,也成为新的问题。前沿能力迭代越快,红队、对齐和安全研究也必须同步扩张,这进一步提高了整个 AI 研发体系的复杂度。
这并不是一场孤立的探索。过去一年,OpenAI、Anthropic等头部实验室都开始把AI从代码助手进一步带入模型研发本身:从编写训练代码、生成数据,到运行实验、分析Eval,再到探索由AI提出研究假设、决定下一轮实验。OpenAI近期披露,其内部已经开始形成类似“自动化研究实习生”的AI工作体系:截至2026年8月,其研究组织中,每1个人类研究日对应约3.1个AI Agent工作日,AI Agent已经能够承担代码编写、实验运行、结果分析等越来越长的研究任务。Anthropic也披露,Claude已经能够编写其公司超过80%的生产代码,并进一步探索让AI参与下一代AI系统的研发。
资本已经先一步涌入。今年5月,由Richard Socher等多位顶尖AI研究者创办的Recursive Superintelligence完成6.5亿美元融资,投后估值约46.5亿美元。该公司称,其自动化AI研究系统已刷新小模型训练、训练速度、GPU内核优化三项基准的公开最佳成绩。6月,前Anthropic Discovery团队负责人创办的Mirendil,以RSI为核心方向,拿下2亿美元种子轮。人才也在向同一方向流动:在谷歌工作27年的Jeff Dean近期离职创业,新公司Discovery Loop同样聚焦把完整实验循环交给AI。更早之前,Karpathy开源autoresearch,让AI Agent在真实小模型训练环境中自己改代码、跑训练、看结果。
不过,从目前公开披露的进展来看,行业尚未出现公认意义上的完整RSI。包括OpenAI和Anthropic在内,行业仍处在“弱RSI”阶段:研究目标、评价标准、关键取舍仍握在人类手里。OpenAI也承认,4到8小时的复杂任务中,一半以上的成功案例仍需要人工救场。如何防止模型钻评分规则漏洞?如何避免补强一种能力时挤压其他能力?当AI深度参与研发,如何防止同一个系统“自己命题、自己答题、自己阅卷”?这些问题,先行者都在摸索。对此,StartLux的做法是给流程装上刹车。一旦某类评测在涨、泛化却在变差,或者模型明显在钻评分机制空子,研究员立刻介入。
在StartLux看来,公司长期积累的核心资产不局限于某一版模型权重,而是围绕真实任务形成的数据、AutoResearch、训练Pipeline、Eval和失败分析体系。相比静态模型版本,这套能持续发现问题、验证改进并迭代模型的系统,具备更高起点和生命力。郭权玮表示:“从研发上看,RSI一直是我们推进的主线之一。现在AI已经能参与任务生成、训练、Eval、失败分析和下一轮实验决策,我们下一步是在可验证、可回退的前提下,把这个闭环继续推进到更受控的参数更新和自我改进。”
按照规划,StartLux将通过新模型架构、训练算法和受控的本地参数更新机制,让模型逐步具备在本地持续自我更新的能力。目前的StartLux-V1.0-27B-Preview可在消费级个人电脑上运行,团队正推进模型的备案。第一代本地智能解决方案也预计将于年内推出。



