【环球网科技综合报道】训练一个 27B 的大模型,有多少研发工作可以交给 AI?上海原点星辉科学技术有限公司(下简称 StartLux)给出的答案是:约 70%。在其本地 Agent 模型 StartLux-V1.0-27B-Preview 的后训练过程中,约 70% 的实验研发工作由 AI 独立完成——包含提出实验假设、生成或筛选数据、启动训练和 Eval、分析失败轨迹,再根据结果决定下一轮试什么。人类研究员主要负责最关键的那件事:决定研究方向和关键取舍。
据介绍,模型训练的过程中,该团队采用AI 训练 AI(Auto Research)的方法,自主开展训练实验,并通过反馈持续优化训练策略。StartLux 联合创始人兼CTO 郭权玮表示:“Auto Research的定义很简单:AI看完上一轮实验结果以后,能不能自己判断下一步值得试什么。如果只是批量生成Synthetic Data,或者自动搜一组超参数,我会把它叫自动化,而不是Research。真正的 Auto Research 应该能形成“假设—实验—验证—新假设”的闭环。”
据称,这套 Auto Research 方法,也指向AI探索的另一个方向——RSI,即 Recursive Self-Improvement(递归式自我改进),核心是让 AI 更深地参与自身研发与改进,并最终让更强的 AI 参与创造下一代更强的 AI。Auto Research 本身并不等同于 RSI,但它可以被看作通往 RSI 的一条工程路径:先让 AI 参与提出假设、执行实验、分析结果和决定下一轮尝试,再逐步把这种能力延伸到更受控的参数更新、训练策略甚至模型结构改进。
过去一年,OpenAI、Anthropic等头部实验室都开始把AI从代码助手进一步带入模型研发本身:从编写训练代码、生成数据,到运行实验、分析Eval,再到探索由AI提出研究假设、决定下一轮实验。
OpenAI 披露,内部已搭建 “自动化研究实习生” 体系;截至 2026 年 8 月,每 1 个人类研究工作日,对应约 3.1 个 AI Agent 工作日,AI 可独立完成代码开发、实验执行、结果分析等长链路科研任务。Anthropic 也表示,Claude 承担了其超 80% 生产代码,并推进 AI 参与下一代大模型研发。
资本与人才同步涌入该赛道。今年 5 月,Recursive Superintelligence 完成 6.5 亿美元融资,投后估值 46.5 亿美元,其自动化 AI 研究系统拿下三项公开基准最优成绩。6 月,Mirendil 获 2 亿美元种子轮,主打 AI 自动化研究。人才方面,谷歌 27 年老将 Jeff Dean 离职创办 Discovery Loop,目标是让 AI 接管完整实验闭环;Karpathy 此前开源 autoresearch,实现 AI Agent 自主调代码、训练小模型、复盘结果。
如何防止模型钻评分规则漏洞?如何避免补强一种能力时挤压其他能力?当AI深度参与研发,如何防止同一个系统“自己命题、自己答题、自己阅卷”?这些问题StartLux的做法是给流程装上刹车。一旦某类评测在涨、泛化却在变差,或者模型明显在钻评分机制空子,研究员立刻介入。
在StartLux看来,公司长期积累的核心资产不局限于某一版模型权重,而是围绕真实任务形成的数据、AutoResearch、训练Pipeline、Eval和失败分析体系。相比静态模型版本,这套能持续发现问题、验证改进并迭代模型的系统,具备更高起点和生命力。郭权玮表示:“从研发上看,RSI一直是我们推进的主线之一。现在AI已经能参与任务生成、训练、Eval、失败分析和下一轮实验决策,我们下一步是在可验证、可回退的前提下,把这个闭环继续推进到更受控的参数更新和自我改进。”
据透露,StartLux将通过新模型架构、训练算法和受控的本地参数更新机制,让模型逐步具备在本地持续自我更新的能力。目前的StartLux-V1.0-27B-Preview可在消费级个人电脑上运行,团队正推进模型的备案。第一代本地智能解决方案也预计将于年内推出。(青山)