Naive AI 正在探索一条令人振奋的新路径:让现有的AI模型肩负起下一代模型的研发任务,并且每一代诞生的模型都能比前一代承担更多的研发工作。
10天前,Anthropic公布了一组罕见的内部数据:公司内部的AI研发工作中,已有26%由Claude“主导”完成。所谓主导,是指研究员只需给出一条高层指令,Claude就能端到端地完成任务的大部分,人类负责监督。而在今年2月,这个比例还不到1%。
而这并非孤立事件。更早几天,OpenAI宣布去年定下的“自动化研究实习生”目标已经达成:按标准工作日折算,其研究团队每投入1个人类工作日,就有约3.1个智能体工作日在同时运转。
9月21日,OpenAI又提议由美国牵头制定前沿AI全球技术标准,并把递归式自我改进(RSI)列为重点议题。
国内,智谱也在9月17日披露,由GLM-5.3驱动的Infra Agent在十万卡国产集群上,从零搭起了GLM-5.3-Flash的推理服务。
OpenAI博客中对RSI的定义
短短半个多月,“让AI研发AI”就已经从一个偏理论的话题变成了头部实验室争相公开的量化指标。
但仔细看,这些数字回答的大多是同一个问题:研发下一代大模型,AI能接手多少工作?
而就在今年2月,当Anthropic的AI“主导”比例还接近零的时候,代季峰的创业团队Naive AI成立了。
这家新创公司从一开始就摒弃了传统以人类为中心的研发体系,把写代码、跑实验、监控流程、分析结果等研发工作交给了AI模型。而人类研究员把精力集中于三件事:提出目标,设定约束与评价标准、最终决策。
从第一天起让AI研发AI,这家新公司交出了首款模型
路线选择上,Naive AI专注于开源模型后训练与Agent研发,没有从零预训练,而是以开源模型为起点,做架构改造、增量预训练和后训练。
开源生态正在成为新一批实验室的起点。前OpenAI首席技术官Mira Murati创办的Thinking Machines Lab,7月推出的首款模型Inkling虽是从零训练,架构却沿用了DeepSeek-V3的混合专家设计。
Naive AI更进一步,直接基于开源基模继续训练和改造。开源基模已经足够强,新实验室的竞争点,正从“能不能从头训出一个基模”,转向“能不能更快、更好地把基模改造成自己要的样子”。
Naive AI押注的,正是后者背后的研发效率。
其刚刚发布的首款模型Naive-N0.5-Flash,总参数量为309B,激活参数量为15.5B,原生支持百万token上下文,面向编程与AI研发。
它有一个双重身份:由AI参与研发,也被专门训练来承担AI研发工作。
技术报告显示,AI已经参与了注意力架构的探索,以及训练、推理和部署系统的优化。研究员设定目标、约束与评价标准,AI据此实现候选方案、运行实验,并根据结果继续调整;涉及架构选择等关键决策,仍由研究员把关。
官方的两个配套案例,让这套研发方式有了具体的呈现:
在推理运行时NaiveRT的优化中,研究员与AI用六天推进了151轮实验,将同一系统的一轮完整投机解码耗时从12.3毫秒降至3.4毫秒。
另一项任务中,Naive-N0.5-Flash接下世界模型研究工作,经过累计400小时、15轮主要实验,持续调整数据、训练方案与推理策略,最终得到AutoWM,其已跻身WorldArena第一梯队。
此外,Naive AI实习生、清华博士生Shiqian Su也在𝕏上分享了一个使用Naive-N0.5-Flash训练Jev模型的示例,所得到的多模态类Jev模型在俄罗斯方块与贪吃蛇这两个小游戏上的表现非常亮眼,均优于Jev以及开源的Laya。
让Naive N0.5承担训练工作,训练出来的多模态模型负责玩俄罗斯方块和贪吃蛇。环境与数据准备、模型和训练方法选择、测试构建,以及后续的训练、评估、纠错和迭代,都由Agent自行推进。这个过程中,Agent还会根据获得的证据调整方案。
这些案例背后,Naive AI正在尝试把模型投入后续研发,让它参与解决下一轮迭代中的实际问题。而这条路线的起点仍是模型本身的能力:它能否读懂论文、实现方法,并在一连串实验之后,找到值得继续推进的方向?
围绕这些问题,Naive AI的首份技术报告给出了从模型设计、训练到研发任务评测的一套结果,也让外界得以具体观察,这个创业团队准备怎样进入大模型竞争。
摒弃传统,走向AI原生的研发方式
把一篇机器学习论文交给模型,距离得到可以检验的复现结果,中间还有很长一段路。模型需要理解方法、完成实现、组织实验,还要处理运行过程中不断出现的问题。
围绕这些研发任务,Naive-N0.5-Flash交出了一组非常亮眼的核心评测结果。
先看考察论文复现能力的PaperBench。Naive-N0.5-Flash取得了63.2分,高于报告中的Claude Opus 4.7、GPT-5.5和MiniMax M3。
对于一款面向AI研发的模型,这项成绩提供了一个直接的观察窗口:面对论文中的研究方法,它能将多少内容落实为具体实现。
机器学习工程提供了另一种考验。在源自Kaggle竞赛任务的MLE-bench-30上,Naive-N0.5-Flash取得了73.7%的成绩,任务涉及围绕数据开展模型训练与实验。
进一步聚焦模型研发,在要求固定计算预算下进行语言模型后训练的PostTrainBench上,它取得了37.5分。
Naive-N0.5-Flash的AI研发相关评测与优化结果,涵盖模型后训练、机器学习工程、论文复现、训练和GPU算子优化。
这几类评测覆盖了研发中的不同环节。论文复现关注对已有研究的理解与实现,机器学习工程考察解决具体任务的能力,后训练任务则要求模型在资源约束下寻找改进方案。它们共同提供了判断模型能否参与研发的依据。
上图中还有一组对照值得留意。在Sol-ExecBench(GPU算子优化)、NanoChat AutoResearch(固定预算下的训练改进)和NanoGPT SpeedRun(训练提速)三项任务上,比较对象是Recursive Superintelligence。这家由Richard Socher担任CEO、田渊栋参与联合创办的公司,专做自动化AI研究。
该公司在6月公布了首批结果:社区优化了两年多、累计83次人类刷新纪录的NanoGPT Speedrun,被它的系统从79.7秒压到了77.5秒——而现在Naive-N0.5-Flash将这个成绩提到了73.8秒。
编程能力是完成这些工作的基础。在要求根据自然语言需求生成代码仓库的NL2Repo上,Naive-N0.5-Flash得分为71.9,高于DeepSeek-V4.1-Flash。
在面向长程专业任务的ALE-CLI上,它取得32.4分,接近GPT-6 Astra与Opus 5.5。
Naive-N0.5-Flash的编程与长程任务评测结果,涵盖软件工程、代码仓库生成、终端操作等任务。
看起来,Naive-N0.5-Flash在论文复现、机器学习工程和长程任务中,展现出了相当强的竞争力。
研发任务还有一个实际特点:工作推进得越久,需要处理的历史信息往往越多。一次训练报错,可能需要结合此前的代码修改来定位;决定下一轮实验方向时,又需要回看已有结果及其对应配置。
而原生1M上下文为保留这些任务历史提供了空间。代码、工具返回与实验记录能够被纳入更长的交互过程,为模型关联分散信息、持续推进任务提供支撑。
按照报告披露的开放方案,Naive-N0.5-Flash的模型权重与推理代码采用MIT许可,将提供API。输入、输出与缓存读取的价格,分别为每百万token 0.6、2.6和0.07人民币,研究者和开发者可以据此选择部署与接入方式。
长上下文也会带来具体的计算负担。要让模型在持续交互中保持可用的运行效率,注意力计算、跨卡通信和显存管理都需要跟上。Naive AI对模型架构与训练系统的改造,正是围绕这些问题展开。
接下来,我们进一步看看首款新模型的诞生过程,AI同样承担了不少具体工作。
研发N0.5,AI参与到了哪一步?
研发Naive-N0.5-Flash,首先要解决百万token上下文带来的效率问题。团队以开放权重的MiMo-V2.5 base为起点:这个基模的大多数层采用滑动窗口注意力(SWA),关注局部信息,少数全局注意力层负责保留长程信息。上下文增长到百万token级别后,这几层全局注意力会贡献相当一部分解码开销。
Naive AI将改造目标放在了这些层上,用DeepSeek稀疏注意力(DSA)替换全局注意力。DSA先通过轻量索引器对历史位置打分,再选出其中的2048个位置,交给主干网络计算注意力;SWA则处理128 token的局部窗口。整个网络以五层SWA搭配一层DSA的布局为主,构成一套混合稀疏注意力架构。
SWA—DSA混合注意力架构
团队还采用了四个KV分组的GQA,并设计了具有16个query头的轻量索引器,进一步调整索引与注意力计算的开销。需要说明的是,DSA的索引器仍需扫描完整历史,相关层也仍需保留完整KV缓存,这套改造主要减少了主干注意力的计算量与访存量。
把索引器的查询头从64个减到16个,可以显著降低长上下文稀疏注意力的处理耗时。
这套方案由研究员与AI共同探索得到。研究员设定目标与评测协议,要求在提升长上下文解码效率的同时保持模型质量;AI负责实现候选架构、运行消融实验并汇总结果。在满足目标的方案中,研究员最终选择了工程实现较为简洁的一种。
改完注意力结构,模型还需要重新适应信息的读取方式。为此,Naive-N0.5-Flash在1M上下文配置下完成了累计3.25T token的多阶段训练:
首先,最初的50B token用于索引器预热:冻结模型其余参数,让准备切换为DSA的层继续使用全局注意力,再以其注意力分布为监督信号,通过KL散度损失训练索引器。
随后,模型切换到稀疏注意力,进行3T token的继续预训练,以语言建模损失为目标,适应新的信息选择与聚合机制,并强化编程和AI研发能力。
最后,再用200B token进行监督微调(SFT),并逐步降低学习率。
这次切换中,AI承担了一项验证工作:以全局注意力结果为参照,分析索引器选出的top-2048位置的召回情况。报告称,AI在这个过程中发现并修复了top-k选择的数值稳定性问题,又独立验证了修复结果。研究员据此确定切换时机与精度阈值,并统一训练和部署阶段的验证标准。
更深一层的工作发生在训练系统中。百万token的序列需要被分配到多张GPU上处理,如何交换各卡上的信息,会直接影响训练效率。
AI在分析混合架构时,抓住了两类注意力的访问差异:DSA需要完整历史,SWA关注左侧的局部窗口。基于这一点,它提出并验证了混合序列并行方案:DSA层使用Ulysses序列并行,通过all-to-all重分配访问完整序列;SWA层采用重叠分片,与左侧相邻分片交换必要的重叠区域。
这样,SWA部分的通信复杂度就从随序列长度增长的O(L),降到了与窗口大小相关的O(w)。这一思路也被延伸到推理侧,让长上下文预填充、按行分片计算和索引检索分别采用相应的上下文并行方案。
显存管理同样需要细化。针对稀疏索引与注意力对齐产生的中间激活,AI分析重计算路径,将卸载粒度细化到单个算子的输出,让不同中间结果可以分别配置卸载策略;top-k索引则显式保留,在重计算时继续使用已选位置。长序列下的检查还发现了位置编码精度问题和序列索引越界风险。
按照披露的数据,这套训练系统在1M上下文配置下,使用512张GPU,约四天可以完成1T token的训练。支撑研发运行的基础设施还包括沙箱、算力和权限管理平台,公司称其每周支持近千万次沙箱运行,峰值并发达到十万个。
这些细节让“AI参与研发”有了具体内容:它需要理解计算依赖,找到数值或性能问题,再通过实验判断修改是否有效。研究员负责设定约束和作出关键决策,AI承担大量分析、实现与验证工作。
同样的研发方式,也延伸到了接下来的推理系统优化与世界模型研究中。
两个Demo案例:AI4AI能力有多强?
NaiveRT和AutoWM提供了两个具体观察窗口,分别展示了AI在底层系统优化和跨领域研究中的参与方式。
NaiveRT是一个推理运行时。
它针对长程强化学习任务中的一个实际问题:单条任务轨迹可能需要持续生成大量token,少数耗时特别长的轨迹,就可能拖住整个训练批次。提高单条序列的解码速度,有望缩短这些样本的等待时间。
围绕这个目标,研究员与AI在六天内推进了151轮优化实验,其中63轮的改动被采纳。AI分析整网性能,实现候选方案,再通过数值验证和多卡测试检查结果,优化涉及算子融合、数据搬运和GPU执行调度等多个环节。
实验中也有走不通的方向。例如,一条MoE算子融合路径连续尝试了七轮,每一版的数值结果都正确,端到端性能却全部下降。分析发现,原有算子边界的开销已经大部分被执行重叠覆盖,融合又引入了额外同步,研究员最终叫停了这个方向。
最终,在同一套系统上,NaiveRT将一轮包含草稿生成、验证、采样与提交的完整投机解码,从SGLang的12.3毫秒缩短至3.4毫秒,延迟下降72.4%。
在八张前沿GPU上,它还测得2,122 token/s的单流解码峰值:这一数字来自41个HTML/SVG生成请求中的最佳一秒窗口,测试关闭思考模式,且不计入预填充时间。
NaiveRT单轮投机解码耗时对比
AI参与研发的过程:151轮实验中,63轮改动被采纳、71轮验证失败或回滚、17轮用于探索。曲线上的下降台阶,对应一项或多项改动进入实际执行路径。
AutoWM将任务扩展到了世界模型研究。
一位研究员向Naive-N0.5-Flash给出研究目标、算力预算和评测协议,此后由模型持续推进方案设计、训练与评测,并根据实验结果决定下一步尝试。
研究从复现FlowWAM开始。早期对无分类器引导和时间步的调整提升有限,模型随后转向数据与训练方案:重写视频描述,将训练集从2500段视频扩充至22500段,筛除评分较低的样本,并调整帧采样和rollout结构。换用更强的基模、配合更高质量的数据后,成绩继续提高。
随着实验推进,模型还发现,WorldArena的部分指标无需真实参考视频即可计算,可以被用于指导输出选择。它开始搜索不同时间步生成的结果,将帧选择建模为用动态规划求解的背包问题,并进一步探索Best-of-N视频选择与后处理策略。搜索规模扩大也未必有效,其中一项配置中,N=32的表现反而低于N=16。
累计400小时、15轮主要实验后,团队按WorldArena-1 Track 1的公开协议,在视频质量评测中测得77.43分,高于报告记录的当时公开最高成绩73.64分。
这项结果包含训练改进、推理时筛选和后处理的共同贡献,也记录了模型如何在实验反馈中逐步调整研究路线。
AutoWM研究进展曲线
Naive AI将这类实践视为探索递归式自我改进(RSI)的一部分:让模型参与后续模型与系统的研发,再逐步扩大它能够承担的工作范围。
迈向递归式自我改进(RSI)
2026年进入大模型赛道,Naive AI选择了一条不同的路:用AI研发AI。以开放基模为起点,它围绕研发任务强化Naive系列的能力,同时让AI深入参与架构改造、训练与系统优化。
这次披露的技术报告和两个案例,让这条路线有了一批可以具体检验的成果。
接下来,更值得关注的是,这些成果能为下一轮研发带来什么。推理速度提升,可以缩短实验中的生成等待;模型更擅长读论文、写代码和分析结果,也有机会帮助研究员更快找到有效方案。如果这些改进能够持续积累,团队就有望在相同的时间和资源预算内,推进更多有效的探索。
这也是Naive AI希望逐步形成的递归式自我改进(RSI)闭环:让AI参与后续模型与系统的研发,再让提升后的能力继续推动下一轮改进。
放到整个行业里看,RSI到底指什么,眼下仍在争论之中。
OpenAI在9月21日的提案中明确表示,完全自主的RSI目前尚未发生,在能够安全实现之前也不应追求。Anthropic同样强调,Claude在其统计的任何一类研发工作中都尚未完全自主。
谷歌与Google DeepMind等机构在9月中旬发布的Dream-RSI则走了另一条路:模型权重不动,只让智能体从过往的搜索记录中学习更好的探索策略。“自我改进”改的究竟是权重、系统,还是做研究的方法,各家给出的答案并不相同。
Naive AI目前的实践,同样是研究员把握方向、AI承担大量执行。它的不同之处在于目标:让研发的产物和研发的执行者逐渐合二为一,Naive系列既是这套体系造出来的模型,也被训练成这套体系里的研究员。如果你想了解更多关于AI研发的最新动态,可以通过九游官方入口获取更多资讯。
两个案例已经展示了AI承担具体研发任务的潜力,这种能力能否持续转化为下一代模型的进步,还需要后续迭代来回答。
本文来自微信公众号 “机器之心”(ID:almosthuman2014),作者:RSI,36氪经授权发布。
九游体育APP下载专注九游入口,为用户提供专业可靠的体验。
围绕九游官方入口,九游体育APP下载持续打磨更优质的服务。
05条评论


Emilly Blunt
2017年12月4日下午3:12
九游体育APP下载深耕九游官网首页领域,用心服务每一位用户。