(本文作者为 字母 AI,钛媒体经授权发布)
文 | 字母 AI
太刺激了。都知道模型训练很费钱,可亲眼看着小米“ 直播” 里的金额往上跳,还是有点替它肉疼。
北京时间 9 月 15 日晚,小米两款新模型先后启动了这一轮训练。到 17 日下午,还不到两天,页面上的累计成本已经超过 130 万美元,而且还在涨。好在这笔钱不用观众掏,不然看着看着,可能真得关掉网页缓一缓。

把围观地址发出来的,是小米大模型负责人、前 DeepSeek 研究员罗福莉。
当天凌晨,她在 X 上写道:“ 沉寂了近半年。” 随后解释,这段时间她和团队一直在研究,强化学习究竟能扩展到什么程度。

新模型 MiMo-V2.6 还没练完,罗福莉就先开“ 直播” 给大家看,不得不说蛮有魄力的。
不过,钱花得快肯定不是这个“ 直播” 透露的唯一信息。罗福莉过去几个月忙些什么,小米又能靠这轮训练往前追赶多少才是更关键的。
模型还没练完,先开直播了
“ 直播” 页面不难看懂,MiMo-V2.6 的 Pro 和 Flash 两款模型各占一栏。
截至北京时间 9 月 17 日 15 时 47 分,Pro 这轮训练跑了 45 个多小时,累计花费约 93 万美元。晚几个小时开练的 Flash 跑了约 40 个半小时,花费约 41.6 万美元。Pro 花的钱已经是 Flash 的两倍多。

进度上,Pro 完成了第 14 步,正在进行第 15 步。Flash 完成了第 17 步,正在进行第 18 步。Flash 看着跑得更快,但光比步数,还不能判断谁练得更好,得看看下面的测试成绩。
页面公布了一项名叫 DeepSWE v1.1 的软件开发测试。它会让模型在真实的开源项目里增加功能、修复问题,再检查交上来的代码是否符合要求。新功能做出来了,却把原有功能改坏了也不算通过。
目前页面公布的通过率,Pro 为 65.78%,Flash 为 60.77%。也就是说,在这项测试里,两款模型都能完成六成多的任务,Pro 领先约 5 个百分点。这些成绩会随着阶段性测试完成而更新,模型还在训练,现在看到的只是中途测验的成绩。

更有意思的是,网页还兼任故障通报栏,小米连训练时出了什么岔子也写在了页面上。
页面顶部的公告写着,Pro 因为一个计算节点出现显存问题,需要重启。Flash 则在一组数据上遇到了某类基础设施错误,约 3 小时内没能正确识别,最后从第 15 步重新启动。

平时看模型发布,大家拿到的是一份已经整理好的成绩单,训练中出了什么问题、重来了几次,通常没机会了解。这次小米连故障通知也挂了出来,外界可以直观看到当模型的分数在往上涨的同时,团队也还在忙着排查问题、重启训练。简直是一场行为艺术。
这种“ 直播” 很快就吸引到了同行关注。
Meta 研究员、前 OpenAI 研究员卢卡斯· 拜尔看到罗福莉介绍扩大训练规模的三个方向,忍不住替她重新“ 翻译” 了一遍:算力、算力,还是算力。玩笑开完,他又特意称赞,小米竟然连“ 目前花了多少钱” 都公开了。

加州大学圣迭戈分校副教授、强化学习研究者 Yu-Xiang Wang 也说,自己“ 看得移不开眼”,还专门提了个要求,希望团队把训练过程中遇到的各种问题记录下来。前面那些重启公告,恰好也是他想了解的内容。

曾任康奈尔大学教授、参与过 Cursor 模型研发的 Sasha Rush,也拿着手机盯起了直播。他自嘲,看一项编程任务的响应长度,看出了赌徒上头的感觉,随后又对数字的变化犯起嘀咕:“ 从 80k 跳到 120k,这个幅度感觉太大了。”
公开到这个程度,外界已经可以拿着具体细节讨论训练方法了。
说起来,小米今年 3 月还让新模型玩过一次“ 猜猜我是谁”。当时,一个叫 Hunter Alpha 的匿名模型出现在模型服务平台 OpenRouter 上。一周后,小米才在 3 月 18 日揭晓身份:这是 MiMo-V2-Pro 的早期测试版。
到了这次,罗福莉干脆提前把训练过程公开,还预告未来几周会逐步开源相关细节。至于这场训练想解决什么问题,她在推文里表示过去近半年,团队一直在研究强化学习究竟能扩展到什么程度。
半年沉寂,罗福莉到底在忙什么?
今年 4 月,MiMo-V2.5 系列发布并开源。同月上线的 《张小珺 Jùn|商业访谈录》 中,罗福莉谈到,国内团队正在加快探索 Agent 的后训练,其中一个重点就是扩大强化学习的规模。主持人追问有没有初步结果,她当时只说:“ 暂时还不是很方便分享。”
几个月后,小米把训练过程放到了网上。模型每天花着这么多钱,到底在学什么?

拿修网站来说。用户发现网站突然登录不上,让 AI 处理,它就得找到相关文件,检查哪里出了问题,修改代码,再运行测试。有时候改完依然报错,还得继续排查。用户要的是能登录,光收到一句“ 已经为您修复”,显然不算交差。
这类能使用工具、连续处理任务的 AI,就是我们经常听到的 Agent。训练时,模型会反复尝试完成任务,系统根据它的表现打分,再用这些反馈调整模型参数,让有效的做法更容易在以后出现。这是强化学习在 Agent 训练中的一种用法。
按照罗福莉公布的配置,小米每个训练步骤安排 1568 条提示词,每条对应 16 次尝试,合计 25088 条轨迹。

这里的一条轨迹,是模型从接到任务到结束的完整过程。修网站时,即使中间改了好几次代码、跑了好几遍测试,也仍然属于同一次尝试。大量这样的过程累积起来,一个训练步骤就涉及约 20 亿 token。模型读写的文字、代码等内容,都按这种单位计量。
所以,页面上一个不起眼的“step”,里面可能已经忙活了很久。
这些练习还有个准备工作:得让模型有地方操作。
比如修网站,训练系统要提供项目文件和运行代码的工具。模型代码修改以后,程序能不能正常运行,也得把结果反馈给它。只有一句“ 请修复登录故障”,却没有文件可查、没有程序可运行,它也无从下手。
罗福莉在访谈中提到,团队会先让公司内部更多人使用模型,从中发现实际需求,再围绕这些场景构造训练数据。难的是,还得尽量还原使用时的环境,让模型可以在里面连续操作,并设置相应的评分标准。
这次 MiMo-V2.6 扩大的训练环境和执行框架,就涉及这些工作。同一次训练可以混合多类任务,模型面对的工具、操作过程和完成要求也会有所不同。
而且,模型做得好不好,也需要花算力去判断。任务复杂了,检查作业也跟着费事。
程序能不能通过测试,可以交给系统运行检查。换成让 AI 分析一家公司的经营情况,就得核对数据和结论。比如它把去年的营收当成今年的,后面写得再有道理,分析也站不住脚。评分系统需要能识别这些问题,否则给错了奖励,模型还可能继续照着错误的做法学。
这也是罗福莉把“ 评分算力” 单独列出来的原因。模型尝试完成任务要花算力,判断这些尝试做得怎么样,同样要投入计算资源。
目前,编程在这场训练中占了相当大的分量。北京时间 9 月 17 日 17 时 49 分,Pro 第 14 步的代码类提示词占 67.7%,超过三分之二,此外还混合了视觉、聊天等任务。

为什么要让模型写这么多代码?罗福莉给过一个解释:软件开发往往需要连续处理很多问题,围绕它形成的规划能力、上下文管理方法,也能帮助 AI 完成其他复杂任务。
比如一个项目改到一半,模型得记住已经改过哪些地方,哪些办法试过但没用。事情多了,还要整理和保留关键信息,方便后面接着做。这些要求放到资料研究等需要多步处理的工作里,同样存在。
当然,代码练好了,也不意味着其他工作就能直接上手。罗福莉同样强调,想让模型在更多场景里表现稳定,还得安排相应的训练。
小米这次想继续摸清的,就是这些投入能带来多大的进步:增加尝试、扩充任务环境、花更多算力判断结果,模型的能力还能往上走多远。直播里的成本在涨,接下来要看的,是模型学到的本事能不能跟着有长进。
三年 600 亿元,小米要拿出什么成绩?
今年 4 月,罗福莉谈到,下一步扩大哪些部分的训练规模、采用什么芯片,会影响半年、大半年之后谁更领先。几个月过去,小米选择在强化学习上继续投入,研究能带来多大进步,也逐渐到了看结果的时候。
从 DeepSeek 研究员到小米 MiMo 负责人,罗福莉做一个技术判断,牵动的事情也多了。一个方向值得尝试,接下来就得安排人手、分配算力,再根据实验结果决定要不要继续。方向如果选得不好,花掉的还有整个团队的时间。

她在访谈中提到,训练 MiMo-V2-Pro 和 Flash,各自需要几千张计算卡,但做研究需要的卡还要更多。正式训练之前,团队得先验证各种想法。最后没被采用的方案,也不会因此免单。
所以,直播里两款模型不断上涨的成本,只是外界能看到的一部分。罗福莉还得考虑眼前这款模型继续打磨的同时,给下一代留出多少研究资源。
小米对 AI 的期待,也早已超出发布几款模型。
今年 3 月 19 日,小米创始人雷军宣布,未来三年将在 AI 领域至少投入 600 亿元。这笔钱覆盖整个 AI 业务,并非全部交给 MiMo 训练模型,这足以说明,小米希望 AI 在公司里承担多大的作用。

这种期待已经体现在业务安排上。7 月,36 氪援引知情人士消息称,小米调整了小爱同学的组织架构:罗福莉带领的 MiMo 团队提供基础模型能力,另外的团队负责云端工程建设,手机、汽车等业务的 OS 团队则负责各自的端侧能力。
按照这个分工,MiMo 往前走一步,后面还有不同的产品团队等着将之融入业务。小米有现成的设备和用户,确实省去了从零寻找应用场景的麻烦。可场景越多,对模型的要求也越复杂。
编程测试里表现不错,不代表放进手机、汽车和智能家居之后,就能让用户放心交代事情。比如用户让 AI 改一项设置,它得弄清楚说的是哪个设备,能操作到什么程度,遇到含糊的要求还得确认。一次演示可以挑最顺利的过程,卖出去的产品却每天都会碰上各种意料之外的用法。
这些问题当然不可能都由罗福莉一个团队解决,但模型能做到哪一步,会影响后面的产品能往前走多远。小米投入 600 亿元之后,用户最终感受到的仍然得是手机和其他设备到底好用了多少。
与此同时,模型同行也不会因为小米要照顾这么多业务,就更新得慢一些。
9 月 10 日,DeepSeek 发布 V4.1-Flash,把更大规模的强化学习列为提升能力的办法之一,同时强调降低运行成本。小米正在研究的方向,同行也在投入,而且成果已经放出来供开发者使用。
这也是模型竞争让负责人头疼的地方。MiMo-V2.6 相对上一代进步多少,和它能让多少开发者改用小米,是两个问题。
小米自己也已经走到了让用户掏钱选择的阶段。今年 6 月推出的 AI 编程助手 MiMo Code,在 7 月 26 日结束了免费使用阶段,用户可以订阅小米的 Token Plan 继续使用。
免费时觉得值得试试,付费后还愿不愿意继续用,要求自然不一样。
罗福莉带领的团队已经让 MiMo 获得了关注,接下来还得让这种关注经得起几轮更新。V2.6 的完整评测和实际使用表现,会是下一次检验。
更多精彩内容,关注钛媒体微信号 (ID:taimeiti),或者下载钛媒体 App















