小米新模型登顶开源榜,训练成本仅262万美元
小米发布了MiMo-V2.6系列,其中旗舰型号MiMo-V2.6-Pro在公开可用的AI模型中排名第一,而每次任务的成本只有竞争对手的一小部分。性能跃升来自一轮大幅扩展的强化学习,但这家公司同时也被指控借用了Anthropic的Claude。 据小米方面介绍,两款新模型中较大的MiMo-V2.6-Pro在分析机构Artificial Analysis的智能指数上得分 46分 。这使它成为当前最强的公开可用AI模型,领先于Kimi K3和Qwen等对手。更关键的是价格:每百万输入token 0.435美元 ,每百万输出token 0.87美元 。 按Artificial Analysis的计算,单个测试任务成本仅约 0.13美元 ,只是同等能力模型收费的一小部分。这让该模型处于所谓的智能与成本帕累托前沿上。 Pro是一个混合专家模型,拥有 1.02万亿 参数,每次请求只有 420亿 参数处于激活状态。与它一同发布的还有更小、更高效的MiMo-V2.6-Flash。 性能提升来自强化学习 小米将性能跃升归功于大幅扩展的强化学习(RL),即通过试错、反馈和奖励进行训练。公司从三个方向扩展了这一阶段:每个训练步骤使用更多数据、更多样的任务环境,以及更多用于给解答打分的算力。 小米称,这次训练用时不到 六天 ,Pro花费约 262万美元 ,Flash花费约 85万美元 。在DeepSWE编程测试中,Pro的分数从58.4升至72.6,Flash则从48.8升至65.7。 为了在这种规模下保持训练稳定,小米冻结了模型的内部概率分布机制,并增加了多层防护,防止“奖励黑客”——即模型用取巧手段骗取奖励、而非真正解决任务。 约7000个带自动评分器的任务 除了模型本身,小米还推出了一个特别快的变体Pro-UltraSpeed,输出速度最高可达前者的 20倍 。最引人注目的是,公司开放了其强化学习工具包,包括技术报告、完整训练框架、一个用于继续训练的较小模型,以及约 7000个 现成训练任务,配有面向软件开发、网络安全、办公工作和网页设计的自动评分器,另有约 1000个 音乐创作任务。 这些任务来源多样。部分代码来自员工提交的真实GitHub拉取请求和用户查询,另一些任务描述由语言模型生成。网络安全任务取材于OSS-Fuzz,一个汇集了数万个真实软件漏洞的集合,办公环境则是合成重建的。 高调开放,也处在Anthropic的瞄准镜中 这种开放姿态,与Anthropic在两周前提出的指控形成鲜明对比。在其威胁情报报告中,Anthropic审查了2025年12月至2026年8月间发现的Claude滥用案例,并点名了七个与针对该模型的活动有关的中国实验室:阿里巴巴、Moonshot AI、DeepSeek、智谱、小米、MiniMax和商汤。 据称,这些实验室总共生成了约 1.9亿次 交互,以抽取Claude的能力来训练自己的模型,Anthropic将这种技术称为非法蒸馏。 小米被点名。在一个标记为GTG-16008的案例中,Anthropic追踪到2026年3月和4月的20天里超过 40万次 交互,其中小米将其自家MiMo模型的用户对话和编程会话,通过OpenClaw和OpenCode传给Claude,目的是丰富未来模型的训练数据。报告几乎没有记录用于内部蒸馏教师模型的早期训练数据和教师数据来自何处。 换句话说,报告称小米记录了自己MiMo模型的用户对话,然后将其输入Claude以提取训练数据——而正是这些数据,如今把它推上了开源模型排行榜的顶端。 特别