Back to news

Gupta:小米用“无名1T模型”骗过全行业,顺手验证了手机厂也能做顶级AI

Gupta 指出,OpenRouter 上匿名上线的“Hunter Alpha”一度被全行业误认成DeepSeek V4:Reuters 跟进报道、开发者在论坛里反复拆benchmark、使用曲线冲到平台第一,结果真身却是小米MiMo 团队的一款1万亿参数模型,能在性能上对标Claude Sonnet 4.6 和 GPT‑5.2,却只按大约五分之一价格计费。

这次“无品牌盲测”最关键的,是产品与团队画像:模型以“主要在中文数据上训练、知识截止到2025年5月”的设定,自报与DeepSeek 一致的cutoff,却坚持只说自己是“某个中国模型”,在8天里吃下超1万亿tokens 真实调用,等于用开发者自发选择完成了一次大规模双盲验证;背后主导者Luo Fuli 从北大ACL 学术履历到Alibaba DAMO、再到DeepSeek V2/R1 核心贡献,构成了一条典型的“学术+大厂+开源爆款”人才曲线,小米用“数千万人民币级”报价把她挖到MiMo,短短数月就把原本偏内容生成的MiMo 系列,推到“面向长时agent”的混合注意力、MTP 推理和百万token上下文架构上。

Gupta 特别强调,Hunter Alpha 的软硬组合是为“长时间自治代理”而不是“一问一答聊天”设计:1T 总参数、约420亿激活参数、混合注意力长上下文、MTP 降低推理时延,再配上每百万tokens 1/3 美元起的定价,直接给OpenAI、Anthropic 和DeepSeek 打了一记“硬件厂商也能卷到模型最前沿”的价格锚;而在叙事层面,更重要的一点是——真正的DeepSeek V4 还没出场,一个被全行业错认的新玩家,已经先用一万亿tokens 的真实流量跑完了首轮迭代。

来源:公开信息

AI

Source

·ABAB News
·
2 min read
·184d ago
分享: