7 月 16 号月之暗面发布了 Kimi K3,到现在快两个月了,热度降了不少,正好适合冷静聊聊。2.8 万亿参数,全球第一个开源的 3 万亿级别模型,权重已经放出来了,技术报告还在路上。这些数字都挺唬人,但我真正在意的其实是另一件事
先说模型本身,有几个细节我觉得比参数总量更有信息量。K3 用了他们自研的 KDA(Kimi Delta Attention)混合线性注意力,加上注意力残差,MoE 稀疏度拉得很高:896 个专家里只激活 16 个。官方说这套架构让 K3 相比 K2 的整体扩展效率提升了约 2.5 倍。翻译一下:同样烧钱,能换到更多能力。上下文 100 万 token,原生支持视觉理解,思考模式常开,推理强度分 low、high、max 三档。还有个不太好意思提但很能说明问题的数字:过去 12 个月里有 9 个月,开源模型的规模上限都是 Kimi 家的。这已经不是发一两个爆款了,是把刷榜当成日常运营在做。
回到 Swarm 这件事。为什么大家都在往多 agent 方向走?因为单 agent 撞墙了。上下文拉到 100 万 token 也没用,任务链条一长,模型就会忘事、跑偏、在第二十步把第三步的结论推翻。一个 agent 干不完长活,那就拆开,一群 agent 各管一段,并行跑。跟写代码从一个人闷头干变成团队协作,是同一个思路。
但我对这条路一直有保留。多 agent 不是免费午餐。上游 agent 理解错一个需求,下游十个 agent 会忠实地把错误放大十倍,而且个个信心满满。agent 之间还得对齐状态、传递上下文,这些协调开销最后都算进 token 账单。最要命的是谁来验收:一个 agent 的输出你还能审,五个 agent 互相引用之后产出的东西,你基本只能选择信或者不信。一群平庸的 agent 组队,得到的大概率不是天才,是更贵的平庸。
Kimi 官方的宣传语是”构建可玩的多人与 3D 游戏,生成咨询级 PPT”。demo 我信他们做得出来,但 demo 和”我周一早上敢把活交给它”之间隔着整个太平洋。这话不是我针对 Kimi,对所有家都一样。
有个商业细节挺有意思。K3 是旗舰模型,但解锁门槛是充值 10 元,而且新用户送的 15 元代金券明确不能用在 K3 上。2.8 万亿参数的模型推理成本肯定不低,却把 API 价格压到几乎白送,还专门堵住羊毛党的路。这说明他们在赌:赌架构带来的 2.5 倍效率提升能把成本打下来,赌开发者一旦用上就离不开。再配上直接开源权重,整盘棋看得很清楚:模型白给你,生态我拿走。
所以我的态度是
技术报告出来之后我会再写一篇,重点看 benchmark 和真实任务里的表现。现在下结论还太早,唯一可以确定的是
信息来源:
- Moonshot AI 官网(K3 发布时间线): https://www.moonshot.cn
- Kimi 官网(Swarm 与 Goal 模式): https://www.kimi.com
- Kimi K3 官方文档(架构、参数、定价): https://platform.kimi.com/docs/guide/kimi-k3-quickstart