8 月 3 号,阿里把 Qwen3.8-Max 正式放出来了。2.4 万亿参数,Qwen 家族目前最大,基于 Qwen3.5 架构。同一天,企业级 Agent 产品”千问办公”(QwenWork)开启公测,网页版和 PC 客户端已经能用,钉钉的入口要等近期才开。
放在半年前,这种发布大家会先问一句:跑分多少?这次不太一样。Arena 榜单上阿里确实排第二,仅次于 Claude 系列。这个当然值得一提,但官方宣传里,参数和榜单都没被怎么强调。他们反复讲的是另外几件事。
从一个空文件夹出发,自主完成一个十数天的真实项目,全程不用人管。你丢给它一句话”创建一个自进化的智能体 Harness”,它自己编程了大概 16 天,做出一个能用的东西,叫 oh-my-cli。还有个案例,把法务团队约一周的审阅量压缩到一小时。
我盯着”16 天”看了半天。以前说一个模型强,说的是单轮回答质量高;后来加了长上下文,说它能记住更多东西。现在阿里直接把”能干多久的活”当卖点。模型不再是回答问题的工具,更像一个能连续干半个月活的数字员工。这个转变比参数大小有意思多了。
价格也给得挺狠。国内每百万 token 输入 12 元、输出 36 元,命中隐式缓存只要 1.5 元;国际价格大概是 Opus 5 的 40% 和 24%。官方还说权重下周就开源,顺便带一个 Qwen3.8-27B。
最强模型、白菜价、全开源,这三样叠在一起,闭源厂商最难受的其实不是跑分被追上,而是开源旗舰开始替”推理成本”定价了。人家卖多少钱,它只收四成(输出更是只有两成四),还能自己部署。开发者没有理由不重新算这笔账。
再说千问办公。它是把 QoderWork、MuleRun、悟空三个产品整合出来的,号称业内首款同时支持桌面端 Agent、云端 Agent、企业协同 Agent 的产品。官方讲了个律所的案例:资深律师做完第一份并购尽调报告,把整个过程沉淀成”组织级 Skill”,团队新人以后接同类案子直接调用就行。
这个点我觉得是全场最值得琢磨的。单个 Agent 帮你干活是旧故事,把一个人的经验变成团队随时能调用的资产,才是企业场景里有复利的地方。当然,“组织级 Skill”能不能沉淀得干净,会不会变成没人维护的垃圾文档,还得看产品怎么设计。
冷水也得泼。所谓 16 天自主编程、一周压到一小时,都是官方演示。真实生产环境里的长程任务,出错率、需要人盯着的时间,都不会像宣传片那么好看。我见过太多 Demo 级 Agent 在自己业务数据上翻车了。能连续干多久,和能干对,是两回事。
但方向我认。模型竞争正在从”谁更聪明”转向”谁能自己把活干完”,谁先把长程任务的可靠性做出来,谁就拿到下一轮的话语权。阿里这次至少把旗帜插在了这个位置上。
价格战会打成什么样,闭源厂商怎么接招,我等着看。
参考来源:
- IT之家:阿里巴巴千问 Qwen3.8-Max 模型正式上线,总参数量 2.4 万亿:https://www.ithome.com/0/984/897.htm
- 新浪科技:阿里”千问办公”开启公测,注册可获 2000 积分:https://finance.sina.com.cn/roll/2026-08-03/doc-inikzeav2867194.shtml