18个模型跑科研速通,没有一个想出新方法:AI科研拼的是试错吞吐量
Prime Intellect让18个前沿模型自主跑nanoGPT优化速通,153次实验没有一次提出全新方法. 开源权重模型Kimi K3靠Harness逼近Opus 5,AI科研的胜负手开始从idea转向试错吞吐量.
1027 字
|
5 分钟
豆包工作发布,字节赌的是上下文
8月25日字节正式发布豆包工作,前一天TRAE、扣子刚并入豆包. 飞书深度打通,Agent直接继承企业上下文. 微软Aion、腾讯WorkBuddy同场竞技,为什么说AI办公的下半场拼的是上下文而不是模型.
1139 字
|
6 分钟
Codex Harness 开源,DeepSeek 的 Harness 拿了 18.8 万星:AI 编程开始卷运行时了
OpenAI 开源 Codex Harness,DeepSeek Harness 开源 11 天拿下 18.8 万星。AI 编程的竞争,正在从模型卷到 Agent 运行时,而开发者该关心的是别把生产链路焊死在预览版上。
1128 字
|
6 分钟
DeepSeek 终于给模型装上了眼睛:聊聊 V4-Flash-Vision-Exp
8 月 21 日 DeepSeek 悄悄上线多模态模型 V4-Flash-Vision-Exp:一张图最多按 384 token 计费,价格和 Flash 一样,官方称多模态 Agent 能力接近 Opus-4.8.补上视觉拼图,DeepSeek 的 Agent 全家桶还差什么?
902 字
|
5 分钟
阿里把 GUI Agent 从演示干成了真机模型:聊聊 Qwen-UI-Agent
8月21日,阿里通义推出 GUI 智能体基座模型 Qwen-UI-Agent:100多台真机,150多个App训练,一个模型覆盖手机电脑网页和搜索,官方口径直接对标 GPT-5.6 Sol.聊聊这波 GUI Agent 竞赛卷到了哪一步.
935 字
|
5 分钟
从宇树上市看人形机器人:故事讲完了,该交作业了
宇树科技上市首日大涨460%,次日机器人板块就崩了。聊聊这只人形机器人第一股背后的估值与落地,以及赛道从讲故事到交作业的转折。
1135 字
|
6 分钟
GLM-5.3 发布:同一个基座,靠后训练把编程能力拉了 50%
智谱 8 月 14 日发布 GLM-5.3,基座和 GLM-5.2 一模一样,全靠后训练把编程能力提升 50%,Terminal Bench 3.0 翻了约 6 倍。开源模型的竞争,正在从预训练转向后训练。
1033 字
|
5 分钟
600 亿收 Cursor,70 亿收 OpenRouter:巨头买的都不是模型
8月14日和16日,SpaceX以600亿美元拿下Cursor,Stripe以超70亿美元买走OpenRouter.两笔天价收购买的都不是模型,而是模型和开发者之间的中间层.
1188 字
|
6 分钟