
Anthropic 推出 Claude Haiku 5.5,称其为速度最快、最便宜、功能最强的 Haiku 系列小型模型,综合运行成本比上一代低约 75%。OpenAI 则宣布,搭载智能界面(Intelligent UI)的 GPT-6 开始面向全球 ChatGPT 用户推出,Plus、Pro、Business 和 Enterprise 用户先行,Free 和 Go 用户次日起可用。
边想边答
GPT-6 这次改动最大的地方不在参数量,而是作答方式。以往的推理模型要先想完再答,GPT-6 则是边想边答,在思考过程中逐步组织答案。OpenAI 称,在需要联网搜索的问题上,GPT-6 Instant 平均比上一代提前 44% 开始作答,取材的准确度也有提升。
另一处改动是智能界面。ChatGPT 的回答里可以嵌入图表、表单、可点击按钮和示意图,用户让它排一份行程、算一笔账、画一张自行车结构图,得到的不再只是一段文字。按付费档位区分,Plus、Pro、Business 和 Enterprise 用户使用 GPT-6 Sol,Free 和 Go 用户使用更轻的 GPT-6 Luna,ChatGPT 里 Work 和 Codex 的底层模型此次未作调整。
严格说,GPT-6 家族不是这两天才出现。9 月底的开发者日上,OpenAI 已经发布面向编程和专业任务的 GPT-6.1 Sol,官方称其性能接近旗舰 GPT-6 Astra,价格约为后者五分之一。这一轮的变化在于,把 Sol 和 Luna 真正铺到了 ChatGPT 的对话入口。
小模型开始拼成本
Anthropic 这边的关键词是便宜。10 万 token 以内的请求,Haiku 5.5 输入每百万 token 0.10 美元、输出 0.50 美元,官方口径下综合运行成本比 Haiku 4.5 低约 75%。同步下调的还有 Sonnet 5.5 的缓存读取价,从每百万 token 0.20 美元降到 0.10 美元,官方测算多数智能体任务的成本因此下降约 20%。
几个关键基准上的分数变化很大。操作电脑的 OSWorld 从前代的 15.7% 升到 72.4%,命令行编程的 Terminal-Bench 4.0 从 0 分涨到 39.2%,知识工作 GDPval-AA 拿到 1620 分。
这是 Haiku 系列第一款支持可调性能档位的模型,用户可以按任务复杂度在成本和智能之间取舍,默认档位为中等。Anthropic 把它定位成 Opus 5.5、Sonnet 5.5 执行编码任务时的子智能体,大模型负责规划,它负责跑具体的子任务。
有一处细节可以留意。Haiku 5.5 换了新的分词器,完成同一个任务消耗的 token 会比上一代多一些,单价的降幅会有一部分被抵消。官方没有给出统一的实际节省数字,只交代了这个技术变化。
国产模型的三条路
把时间往回拨到国庆假期,国内的节奏也没有慢下来,方向更集中。
月之暗面的 Kimi K3.1 模型标识出现在 API 平台后台,可被调用,官方开放平台挂出预告,支持 100 万 token 上下文,提供 Low、High、Max 三档推理强度,预计 10 月正式发布。阶跃星辰 Step 5 Preview已经发布,采用稀疏 MoE 架构,总参数 600B、激活 27B,同样是 100 万 token 上下文,官方称单任务成本约为 Claude Opus 5 的八分之一,定档 10 月 15 日开源。快手可灵 Kling 4.0 开启内测,单次原生生成最长 30 秒,最多支持 10 张关键帧输入,提供 4K 和 1080p 的 10-bit HDR 输出,Kling 4.0 Flash 已先行开放体验。
三家切入方向不同,分别涉及长文本、推理效率、视频生成等。字节豆包被传出内测个人助理项目 "Spell",计划与豆包产品进一步结合;智谱 GLM-5.3 在海外开发者社区的讨论度走高,节前节后股价出现上涨。
DeepSeek 开源了面向华为昇腾算力平台的全套基础设施组件,涵盖 TileLang 高级语言编译工具、计算库与分布式通信库,与此前面向英伟达平台的开源组件一一对应。
钱和算力的同向动作
假期里的另一条线索是资本和算力。
据报道,Anthropic 已向部分机构投资者发出邀请,最快于 11 月 9 日当周启动 IPO 路演,目标估值在 1.8 万亿至 2 万亿美元之间。招股书显示,其 2025 年收入约 46 亿美元,同比增长近 12 倍,同时承诺未来十年至少 5180 亿美元的算力基础设施支出。DeepSeek 也被报道接近完成至少 120 亿美元融资,估值约 750 亿美元,腾讯与宁德时代在主要投资方之列。
芯片侧的动作同样密集,AMD 以 82 亿美元全股票收购李飞飞创办的世界模型公司 World Labs,补齐其在物理 AI 方向的短板;英伟达此前以约 129 亿美元收购开源社区 Hugging Face。10 月 3 日凌晨,英伟达股价盘中大涨,市值重回 5.7 万亿美元,距离 6 万亿只差一步,同步推出起售价 4999 美元的 DGX Spark 桌面 AI 超算 64GB 版本。
落地场景里,机器人的动作最密集。国庆假期,机器人在景区和商场集中上岗,据不完全统计,近 30 家具身智能及机器人企业进入文旅、零售和消费服务场景,在岗规模达到数千台,承担迎宾、导览、制作咖啡和冰淇淋等任务。这类场景门槛低、曝光高,收入目前依赖假期客流和产品的新鲜感,能否长期立住,还要看后续的复购和运维成本。
把这段时间的消息放在一起,有几处变化是共通的。
竞争的落点变了。Haiku 5.5 的可调档位、阶跃按单任务口径报出的价格、Kimi 的三档推理强度,回答的是同一个问题:处理一类任务,值得花多少算力。降价和调档是一件事的两面。
衡量模型的标准也在变。GPT-6 把答案做成可交互的界面,OpenAI 把 computer use 接进智能体接口,Anthropic 把 Haiku 做成子智能体,国内几家的新模型也都在引入智能体模式。模型好不好,越来越看它能不能把一件完整的事办完。
国产厂商的路径更偏差异化与算力自主。长文本、效率、视频三条线彼此错开,避免在同一张榜单上硬碰;同时把工具链铺到昇腾这类国产平台上,减少对单一芯片平台的依赖。两件事叠加,构成国内厂商这一轮的实际策略。
资本在向有收入、有交付的地方集中。Anthropic 的收入体量和算力承诺摆在一起,说明前沿实验室的成本是刚性的;DeepSeek 的融资、芯片公司对模型公司的收购,说明钱更愿意流向能形成商业回报的环节。
节后第一周,假期里预告的几款模型要陆续落地,Kimi K3.1、可灵 Kling 4.0 正式发布,阶跃 Step 5 开源,都会在这个窗口内兑现。海外这一轮把成本压下来之后,下一个阶段比的,是谁能把这些能力用进具体场景。(本文首发钛媒体 APP,作者 | AGI-Signal 编辑 | 秦聪慧)