关于ZAKER Skills 合作
智东西 1小时前

黄仁勋力挺开源同一天,蚂蚁百灵扔出 124B “执行模型”

智东西

作者 | 王涵

编辑 | 漠影

最近一周,硅谷 AI 圈的两件大事将 AI 的路线之争推至顶点。

先是黄仁勋首条 X 推文转发 25 家巨头联署公开信,呼吁审慎监管开源 AI 模型;紧接着,OpenAI 与 Anthropic 罕见联手,超 1100 名员工联署呼吁 " 控速 ",Meta 创始人兼 CEO 扎克伯格则公开反击称这是扼杀创新。

硅谷还在吵 " 该不该开源 "" 该不该踩刹车 " 的时候,大洋彼岸的中国 AI 圈,开源和前进似乎从来就不是一道选择题。从 DeepSeek 到智谱,从阿里通义到蚂蚁百灵,中国大模型的开源步伐从未停歇

7 月 24 日——恰恰是黄仁勋发推支持开源的同一天,蚂蚁百灵正式发布了新一代原生混合推理模型 Ling-3.0-flash。该模型在 OpenRouter 与百灵官方平台同步开放限时免费 API 调用,免费期截至 8 月 3 日 23:00,模型权重将在免费期结束后正式开源。

在 Token 调用量排行中,Ling-3.0-flash 自发布其 5 天内从第 9 位跃升至第 6 位,7 月 29 日的调用量仅比 DeepSeek V4 Pro 低 0.5%。

Ling-3.0-flash 总参数量为124B,激活参数量仅为5.1B,与其 5 月开源的旗舰级思考模型 Ring-2.6-1T 相比,总参数量约为后者的12.4%,激活参数量仅为后者的8.1%,却在 12 项基准测试中有11 项表现优于 Ring-2.6-1T。

硅谷巨头们争论不休的问题 " 开源能不能既安全又强大?" 蚂蚁百灵用产品给出了自己的回答。

一、以小搏大,12 项测试 11 项超越万亿旗舰

先来看看 Ling-3.0-flash 的成绩:

在基准测试上,Ling-3.0-flash 在34 个评测维度中拿下 15 个第一、19 个第二,综合均分与 DeepSeek-V4-Flash并列第一,领先万亿级旗舰 Ring-2.6-1T(59.7 分)近 8 分

蚂蚁百灵同步提出了两项新指标:智能密度(均分 / 总参数量)与智效比(均分 / 激活参数量)。Ling-3.0-flash 智能密度达0.5,智效比高达13.2,在可比模型中双双登顶,几乎是用最少的参数撬动了最高的性能。

在代码能力方面,在 SWE-Bench Pro 测试中,模型需要理解代码库、定位问题并生成可通过测试的补丁,Ling-3.0-flash 以56.6%的得分位居参测模型第一;在一次性生成完整交互式组件的 ArtifactsBench 中,其77.0%的得分断层领先,高出第二名10 余分

MiniAppBench 要求模型根据一句话需求生成完整 APP,在 16 个主流模型平均仅 17% 通过率的硬核测试中,Ling-3.0-flash 达到25.3%,与总参数约两倍的开源 SOTA 模型处于同等水平。

通用 Agent 能力方面,BFCL-v4 是行业通用的函数调用评测,Ling-3.0-flash 以73.0%的准确率与 Claude-Sonnet-4.6并列第一。在端到端综合 Agent 评测 GDPVal v2-AA 中,Ling-3.0-flash 以1107 分的成绩在参测模型中拔得头筹。Tau3-banking-AA 将模型置于模拟银行系统中完成金融操作,其 28.0% 的得分仅次于 Claude-Sonnet-4.6

搜索 Agent 能力上,WideSearch 测试中,模型需在海量网页中快速定位与用户问题最相关的信息,Ling-3.0-flash 以73.6% 排名第三。在多智能体协作模式下,该模型在 BrowseComp 测试中达到 82.0%,与 Claude-Sonnet-4.6 的 82.1% 基本持平,验证了其在复杂网页交互中的信息获取能力。

指令遵循能力决定了模型在严格约束下的执行可靠性,IFBench 检验模型对格式、角色、语气等多重约束指令的遵循程度,Ling-3.0-flash 得分 74.5%,排名第三。LIFEBench 则测试多轮对话中的长期指令记忆与遵循能力,Ling-3.0-flash 以 77.3%位列第一,验证了其在长程交互中的稳定性。

推理能力上,在高难度数学竞赛测试中,Ling-3.0-flash 的表现基本与主流模型持平;在专家级跨学科知识推理测试 HLE 中,Ling-3.0-flash 依然领先万亿级旗舰 Ring-2.6-1T。

长上下文能力是 Ling-3.0-flash 原生支持256K上下文窗口的直接体现。在 MRCR_256K 测试中,模型需在多轮对话中定位长文本关键信息,Ling-3.0-flash 取得 81.1%,在同等规模模型中表现优异。Multi-IF 测试多轮对话中持续遵循跨轮指令的能力,Ling-3.0-flash 以 87.7% 位列第二。

二、能力实测:快、稳、省,三个字能不能站住脚?

基准测试终究是 " 考试 ",模型好不好用,得看它能不能在实际场景中帮人把事办成。

与其他模型不同,Ling-3.0-flash 的定位非常清晰:不是要取代超大参数规模的通用推理模型,而是做那个可以帮你做事的 AI。

在视觉与互动场景中,Ling-3.0-flash 的核心能力集中在两点:一是极短的首字响应时间,二是多轮对话中维持复杂空间逻辑的能力

例如在游戏开发场景中,Ling-3.0-flash 适合以" 结对编程 " 模式参与渐进式开发。模型在多轮对话中能够维持工程架构的一致性——不丢上下文、不跑偏架构、不陷入死循环。

通过三轮对话,我们用 Ling-3.0-flash 做出了一个 3D 台球模拟器。可以看到,在这个模拟器中,我们可以控制白球的击球角度和力度,彩色球被撞击后的路径也基本符合物理规律。在生成过程中,Ling-3.0-flash 的反应速度很快,几乎不需要思考,可以精准找到 BUG,并进行迭代优化。

在开发者与办公场景中,Ling-3.0-flash 展现的是长程任务的稳定性、多系统协同的调度能力,以及在严格约束下保持输出质量和格式一致性的执行力。

在多智能体协同场景中,Ling-3.0-flash 支撑了一套完整的科研工作流。不同 Agent 角色各司其职:Scientist 提出假说、Data Analyst 检索与验证、CrossValidator 交叉质询、Archivist 归档沉淀、Writer 自动产出论文与 Slide 报告。

在办公自动化场景中,Ling-3.0-flash 通过挂载 Office MCP 工具集,将自然语言指令转换为序列化的 API 调用,实现跨应用自动化工作流。

例如,用户下达单次指令后,Ling-3.0-flash 自动在 Excel 中填入数据并生成透视表,随后提取核心图表插入 Word 文档并完成排版。整个过程中,模型不依赖易出错的 GUI 模拟操作,而是通过底层协议直接驱动软件,而这正是" 稳定工具调用 " 能力的落地体现。

此外,Ling-3.0-flash 无需外部图像素材,仅凭代码便可批量生成视觉表现力突出的艺术网页。

该模型可以批量产出多款契合不同现代设计流派的页面,覆盖包豪斯、波西米亚、酸性设计等风格,难度梯度由易至难。页面完全依托CSS 渐变、SVG 路径与版式布局构建,脱离外部图片素材依旧还原了各类设计流派独有的美学特征。

三、混合线性注意力 +1/64 稀疏 MoE,把每一分算力榨干

" 小身材大能量 " 的背后,是模型架构上的创新。Ling-3.0-flash 放弃了单纯堆砌参数的思路,从预训练阶段即对计算架构进行了重新设计

Ling-3.0-flash 从预训练伊始即采用原生混合线性注意力架构,以5:1的比例交替堆叠 KDA(Kimi Delta Attention)线性注意力层与 MLA(Multi-head Latent Attention)层。

其中,KDA将上一代的 Lightning Attention 进行了升级,在 Delta Rule 的状态更新中引入细粒度对角门控,赋予不同特征通道独立的保留、衰减与写入控制能力。这让模型在处理长文档和大型代码库时,能更精准地记住跨段落的关键信息,避免在长上下文中 " 迷失 "。

MLA则通过低秩压缩将 KV Cache 大幅缩减,降低推理时的显存占用。两者以 5:1 的比例交替堆叠,让模型在长上下文效率、状态记忆与计算成本之间实现了协同跃升。

百灵团队提出的"Ling Scaling Law"认为:更低的专家激活比例带来更高的 " 效率杠杆 "。Ling-3.0-flash 进一步压缩了单次计算的专家激活比例,将每个 Token 的专家激活比例由前代的 1/32 压缩至1/64

1/64 的稀疏比例意味着,模型虽然总参数达 124B,但每次推理只需激活 5.1B 参数参与计算。通过更精细的专家路由策略,让每个 Token 只调动最相关的少数专家,将算力精准投放到当前任务最需要的地方。

此外,为了让 AI Agent 运行更快、更稳,百灵为 Ling-3.0-flash 匹配了集群级的分级缓存架构。模型创新接入了SGLang HiCache 与 Mooncake 分级缓存体系(物理双池、集群共享 L3),使长程交互无需重复计算。

该缓存架构借鉴了现代 CPU 的三级缓存设计理念,将 GPU 内存、主机内存与分布式存储分别组织为 L1、L2、L3 三级缓存。长对话和多轮交互中,已计算过的 KV Cache 可以被复用,避免重复计算。实测数据显示,长输入场景下的首字响应时间(TTFT)降低 60% 至 80% 以上

在任务稳定性上,百灵还升级了多智能体协同架构——Ling Multi-Agent。各 Agent 通过分工协作、相互校验,有效减少了单一模型在长程任务中容易 " 跑偏 " 或误判的风险。

这套架构让 Ling-3.0-flash 从一个单点执行器,升级为可支撑多角色协同的 " 集团军 " 作战平台,为高频线上服务与真实业务落地提供了支撑。

从混合线性注意力到多智能体协同,四层架构环环相扣。正是这套从底层计算到上层调度的系统性重构,让 Ling-3.0-flash 以 124B 总参、5.1B 激活的体量,在 12 项测试中 11 项超越万亿旗舰成为可能。

结语:开源、能干活,才是最大范围实现技术普惠

5 月开源万亿级 Ling-2.6-1T、Ring-2.6-1T、Ling-2.6-flash,7 月推出 Ling-3.0-flash 并计划 8 月 3 日开源,蚂蚁百灵开源节奏持续提速。

相比单纯新增模型,Ling-3.0-flash 更大的价值,是将轻量化高性价比的技术路线推向新阶段。在高并发、低延迟的 Agent 商用场景下,依托约 1/12 激活算力即可逼近旗舰模型表现,有效降低企业推理开销。

当开源模型兼顾实用性、效果与成本优势,技术普惠才有落地的现实基础。

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容