关于ZAKER Skills 合作
钛媒体 20分钟前

决战视频 AI:字节快手玩生态,独立厂商拼差异

文 | 财经故事荟

行业独家 30s 视频原生直出,至高同时参考 50 个素材 / 白模和绿幕素材参考能力,误差控制在 1s 内,这是字节 Seedance2.5 视频模型的核心能力。

另一边,MiniMax 发布的 H3 模型,将剪辑逻辑、排版、转场、配乐、特效全部端到端集成,成为其首个开源视频模型。

美国那边也很热闹,马斯克与导演诺兰撕起来了!马斯克先挑事儿宣战将在年底前依托自家 Grok AI,打造一部历史严谨、忠于原著的 AI 版长片《奥德赛》,正面踢馆诺兰。

面对马斯克的 " 跨圈挑衅 ",诺兰霸气回怼道,马斯克纯属 " 无稽之谈。"

隔空互撕背后,暴露出视频 AI 行业的技术瓶颈与商业化困境。

在海外,Sora、Haiper、Stability AI 等一众独立视频 AI 模型,纷纷陷入业务收缩、产品下线的困境;而国内独立视频 AI 工具,在真实剧情场景的落地中,还在艰难探路。

当下赛道格局清晰分化:即梦、可灵等大厂系视频 AI 工具,背靠字节、快手的海量内容场、资金储备与完整生态闭环,能够依托生态优势摊薄试错成本、放大产品价值。而以海螺 AI 为代表的一众独立玩家,在巨头强势围剿之下,究竟该如何破局突围?

价值很可观,短板很明显

降低制作门槛、压缩制作周期、拓宽创意上限,是视频 AI 工具带给创作者最直观的价值。

英国生成式 AI 媒体公司 Synthesia CEO Victor Riparbelli 提到:" 和传统实拍相比,AI 做视频所需成本极低,不用再依赖真人演员、专业拍摄器材、实体影棚,大幅拉低内容制作门槛,让批量产出视频成为可能。"

另据 Fortune Business Insights 数据显示,全球视频 AI 生成工具市场规模将从 2025 年的 7.168 亿美元,攀升至 2034 年的 33.5 亿美元。

但现阶段,视频 AI 工具仍存在明显缺陷。我们采用统一宫斗剧情提示词,横向实测三款主流积分制模型:Mini Max 旗下海螺 AI H3 新版、Flova1.0、可灵 King3.0。

Flova 无法拍出 " 眼神戏 ":贵妃的妒意、嫔位的隐忍不甘以及皇后不动声色的威慑。也就是说,优化工作流能拉高视频基础完成度,但无法补足模型对人物心理、人与人社会关系的深层理解。

海螺 AI 角色人设错乱:大臣 " 变 " 太监;皇后全程双眼紧闭 " 沦为 " 背景板,贵妃挑衅、嫔妃对峙时的眼神转动僵硬机械,缺乏真实表演的情绪张力。作为对比,可灵生成的视频能明显区分皇后、贵妃、嫔侍、宫女之间的层级差异。

针对生成能力的差距,来自杭州的 AI 算法工程师张扬(化名)解释 " 文本大模型玩的是‘猜字游戏’,不断推算下一个输出 Token。而视频则需同时兼顾连续画面帧、人物互动及服化道、剧情因果链,承载的信息量、不确定因素大幅高于文本,生成过程更容易失控。这也是 AI 漫剧行业催生‘抽卡师’岗位的原因:从反复生成的素材中,挑选最优镜头与人物。可灵、即梦背靠字节和快手的内容优势,在针对中文内容、古装题材和人物关系,能进行更充分的训练与产品调优,这也是可灵表现相对更好的原因。"

张扬也指出,短剧、广告、影视剧题材覆盖范围极广,进一步放大了视频 AI 生成的不可控问题。写实类剧情对模型要求更高,不能仅追求画面 " 好看 ",还需遵循人物礼制、道具常识、动作逻辑与大众认知。AI 虽具备自由创作空间,但商用成片需要贴合现实规则。

张扬所说的问题,在小众专业场景表现得尤其突出,且独立和大厂视频 AI 工具均面临类似问题。

我们以盗墓题材为例,要求生成二十四山专业罗盘。然而,海螺 AI、Flova、可灵 AI 均未正确还原罗盘样貌。就算反复调整提示词继续重试,海螺 AI 甚至出现离谱画面:罗盘 " 变 " 盾牌。

当然,大厂能凭借资金、算力、内容优势,未来或许可以通过收录实拍视频、专业器物资料、标准操作流程数据,持续缩小 " 数据幻觉 ";然而," 见过样本 " 不等于 " 真正理解原理 "。

腾讯视频上线的 AI 精品短剧《北派笔记》,其创作团队针对 AI 把 " 洛阳铲 " 生成普通铁锹,通过提供给 AI 准确的 " 洛阳铲 " 参考图,但一旦人物做出挖掘动作,画面里铲下去的是洛阳铲,拔出来时却变成普通铁锹。

这意味着模型不仅要保证真实还原,更要保证连续画面不变形、人物操作符合常识。想要实现这一点,仍需要专业垂直数据集、结构性约束、生成后人工质检等多重手段配合。《北派笔记》创作团队为了让 AI 理解 " 洛阳铲 ",团队单独采风、搜集资料、建立标准,并进行针对性的模型训练和资产制作。

相比头部平台,独立厂商面临的短板不止于资金,更缺少完整的真实数据反馈闭环。用户使用即梦、可灵创造的视频 AI、AI 漫剧,字节、快手能够追踪整条链路数据:用户最终选用哪一段视频、如何剪辑、是否正式发布、成片完播率、转化效果等指标全部可追溯。这种真实数据反映,有助于持续优化模型;同时,其内容、广告和生态业务也能分摊反复生成带来的试错成本。

作为对比,大多数独立 AI 工具,只能看到用户输入了什么、生成了多少次,无从判断到底是人物崩坏、道具出错、剧情违和、审美问题导致成片作废,且如何衡量用户生成的视频真实播放量到底是多少。这意味着独立厂商既要追赶模型效果,又要承担失败生成造成的算力消耗和用户流失。

避开大厂锋芒,同向不同路

面对与大厂竞争的劣势,当前国内独立视频 AI 模型厂商走出五条差异化突围路线。

一是以海螺 AI 为代表的路线:打造通用多模态基座,面向全球市场推出订阅服务,同时开放 API 对外合作。其中,海螺 AI 持续布局海外生态,先后接入 VEED、Envato Video Gen 等海外创作平台。

在张扬看来,海螺 AI 模式为典型的 " 发动机模式 ":搭载自家 C 端产品 " 卖整车 ",对外输出 API 能力 " 卖配件。" 想要摊平高昂的研发、算力成本,就要扩大模型调用规模,分摊前期硬件与训练投入,积累真实场景数据迭代优化,构筑性价比优势。但过硬的底层模型,不等于稳定交付成片。一旦出现人物关系错乱、道具失真、剧情衔接断裂等问题,都会转化为合作方的返工成本。

Mini Max 招股书显示,截至 2025 年 9 月 30 日,海螺 AI 累计用户 4234.8 万,创造收入 1746.4 万美元。

二是以 Flova 为代表,搭建项目资产体系、多模型调度能力与一体化 AI 创作工作台。张扬解释,制作视频通常需要联动文生图、视频生成、配音等多种模型,而 Flovsa 相当于一名 "AI 总导演 ",聚合工具到统一工作台,项目内角色、造型素材一次设定、持续复用。这套方案运行成本更低、素材复用效率更高,但短板突出:某个模型输出不稳定,即便有 " 总导演 " 统筹,也难以保障镜头准确率。

今年 7 月,Flova 母公司雨舟科技获得红杉中国、IDG 资本、云九资本合计超 8000 万美元融资。

三是以 Vidu 为代表,聚焦人物与场景一致性、连续化内容生产,配套完整创作工作流。漫剧、系列长视频创作中,角色形象前后不一、频繁 " 变脸 " 是致命缺陷。而 Vidu 的核心价值是,角色、场景设定一次完成后可以反复调用,不用每段素材都从头反复 " 抽卡 "。

Vidu 母公司生数科技披露,2025 年实现用户和收入超 10 倍增长,印证市场对连续内容生产工具的旺盛需求。但我们实测 Vidu Q3 模型发现,视频画面观感精致,却存在明显漏洞:片段前半段女主没有围巾,后半段凭空多出一条厚重黑色围巾;人物相互靠近时生硬平移,观感近似统一角色设定的静态剧照拼接。这暴露出 Vidu 产品的短板:它能够稳定锁住人物五官、发型和大体服装样式,却很难把控动作逻辑、道具变化、时间线与情绪连贯性。

四是以 PixVerse 为代表,依靠模板化能力面向全球创作者获客,实现商业化变现。"PixVerse 本质是一家视频模板工厂。" 张扬说," 用户不用精细调整各项参数,选定热门特效模板、上传图片就能快速产出视频。这种模式牺牲部分创作自由度,但换来更低使用门槛与更高出片成功率。"

PixVerse 母公司爱诗科技数据显示,截至 2025 年 10 月,PixVerse 与拍我 AI 累计用户突破 1 亿,月活超 1600 万,年度经常性收入超过 4000 万美元;商业化启动以来,收入涨幅超 10 倍。模板路线能够快速起量,但热点生命周期短,特效模板极易被同行复制。若长期局限于特效层面,很容易陷入用户用完即走、难以沉淀的困境。

五是以商汤 Seko 为代表,搭建大模型底座、多模型调度能力与一体化视频交付工作流。在张扬看来,完成视频成片需要串联剧本到后期制作等不同环节,而商汤 Seko 相当于 " 视频 AI 总包负责人 ",通过打通全流程链路,按需调度适配模型,项目素材能够统一管理、重复复用。这套方案虽能够减少企业跨工具协作损耗、流程可控性更强,但短板是统一流程统筹≠成片率提升,甚至可能增加调用成本与管理难度。

" 海螺卖‘发动机’,Flova 卖‘导演工作台’,Vidu 卖‘连续剧生产线’,PixVerse 卖‘一键模板’,商汤卖‘整套视频 AI 制作总包’。"张扬总结,五种模式没有绝对优劣。想要突围,关键在于找准大厂难以深度覆盖、客户愿意持续付费的垂直生产场景,把 AI 随机生成能力,打磨成稳定、可交付的商业产品。

告别参数内卷,独立厂商突围

尽管独立视频 AI 工具同向不同路,但创作者对工具的选择,始终很务实。

《北派笔记》导演杨念总结出团队长期选用 AI 工具的三大核心准则:能否解决现有制作流程中的具体问题?节省的时间与人力成本能否覆盖学习试错成本?能否无缝接入团队现有工作流?

创作者的真实需求,也为独立视频 AI 厂商的突围指明了清晰方向。

一是跳出参数内卷,聚焦真实生产痛点。随着视频 AI 工具数量持续增加,模型风格种类、视频生成时长,已经很难拉开差距。

Runway 联合 CEO Crist ó bal Valenzuela 认为,AI 工具的成熟发展路径,是先找准精准落地场景、验证实际落地效果,再稳步拓展业务边界。

这意味着,深耕垂直赛道、攻克细分生产痛点,才是独立视频 AI 厂商的破局关键。漫剧场景重点解决角色漂移、剧集内容连贯性不足的问题。毕竟客户愿意付费的核心,是能否精准解决生产环节的实际难题。正如 Synthesia CEO Victor Riparbelli 所言,AI 技术只有嵌入能够解决企业实际需求的产品与服务,才能真正落地产生价值。

二是告别低价内卷,比拼有效成片成本。平台低价计费模式不代表整体生产成本更低,反复抽卡、人工修复会持续叠加人力与时间成本。据短剧编剧尔东透露,精品 AI 漫剧每分钟制作成本约 4000 元,普通质量作品也需 1500 元 / 分钟。

居高不下的试错成本,叠加行业极低的出圈率,让粗放式量产模式逐渐失效。DataEye-ADX 数据显示,今年上半年全网新增 AI 短剧,破亿率不足 0.5%,绝大多数 AI 短剧难以出圈变现,沦为行业炮灰。市场倒逼创作者与厂商评判标准。从 " 生成总量 " 转向 " 可用成片数量。"Victor Riparbelli 曾指出,企业客户早已不再关注 AI 的使用频次,而是聚焦技术带来的实际生产力增量。

这意味着独立厂商的竞争力,是通过角色资产库、智能拆镜、局部重绘等功能提高首轮成片合格率,人力、时间成本控制能力,才是赛道真正差距。

三是不再让团队适配工具,让工具适配现有流程。成熟内容团队均拥有一套完整的全链路制作流程。即便 AI 生成效果出众,若让团队更换软件、调整分工、迁移素材,高额适配成本会直接抹平提效收益。Adobe CEO Shantanu Narayen 认为,Firefly 热度走高的关键,是深度嵌入 Creative Cloud 生态,贴合用户原有创作习惯。

缺乏流量与生态壁垒的独立厂商,可依靠 API、插件、项目协同功能对接剪辑、广告、漫剧制作及企业素材系统。优质工具无需重构原有生产模式,而是需要嵌入产业链,成为不可或缺的效率一环。

" 海螺 AI 们 " 很难成就即梦与可灵的生态,它们的核心机会,是为客户交付更高的成片合格率、更低的返工成本与更稳定的项目交付效果。

大厂角逐的是 AI 内容生态的全域话语权,而独立视频工具的终极竞争,是扎根内容产业链,深耕细分生产环节,成为行业不可替代的效率工具。

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容