我制作完全出自电脑的广告片。而我听到最多的问题,恰恰问错了方向。

问题是:“一秒钟要多少钱?”仿佛那就是全部账单。并不是。每个比价网站用来填满表格的那个每秒价格,是最小的一项开支。真正的成本在别处——而且没人提,因为它没法整整齐齐地写进一栏表格里。

我们还是先从每秒价格说起——只是为了说明它到底解释了多么少的东西。

一秒钟名义上要多少钱

型号 价格(净列表价,美元) 片段时长 音频 可商用?
Kling 2.6 Pro Kling AI 0.07 美元/秒(无音效),0.14 美元/秒(有音效)——通过转销商 fal.ai 5 秒或 10 秒 音效使价格翻倍 免费用户不得将输出用于商业用途(ToS 4.6);仅限付费会员
Ray 3.2 Luma AI 每个片段:1080p/5 秒 = 1.20 美元(约 0.24 美元/秒),720p/5 秒 = 0.30 美元 5 秒或 10 秒 按套餐
Sora 2 Pro OpenAI 0.30 美元/秒(Sora 2:0.10 美元/秒) 仅支持 720×1280 / 1280×720 依据 OpenAI 条款
Veo 3.1 Google 标准版 0.40 美元/秒(720p/1080p),0.60 美元/秒(4K);Fast 版起价 0.10 美元/秒;Lite 版起价 0.05 美元/秒 4、6 或 8 秒 始终开启,已包含在价格中 Google 不主张所有权;在欧盟仅可通过付费套餐使用
Gen-4.5 Runway 12 积分/秒,1 积分 = 0.01 美元 → 0.12 美元/秒 按套餐 不受限制;Runway 保留使用输出结果进行训练的权利
Wan 2.7 Alibaba 通过 Alibaba Cloud Model Studio 提供;开源权重仅至 Wan 2.2(Apache-2.0) 2 到 15 秒 自有文件或自动生成 依据 Model Studio 条款

截至 2026年7月24日。所有价格均为直接取自服务商页面的美元净列表价;欧盟买家可能需缴纳增值税或适用反向征税(非税务建议)。价格、模型 ID 与可用性变化很快——做决定前请直接向服务商核实。

有两点值得注意。

第一,价差本身。 标出的最便宜和最贵的每秒价格之间大约相差六倍——Kling是0.07美元,Veo Standard是0.40美元。只看这个数字的人,会直接选Kling,完事。但这个数字完全没说你需要试多少次才能得到一个能用的片段。而真正的账单,恰恰在那里见分晓。

第二,定价页面从不放在前面的那些条件。 用Kling的免费版,你根本不能把生成结果用于商业用途——这写在服务条款第4.6条里,不在定价页上。Veo的音频始终包含在价格里;而在Kling那里,加上音频价格会翻倍。Sora 2只支持一种画面比例。而Sora再过几周就要下线了——后面细说。

没人写下来的那笔账:弃用

这是我能找到的唯一一个有据可查的实践者数字,而且相当令人清醒。

有一支在NBA总决赛中场休息时播出的AI广告片(为预测市场平台Kalshi制作),制作者PJ Accetturo公开记录了自己的工作量:大约生成了300到400次,才得到15个可用的片段。 一个人,两天。用到的工具:Veo负责视频,Gemini和ChatGPT负责提示词,CapCut和Premiere负责剪辑,Topaz负责放大处理。

把这个数字拿去对照每秒价格。如果你要扔掉20到25次尝试才能得到一个能用的,那么这一个可用片段的成本就不是每秒价格,而是它的二十倍。这时0.07美元和0.40美元之间的差别就变得次要了:真正重要的是哪个模型让你更少地弃用,而不是哪个的单秒最便宜。

这就是为什么我在这里不会加冕任何赢家。弃用率取决于你的拍摄对象——一个静止的产品镜头和一个在画面中走动的人物角色,弃用情况完全不同。谁跟你说“X模型最便宜”,谁就漏掉了那个最贵的变量。

然后是后期制作

模型生成的片段不是成品,它是素材。

就拿Kalshi那支片子明确需要的放大处理来说。Runway自家的4K放大器按帧计费,公式是公开的。一段十秒、每秒30帧的视频,光是放大就要360个积分——也就是3.60美元。对于一个生成成本是每秒0.12美元的模型来说,十秒视频的放大处理反而比生成本身还贵。片中用到的Topaz,还是另一笔独立的订阅费用。

而这还只是放大处理。此外还有:剪辑、调色、混音,把15个片段拼成一部不会让人觉得是“15段提示词硬拼在一起”的成片。这是需要花时间的手艺活——而这些时间不在任何每秒价格里。

老实说一句话:AI视频是加速器,不是替代品。提示词取代的是拍摄,取代不了电影制作本身。

哪个模型适合做什么——谨慎地说,因为明天可能就不一样了

我刻意不说“最好的模型”。我说的是截至今天,2026年7月24日,证据里写的是什么。

在Artificial Analysis的盲测竞技场里,用户在不知道品牌名的情况下给两个片段打分,截至查询日期,领先的是Gemini Omni Flash——带音频,Elo评分1245分,来自近4000票。这只是一个瞬间快照,不是自然法则:Elo分数和票数每天都在变,身后紧追的是Dreamina Seedance,以及一批一年前还没人听过的模型。

物理是最难突破的一关——而且它和画面的逼真程度并不挂钩。Google DeepMind的Physics-IQ基准测试衡量一个模型对物理过程的理解程度(物体是否正确地下落,水流是否合理)。作者们自己也强调:视觉逼真度和物理理解并不相关。一个片段可以看起来像照片一样真实,却同时呈现出根本不存在的物理规律。目前没有任何模型能接近真实视频的水平。

关于角色一致性的营销承诺——同一个人物贯穿多个镜头——恰恰只是承诺。Google在自家博客里把Veo 3.1描述为拥有“更出色的画面与音频质量”,并且可以为一个角色提供最多三张参考图。Google没有给出任何独立的测量数据。从我自己的工作经验来看:角色一致性是尚未解决的核心难题。参考图有帮助,但不能保证任何事——镜头越多,漂移就越明显。

几乎没人问的问题:我能卖这个吗?

对一支广告片来说,“我觉得可以”不是答案。使用条款里写的内容,每家服务商都不一样——而且很少出现在定价页面上。

Kling明确禁止免费用户进行任何商业用途(服务条款第4.6条:“without our written permission, you may not use … for any commercial purposes”)。只有付费会员才可以。而且Kling要求生成结果必须可见地标注为“Kling AI”(服务条款第4.5条)。

Runway允许无限制的商业使用,也不主张对你的生成结果拥有所有权——但保留用这些结果做训练的权利。此外:使用其API的应用必须可见地显示“Powered by Runway”并链接到runway.com(服务条款)。

Google不主张对生成的视频拥有所有权,但明确指出它也可以为其他用户生成相同或类似的素材。每一个Veo输出都带有一个不可见的SynthID水印。

简而言之:“我生成的,当然归我”这句话,在这些服务商中没有一家是自动成立的。在片子上线之前,先把那条条款读一遍。

工具的寿命——没人会想到的那个坑

2026年3月24日,OpenAI宣布将关闭其Videos API和所有Sora 2模型,生效日期为2026年9月24日。在其弃用页面上没有列出任何后继模型(截至2026年7月24日)。这对OpenAI的战略意味着什么,我不知道——页面上也没写。

但教训是明摆着的:如果你把一整套制作流程建立在某个模型上,你建立的就是一个服务商能提前几个月说关就关的东西。Google那边是同样的模式:Veo 3和Veo 2已在2026年6月30日下线,而当前的Veo 3.1名字里仍然带着“preview”字样。至于Alibaba的Wan,真正开放、可自行托管的权重只到2.2版本——更新的一切都只提供API,也就是说依赖服务商。

想要独立性的人必须把这一点算进去:要么押注开放权重(并接受质量上的差距),要么做好每隔几个月就要重建整套工作流程的心理准备。

德国法律现状——简短说明,明确不构成法律意见

以下内容是对法律条文和官方资料的转述,截至2026年7月24日——不构成法律意见。这些规定是否以及如何适用于你的项目,如有疑问请咨询律师。

标识义务。 从2026年8月2日起,欧盟AI法案第50条(根据欧盟委员会的FAQ)要求合成内容必须以机器可读的方式标记,并可被识别为AI生成;凡使用AI视频的人,必须最迟在观众第一次观看时清楚披露这是“深度伪造”内容。到2026年12月2日的过渡期,仅涉及服务商对旧系统的标记义务。在德国,自《AI实施法》(联邦议院,2026年6月11日通过)起,由联邦网络局负责监管。违反透明度规定的罚款上限为1500万欧元或全球年营业额的3%(AI法案第99条第4款)。

关于著作权令人意外的一点: 在德国,一段纯粹由AI生成的视频不属于任何人。德国《著作权法》第2条第2款只保护“个人的智力创作”——一个完全由AI自主生成的结果不满足这个条件。它不受著作权保护;理论上任何人都可以复制它。只有通过你自己的创造性贡献——剪辑、选择、构图——才会产生保护。

而反过来看: 即便是完全合成出来的一张脸,也可能侵犯权利。《艺术著作权法》(KunstUrhG)第22条(肖像权)只要生成图像中能辨认出一个真实的人,就会适用——哪怕从未有任何摄像机拍摄过。一张偶然或刻意长得像真人的AI脸孔,并不是一个法外之地。

我的结论

如果你只带走一个数字,那就是:每秒价格不是真正的价格。把它乘以你的弃用率,再加上放大处理和剪辑,你得到的会是原价的好几倍。一个每秒价格只有一半、却让你多弃用三倍次数的模型,反而更贵。

所以正确的问题不是“哪个最便宜”,而是“哪个在的这类拍摄对象上弃用得最少”——而这个问题只有你自己能回答:把你典型的拍摄对象拿去跑两三个模型,数一数命中率。而不是看价目表。

在片子上线之前:读一遍使用条款,加上标识,有疑问就去问懂法律的人。

至于我在整个流程周边用哪些工具——图像、剪辑、音频、放大处理——都写在我持续维护的137个AI工具索引里。

来源

以下所有信息均于2026年7月24日直接在各服务商或官方机构处核实。价格和模型状态可能会短期内变化。

如果你发现这里有什么内容过时或有误:联系我