中国AI视频崛起 影响不止好莱坞

七颜百科 °C 栏目:历史大事记
中国AI视频崛起 影响不止好莱坞

月之暗面Kimi K3等新一代大语言模型,主导着外界关于中国人工智能雄心的讨论。然而,中国人工智能实力的最有力证明或许在视频生成领域,而其影响力可能远不止于撼动好莱坞。

除Alphabet旗下谷歌(Google)之外,目前几乎所有领先的视频生成模型都来自中国,在人工智能基准测试平台Artificial Analysis的排行榜上,排名前十的文本生成视频系统中有九个来自中国。

字节跳动和MiniMax近期接连发布了各自视频生成模型的更新版本。此前,一个名为HappyHorse的神秘视频系统横空出世,一度震撼业界,后被证实是阿里巴巴集团的项目。再加上快手可灵(Kling)、北京生数科技Vidu,以及众多初创企业,中国在这条赛道上涌现出了数量惊人的主要参与者。而OpenAI和Anthropic等美国头部企业却降低了该领域的优先级。

中国视频生成模型占据主导地位。全球十大文本生成视频模型中,有九个来自中国。数据来源:Artificial Analysis(注:数值代表Elo分数,用于衡量模型画质与综合性能;数据来自Artificial Analysis文本生成视频人工智能模型排行榜。)

这类工具正被广告公司、影视工作室广泛使用,甚至助推了微短剧产业在海内外的快速兴起。不少从业者认为,在饱受价格战冲击、商业模式尚不明朗的人工智能领域,视频生成模型有望开辟可行的盈利路径。不过,它们更深层的战略意义或许才刚刚开始显现。中国在生成式视频领域的主导地位,可能使其在构建所谓的“世界模型”(world models)方面占据优势,而后者长期以来一直被视为人工智能的下一代形态。

商界领袖以及越来越多的研究成果都认为,这些视频工具最终可能成为人工智能系统的基础,使这项技术从屏幕走向物理世界。世界模型不仅必须理解语言,还必须掌握物理规律,以及物体在充满不确定性的真实环境中如何相互作用。这类系统最终可能用于驱动人形机器人或自动驾驶汽车。一些人工智能领域的先驱者认为,与构建越来越庞大的聊天机器人相比,这才是通往硅谷梦寐以求的“通用人工智能”的更可行途径。

想要生成逼真的视频,模型需要掌握的不只是画面美感,它至少需要对运动、因果关系和物理规律有粗略的理解,否则生成内容会出现荒诞可笑的漏洞。研究人员发现,随着模型规模扩大,即使没有进行明确的程序设定,模型也会自发形成基础物理推理能力。它们对世界的理解仍远不能与人类相比,但在预测事物应该呈现什么样子,以及接下来可能发生什么方面,它们正在取得越来越大的进步。如今,许多研究人员已经开始将这些视频模型与机器人训练结合起来。

生数科技等多家中国头部人工智能视频企业,已经在朝着发布世界模型以及更广泛的多模态系统迈进。这种探索并非中国企业独有。美国的Runway AI和德国的Black Forest Labs——两家西方最具影响力的视觉人工智能初创企业——也在遵循同样的路径。

Runway首席执行官克里斯・巴伦苏埃拉(Cris Valenzuela)表示,这是自然而然的发展方向。想要做出优质视频模型,就必须精准模拟现实世界的运行逻辑。例如,皮球会在草地上滚动,而非滑行。机器人要想叠衣服或给超市货架补货,仅仅识别出物体是什么是不够的,它还需要预判物体移动或与之互动时会发生什么。

从视频生成到训练全球模型的跨越仍处于初期阶段。但自OpenAI叫停其视频工具Sora以来,中国开发者便抓住了这一契机,并日益引领这一领域的发展节奏。

前路依旧挑战重重。搭建视频模型(更不用说世界模型),需要海量数据与庞大算力资源。版权问题是这些企业面临的另一大隐患。这是整个人工智能行业都必须应对的难题,但与聊天机器人相比,视频生成器的训练数据内容更难隐瞒。这已成为中国平台拓展海外市场的一大障碍。

不过,中国已经在机器人领域建立了显著的工业硬件优势。正如我此前所写,数百家公司已经摸索出如何拼装出一个人形机器人躯体;它们目前缺少的,是“大脑”。如今,越来越多从视频生成模型中发展出来的数据和仿真能力,正被用于构建这个“大脑”。

世界模型可能永远不会迎来一个ChatGPT那样的高光时刻。它们的战略重要性,很可能不会通过一款数百万用户都能亲自尝试的大众消费级产品得到证明。尽管华盛顿对中国的聊天机器人日益感到担忧,但它可能会过度关注最引人注目的竞争,而忽略一些最终可能产生更大影响的进展。

企业和投资者也应该警惕同样的问题。大语言模型仍然吸收了大部分资本,但下一次突破可能来自那些能够在现实世界中行动、而不仅仅是描述现实世界的系统。

倘若视频模型正是这类智能系统的训练场,中国抢占的先发优势绝不仅仅会令好莱坞不安。它或将决定谁能引领人工智能的下一个时代。编辑/陈佳靖