你刷到的那条"外国博主用东北话推销螺蛳粉"的AI视频,可能不是后期配音,而是模型从一开始就"说"出来的——人物口型、情绪、方言全对得上。快手可灵在2月把3.0系列模型全面上线后,AI视频正在从"能生成"跨到"能交付成片"。
一、All-in-One:把理解、生成、剪辑塞进一个模型
可灵3.0系列(视频3.0、视频3.0 Omni、图片3.0及Omni)基于All-in-One理念,文本、图像、音频、视频全模态输入输出,在一个原生多模态架构里完成从理解到生成到编辑的闭环。
也就是说,创作者不用在"文生视频""图生视频""视频内编辑"多个工具间反复跳转,一句话加上参考图,就能拿到一段带镜头逻辑的成片,而不是一堆需要手工拼接的碎片。
二、最实用的两个能力
主体一致性:全球首创的"图生视频+主体参考"技术,让人物、道具、场景在镜头推拉摇移中始终不"崩",解决了AI视频最被人诟病的"变脸"问题。对电商广告来说,角色穿的品牌T恤logo全程清晰,这一点直接决定了能不能商用。
原生音画同出:视频3.0支持最长15秒连续生成,并原生生成多语言、多方言音频(中英日韩西及粤语、四川话、东北话等),角色口型与情绪自动对齐;多人同框时还能指定"让谁说、说什么、什么语气"。
据官方介绍,3.0系列建立在可灵O1和2.6模型基础上,进一步深化了多模态视觉语言(MVL)框架,让模型不仅能生成画面,还能"读懂"剧本里的镜头意图,把分镜、表演、声音一起调度。
三、它已经不是小众玩具
自2024年6月推出以来,可灵AI全球创作者已超6000万,累计生成超6亿条视频,服务超3万家企业,2026年1月月活突破1200万,年化收入运行率达到2.4亿美元。
从广告分镜、电商种草到游戏CG初稿,AI视频正在进入真实生产流水线,而不只是朋友圈里的炫技。模型能力、产品体系和专业场景落地,三者开始形成正循环。
这类能力对广告和影视行业尤其划算——过去需要分镜师、配音演员、剪辑师三方协作的活,现在在一个模型里就能跑通初稿,人力成本和时间都省下一大截,剩下的只是专业精修。
四、普通人现在能做什么
第一,短视频创作者:直接用可灵3.0的"主体参考+智能分镜"做口播和种草视频,先把人物和品牌元素锁死,再批量出不同脚本的版本,用最低成本测试哪条流量好。
第二,商家和电商:把商品图丢进去生成带方言口播的短视频,用"多语混说"顺手做跨境版本,比找真人配音加剪辑,成本和时间都低一个量级。
第三,普通用户:试着用它把一段文字脚本变成15秒小片,亲身感受"主体崩坏"还在不在——如果口型对不上、脸变了,那就是模型还没覆盖到的边界,别轻信"一键成片"的宣传。