引领AI拟人视频制作技术的CraftStory近日推出了基于图像的长时间视频生成模型。该模型设计为仅用一张静态图像即可生成最长5分钟的人类角色视频,是对原有视频到视频(video-to-video)基础Model 2.0功能的扩展。
在企业日益将视频应用于营销、教育内容和商务沟通的背景下,CraftStory的技术能够在不依赖传统视频制作流程的情况下,实现影棚级品质且表现一致的拟人表演,因而备受关注。考虑到现有大多数AI视频生成模型仅能制作10至30秒的短片,这被视为一项显著的技术飞跃。以往只能通过拼接短片段来实现长视频,但这种方式容易导致人物外貌、灯光和动作的一致性受损。
CraftStory通过其自主研发的并行扩散管道(parallelized diffusion pipeline)克服了上述局限。该技术旨在同时处理多个视频片段,并保持分段场景之间的视觉连贯性。公司创始人兼首席执行官维克托·埃鲁希莫夫表示:“如今我们无需实际拍摄,就能制作出蕴含人类表现力的视频”,“仅凭一张图像和文本,就能实现手势丰富、情感充沛的人类角色。”埃鲁希莫夫此前也是被英特尔收购的计算机视觉初创公司Itseez Inc.的联合创始人。
新模型基于真实演员的高速拍摄数据进行训练,能够捕捉表情、手势和身体姿态的自然运动,生成的人物流畅自然,避免了静态或人工合成的感觉。视频默认生成分辨率为480p和720p,可通过升级提升至1080p。特别值得一提的是,该模型还支持生成最长80秒、可实现自然背景移动的“行走对话”(walk-and-talk)视频,这为动态场景制作开辟了新的可能性。
用户输入图像及脚本或音轨后,系统即可自动生成与场景匹配、口型同步的视频。此外,模型还具备手势对齐功能,能根据语音节奏和情感调整人物的身体动作。
在技术日益趋近人类特质与创造力的当下,CraftStory正改变视频内容制作的格局,加速AI视频生态系统的扩展。业界评价认为,此项技术可能成为商业视频制作方式的一个根本转折点。


