面向导演与电影人的 AI 工具
更新于 2026-10-11
视频生成
提供 Gen-4.5 视频创作、开发者 API 及交互式 GWM-1 世界模型研究的 AI 视频与模型平台。
- 官网将 Gen-4.5 的定位概括为运动质量、提示词遵循度和视觉保真度。
- Runway 将 GWM-1 描述为用于环境交互和仿真工作流的通用世界模型。
- Runway Dev 于 2026 年 8 月 26 日加入 WAN 3.0,支持根据文本或起始帧图像生成最长 30 秒、带原生音频的视频。 [docs.dev.runwayml.com]
Google DeepMind 的视频生成模型(目前为 Veo 3.1),可生成带原生音频的电影感片段,音频包括对白、音效和环境声。
- Veo 3.1 原生生成音频,包括音效、环境噪声和对白。
- 通过参考图像提供角色一致性,并提供镜头运动控制(变焦、摇镜、推轨)、场景延长,输出最高可达 1080p/4K。
- 可通过 Gemini app、Google Flow、Google AI Studio 和 Google Vids 使用。
Google Labs 面向创作者打造的 AI 电影制作工具,由 Veo 视频模型驱动,结合视频与图像生成。可用地区有限。
- Google 将 Flow 描述为专门的 AI 电影制作工具,可调用 Veo 3.1。 [deepmind.google]
快手的 AI 视频生成平台。Kling 3.0 支持多模态输入、最长 15 秒的视频片段,以及多语言原生音频。
- 快手于 2026 年 2 月 5 日公告 Kling 3.0 系列,介绍了最长 15 秒的视频生成和多语言原生音频;公告中的 2K 和 4K 输出指的是 Image 3.0 图像模型。 [ir.kuaishou.com]
- 快手还宣布了 Kling O1,并将其描述为统一的多模态视频模型。 [ir.kuaishou.com]
Luma 的 AI 创意工作区,围绕其 Ray 视频模型构建,在无限画布上整合图像、视频和音频生成,并提供分镜(storyboard)开发和带镜头运动的图生视频动画。
- 运行 Luma 自有的 Ray3 系列视频模型和 Uni-1 图像模型,同时也托管 Veo 3.1、Kling 等第三方模型。
面向视频、图像和音频生成的 AI 创作平台,提供动作迁移、视频延长、图像编辑、语音和音效等应用。
- 模型目录包括 Pika 2.5 及其他视频模型;产品导航还列出图像和音频工作流。
- 视频应用包括动作迁移和视频延长;图像与音频应用包括编辑、语音及音效。
整合图像、视频、音频、电影化创作和视觉特效工作流的 AI 平台,并提供 API 和 MCP 入口。
- 官网列出图像、视频与音频工具,工作区包括 Cinema Studio、Effects 和 Ads Studio。
- 产品导航提供 API 和 MCP 集成入口。
面向广告与效果营销团队的 AI 视频创作平台,可根据脚本或已有素材制作视频,并调整产品、角色或声音。
- 官网介绍了根据简报或脚本生成视频,以及在已有视频素材中替换产品。
- 还提供角色或声音替换,以及通过调整口型同步将已有视频本地化的工作流。
整合脚本写作、分镜、视频生成和多轨时间线编辑的 AI 视频制作套件,面向电影制作及其他视频工作流。
- 官网介绍了脚本写作、逐镜头分镜规划,以及可通过自然语言指令控制的时间线编辑器。
- 平台在视频生成之外提供图像、语音和音乐工具;可使用的模型与功能取决于所选套餐。
分镜与预演
基于网页的 AI 电影制作一体化平台,可将剧本转化为场景拆解、分镜和视频序列,提供持久角色档案、镜头调度控制和时间线编辑器。
- Lightricks 于 2024 年 2 月推出,定位为 AI 驱动的电影制作工作室,用于把故事从剧本一路可视化到银幕。 [techcrunch.com]
- 包含 AI 分镜生成器,可把粘贴的剧本拆分为场景和逐镜头画面。 [ltx.io]
面向视频和动画团队的协作式分镜平台,提供为分镜格生成画面的 AI 图像生成、带音频的定时动态分镜(animatic),以及客户审阅与审批流程。
- 包含 AI 图像生成,可根据场景描述生成分镜画面的多个变体。
- 可将分镜板转换为带音频的定时动态分镜,并跟踪版本、评论和审批确认。
剧本与前期筹备
AI 前期制作平台,可自动拆解剧本(演员、道具、场地、视觉特效、服装),生成拍摄日程和预算,并运行可提示制作风险的 AI Production Agent。
- 自动 AI 剧本拆解会标记演员、道具、场地、视觉特效和服装,并生成场景条板(stripboard)、拍摄日程和预算模板。
- 其 AI Production Agent 会分析剧本以发现制作风险,并优化拍摄日安排。
面向小说作者和编剧的 AI 写作搭档,提供从提纲到初稿的 Story Bible 工作流、改写、扩写和描写工具,以及包括剧本转换在内的插件。
- Story Bible 引导作者从构思出发,经过提纲、章节规划,直到以自己的风格生成初稿。
剪辑与后期制作
基于文本的视频与播客编辑器:编辑文字稿即编辑视频。包含智能体式 AI 协同剪辑助手 Underlord、Studio Sound 音频清理、语气词删除和翻译。
- 核心工作流是基于文本的剪辑——修改文字稿,视频会自动随之更新。
- Underlord 是一个智能体式 AI 协同剪辑助手,可以撰写或修改脚本,套用布局和转场,并执行剪辑指令。
行业标准剪辑软件,配备由 Firefly 驱动的生成式 AI 功能:Generative Extend 可为 4K 片段补充画面帧和房间底噪(room tone),Media Intelligence 支持按语义搜索素材,字幕可自动翻译。
- 由 Adobe Firefly 驱动的 Generative Extend 可延长 4K 视频片段(视频最多约 2 秒,音频最多 10 秒),并为片段标注 Content Credentials。 [helpx.adobe.com]
- 2025 年 4 月的版本全面上线了 Generative Extend,并新增 Media Intelligence 语义搜索和自动字幕翻译。 [news.adobe.com]
涵盖剪辑、调色、视觉特效和音频的后期制作一体化平台,其 DaVinci Neural Engine 驱动 Magic Mask、Voice Isolation、人脸识别、智能重构图和 IntelliSearch 等 AI 工具。
- DaVinci Resolve 21 包含 Neural Engine AI 工具:Magic Mask、Voice Isolation、人脸识别、智能重构图、IntelliSearch 和 CineFocus。
- 提供免费版本;DaVinci Resolve Studio($295,一次性付费)增加 Neural Engine 和高级功能。
提供免费入口及付费功能的在线与桌面视频编辑器,AI 功能包括字幕、背景移除、文本转语音、降噪和视频生成。
- 提供多语言 AI 自动字幕、视频与图像背景移除、文本转语音和 AI 视频生成器。
将长视频转为竖屏短片的 AI 辅助剪辑工具,提供片段识别、画面重构、字幕和可视化编辑器,由用户审核最终剪辑。
- 官网介绍了 AI 片段识别、可编辑的竖屏画面重构、精确裁切,以及带样式字幕的自动转录。
- 当前免费方案总共可处理两条长视频,并非每月两条。官网提供无需信用卡的开始方式和按月付费套餐。
语音、配音与音乐
AI 音频平台,提供文本转语音、声音克隆、配音、音效和音乐生成,以及语音转文字和开发者 API。
- ElevenCreative 覆盖语音、音乐、音效、声音克隆、配音及视频相关创作工作流。
- 语音转文字服务支持说话人区分和时间戳,并提供语音及音乐相关 API。
用于影视制作的企业级声音克隆与语音合成服务,提供由工程师监督的定制声音克隆、实时 TTS(文本转语音)API,以及 AI 声音市场。
- 参与过的作品包括:为《曼达洛人》(The Mandalorian)重现青年卢克·天行者的声音,以及在《粗野派》(The Brutalist)中为艾德里安·布洛迪和菲丽希缇·琼斯做口音增强。
- 还用于《艾米莉亚·佩雷斯》(Emilia Pérez)的歌唱增强,以及《赛博朋克 2077:往日之影》(Cyberpunk 2077: Phantom Liberty)中保留已故演员的声音。
AI 音乐生成平台,可根据文本提示生成完整的原创歌曲(人声、歌词和完整制作),并提供音轨分离(stem separation)、音频上传和基于网页的编辑工作站。
- 只需一条文本提示即可生成各种曲风的完整原创歌曲;商业使用权随付费方案提供。
概念美术与视觉风格开发
用于概念美术和视觉风格开发的图像生成与编辑服务。文档中的默认版本为 V8.2,提供个性化和 Edit Model;参考功能取决于所选版本。
- V8.2 于 2026 年 7 月 24 日成为 Midjourney 的默认版本;该版本包含 Edit Model,它取代了 Omni Reference、Character Reference 和 Retexture 工作流。 [docs.midjourney.com]
- 据 Midjourney 官方版本文档,V7 于 2025 年 4 月 3 日发布,引入了 Draft Mode 和 Omni Reference。
历史条目
历史条目,已停用。OpenAI 的 Sora 2 曾是一款可根据文本或图像生成带音频视频片段的模型,但 Sora 2 模型和 Videos API 已于 2026 年 9 月 24 日关停,不再可用;OpenAI 表示没有一对一的替代 API。
- OpenAI 已于 2026 年 9 月 24 日关停 Sora 2 模型和 Videos API;该公司表示没有一对一的替代 API。 [developers.openai.com]
- 关停之前,Sora 2 可根据自然语言或图像输入生成带同步音频、细节丰富的视频片段,输出包括竖屏 720x1280 和横屏 1280x720。