AI Director Tools
简体中文

面向导演与电影人的 AI 工具

更新于 2026-10-11

“套件”覆盖至少三项制作工作流,“专用”聚焦单项任务。 点击卡片右上角图标反馈。 详细规则见收录原则。

视频生成

Runway

套件

Runway AI, Inc. · 官网 · 定价

提供 Gen-4.5 视频创作、开发者 API 及交互式 GWM-1 世界模型研究的 AI 视频与模型平台。

  • 官网将 Gen-4.5 的定位概括为运动质量、提示词遵循度和视觉保真度。 (截至 2026-10-11)
  • Runway 将 GWM-1 描述为用于环境交互和仿真工作流的通用世界模型。 (截至 2026-10-11)
  • Runway Dev 于 2026 年 8 月 26 日加入 WAN 3.0,支持根据文本或起始帧图像生成最长 30 秒、带原生音频的视频。 (截至 2026-10-11) [docs.dev.runwayml.com]

Google Veo

专用

Google DeepMind · 官网

Google DeepMind 的视频生成模型(目前为 Veo 3.1),可生成带原生音频的电影感片段,音频包括对白、音效和环境声。

  • Veo 3.1 原生生成音频,包括音效、环境噪声和对白。
  • 通过参考图像提供角色一致性,并提供镜头运动控制(变焦、摇镜、推轨)、场景延长,输出最高可达 1080p/4K。
  • 可通过 Gemini app、Google Flow、Google AI Studio 和 Google Vids 使用。

Flow

专用

Google Labs · 官网

Google Labs 面向创作者打造的 AI 电影制作工具,由 Veo 视频模型驱动,结合视频与图像生成。可用地区有限。

  • Google 将 Flow 描述为专门的 AI 电影制作工具,可调用 Veo 3.1。 [deepmind.google]

Kling AI

专用

Kuaishou Technology · 官网

快手的 AI 视频生成平台。Kling 3.0 支持多模态输入、最长 15 秒的视频片段,以及多语言原生音频。

  • 快手于 2026 年 2 月 5 日公告 Kling 3.0 系列,介绍了最长 15 秒的视频生成和多语言原生音频;公告中的 2K 和 4K 输出指的是 Image 3.0 图像模型。 (截至 2026-10-11) [ir.kuaishou.com]
  • 快手还宣布了 Kling O1,并将其描述为统一的多模态视频模型。 [ir.kuaishou.com]

Luma Dream Machine

套件

Luma AI · 官网

Luma 的 AI 创意工作区,围绕其 Ray 视频模型构建,在无限画布上整合图像、视频和音频生成,并提供分镜(storyboard)开发和带镜头运动的图生视频动画。

  • 运行 Luma 自有的 Ray3 系列视频模型和 Uni-1 图像模型,同时也托管 Veo 3.1、Kling 等第三方模型。

Pika

套件

Pika Labs · 官网

面向视频、图像和音频生成的 AI 创作平台,提供动作迁移、视频延长、图像编辑、语音和音效等应用。

  • 模型目录包括 Pika 2.5 及其他视频模型;产品导航还列出图像和音频工作流。 (截至 2026-10-11)
  • 视频应用包括动作迁移和视频延长;图像与音频应用包括编辑、语音及音效。 (截至 2026-10-11)

Hailuo AI

套件

MiniMax · 官网

MiniMax 的创作平台,提供视频、图像和音频创作入口,以及 CineScope 等电影化预设。

  • 官网界面列出视频、图像和音频创作工具,电影化预设包括 CineScope。 (截至 2026-10-11)

Wan

专用

Alibaba · 官网

阿里巴巴的视频生成模型系列与平台。公开模型文档介绍了文生视频和图生视频能力。

  • 官方 Wan2.2 仓库提供文生视频、图生视频及文本/图像混合输入模型的文档。 (截至 2026-10-11) [github.com]

Higgsfield

套件

Higgsfield AI · 官网

整合图像、视频、音频、电影化创作和视觉特效工作流的 AI 平台,并提供 API 和 MCP 入口。

  • 官网列出图像、视频与音频工具,工作区包括 Cinema Studio、Effects 和 Ads Studio。 (截至 2026-10-11)
  • 产品导航提供 API 和 MCP 集成入口。 (截至 2026-10-11)

Katalist

专用

Katalist AI · 官网 · 定价

面向广告与效果营销团队的 AI 视频创作平台,可根据脚本或已有素材制作视频,并调整产品、角色或声音。

  • 官网介绍了根据简报或脚本生成视频,以及在已有视频素材中替换产品。 (截至 2026-10-11)
  • 还提供角色或声音替换,以及通过调整口型同步将已有视频本地化的工作流。 (截至 2026-10-11)

Invideo

套件

Invideo · 官网 · 定价

整合脚本写作、分镜、视频生成和多轨时间线编辑的 AI 视频制作套件,面向电影制作及其他视频工作流。

  • 官网介绍了脚本写作、逐镜头分镜规划,以及可通过自然语言指令控制的时间线编辑器。 (截至 2026-10-11)
  • 平台在视频生成之外提供图像、语音和音乐工具;可使用的模型与功能取决于所选套餐。 (截至 2026-10-11)

MaxVideoAI

套件

MaxVideoAI · 官网 · 定价

按量付费的创作工作区,整合视频、图像和音频生成,以及角色一致性、镜头角度调整、放大和背景移除等工具。

  • 官网导航提供视频、图像与音频生成,以及一致性、镜头角度、放大和背景移除工具。 (截至 2026-10-11)
  • 定价页说明无需订阅,用户在应用内确认确切生成报价;样例成本不是后续生成的固定价格。 (截至 2026-10-11)

分镜与预演

LTX Studio

套件

Lightricks · 官网

基于网页的 AI 电影制作一体化平台,可将剧本转化为场景拆解、分镜和视频序列,提供持久角色档案、镜头调度控制和时间线编辑器。

  • Lightricks 于 2024 年 2 月推出,定位为 AI 驱动的电影制作工作室,用于把故事从剧本一路可视化到银幕。 [techcrunch.com]
  • 包含 AI 分镜生成器,可把粘贴的剧本拆分为场景和逐镜头画面。 [ltx.io]

Boords

专用

Boords Ltd · 官网 · 定价

面向视频和动画团队的协作式分镜平台,提供为分镜格生成画面的 AI 图像生成、带音频的定时动态分镜(animatic),以及客户审阅与审批流程。

  • 包含 AI 图像生成,可根据场景描述生成分镜画面的多个变体。
  • 可将分镜板转换为带音频的定时动态分镜,并跟踪版本、评论和审批确认。

DramaDirector

专用

Academic research team · 官网

一个用于几何引导短剧生成的研究框架,可将全局剧情和局部上下文转化为以几何信息为约束的多镜头视频规划和成片输出。

  • DramaDirector 把每个镜头解耦为静态视觉条件和动态叙事条件,从真实短剧镜头中检索深度-姿态参考,用以引导首帧生成和图生视频合成。
  • 该论文提出 DramaBoard 基准,由 35 部真人实拍剧、约 2,800 集、约 81,000 个镜头构建,附带结构化分镜和多维评估协议。

剧本与前期筹备

Filmustage

专用

Filmustage · 官网 · 定价

AI 前期制作平台,可自动拆解剧本(演员、道具、场地、视觉特效、服装),生成拍摄日程和预算,并运行可提示制作风险的 AI Production Agent。

  • 自动 AI 剧本拆解会标记演员、道具、场地、视觉特效和服装,并生成场景条板(stripboard)、拍摄日程和预算模板。
  • 其 AI Production Agent 会分析剧本以发现制作风险,并优化拍摄日安排。

Sudowrite

专用

Sudowrite · 官网

面向小说作者和编剧的 AI 写作搭档,提供从提纲到初稿的 Story Bible 工作流、改写、扩写和描写工具,以及包括剧本转换在内的插件。

  • Story Bible 引导作者从构思出发,经过提纲、章节规划,直到以自己的风格生成初稿。

Celtx

套件

Celtx (Backlight) · 官网

编剧与前期制作平台,提供行业标准的剧本编辑器、节拍表(beat sheet)、剧本分析、场景拆解、镜头清单、排期与预算,以及实时协同写作。

  • 提供多格式剧本编辑器,以及包括节拍表、分镜和剧本分析在内的故事开发工具,并支持逐场景拆解。

剪辑与后期制作

Descript

专用

Descript · 官网 · 定价

基于文本的视频与播客编辑器:编辑文字稿即编辑视频。包含智能体式 AI 协同剪辑助手 Underlord、Studio Sound 音频清理、语气词删除和翻译。

  • 核心工作流是基于文本的剪辑——修改文字稿,视频会自动随之更新。
  • Underlord 是一个智能体式 AI 协同剪辑助手,可以撰写或修改脚本,套用布局和转场,并执行剪辑指令。

Adobe Premiere Pro

套件

Adobe · 官网

行业标准剪辑软件,配备由 Firefly 驱动的生成式 AI 功能:Generative Extend 可为 4K 片段补充画面帧和房间底噪(room tone),Media Intelligence 支持按语义搜索素材,字幕可自动翻译。

  • 由 Adobe Firefly 驱动的 Generative Extend 可延长 4K 视频片段(视频最多约 2 秒,音频最多 10 秒),并为片段标注 Content Credentials。 [helpx.adobe.com]
  • 2025 年 4 月的版本全面上线了 Generative Extend,并新增 Media Intelligence 语义搜索和自动字幕翻译。 [news.adobe.com]

DaVinci Resolve

套件

Blackmagic Design · 官网 · 定价

涵盖剪辑、调色、视觉特效和音频的后期制作一体化平台,其 DaVinci Neural Engine 驱动 Magic Mask、Voice Isolation、人脸识别、智能重构图和 IntelliSearch 等 AI 工具。

  • DaVinci Resolve 21 包含 Neural Engine AI 工具:Magic Mask、Voice Isolation、人脸识别、智能重构图、IntelliSearch 和 CineFocus。
  • 提供免费版本;DaVinci Resolve Studio($295,一次性付费)增加 Neural Engine 和高级功能。

CapCut

套件

ByteDance · 官网

提供免费入口及付费功能的在线与桌面视频编辑器,AI 功能包括字幕、背景移除、文本转语音、降噪和视频生成。

  • 提供多语言 AI 自动字幕、视频与图像背景移除、文本转语音和 AI 视频生成器。

Clipzi

专用

Clipzi · 官网 · 定价

将长视频转为竖屏短片的 AI 辅助剪辑工具,提供片段识别、画面重构、字幕和可视化编辑器,由用户审核最终剪辑。

  • 官网介绍了 AI 片段识别、可编辑的竖屏画面重构、精确裁切,以及带样式字幕的自动转录。 (截至 2026-10-11)
  • 当前免费方案总共可处理两条长视频,并非每月两条。官网提供无需信用卡的开始方式和按月付费套餐。 (截至 2026-10-11)

VidiRelay

专用

VidiRelay · 官网 · 定价

用于素材研究、采访审阅和字幕准备的视频与音频转录工作区,提供带时间戳的可编辑文本,以及文档或字幕导出。

  • 支持指定平台的公开视频链接及上传的媒体,提供带时间戳的可编辑转录文本,可导出 TXT、SRT、VTT、CSV、JSON 和 DOCX。不接受私有链接和本地网络链接。 (截至 2026-10-11)
  • 定价页介绍了无需强制订阅的按量付费转录积分;编辑和导出不额外消耗积分。 (截至 2026-10-11)

语音、配音与音乐

ElevenLabs

套件

ElevenLabs · 官网

AI 音频平台,提供文本转语音、声音克隆、配音、音效和音乐生成,以及语音转文字和开发者 API。

  • ElevenCreative 覆盖语音、音乐、音效、声音克隆、配音及视频相关创作工作流。 (截至 2026-10-11)
  • 语音转文字服务支持说话人区分和时间戳,并提供语音及音乐相关 API。 (截至 2026-10-11)

Respeecher

专用

Respeecher · 官网

用于影视制作的企业级声音克隆与语音合成服务,提供由工程师监督的定制声音克隆、实时 TTS(文本转语音)API,以及 AI 声音市场。

  • 参与过的作品包括:为《曼达洛人》(The Mandalorian)重现青年卢克·天行者的声音,以及在《粗野派》(The Brutalist)中为艾德里安·布洛迪和菲丽希缇·琼斯做口音增强。
  • 还用于《艾米莉亚·佩雷斯》(Emilia Pérez)的歌唱增强,以及《赛博朋克 2077:往日之影》(Cyberpunk 2077: Phantom Liberty)中保留已故演员的声音。

Suno

专用

Suno · 官网

AI 音乐生成平台,可根据文本提示生成完整的原创歌曲(人声、歌词和完整制作),并提供音轨分离(stem separation)、音频上传和基于网页的编辑工作站。

  • 只需一条文本提示即可生成各种曲风的完整原创歌曲;商业使用权随付费方案提供。

AIVA

专用

AIVA Technologies · 官网

AI 音乐创作助手,可生成 250+ 种风格的原创曲目,支持上传 MIDI 或音频作为参考素材(influence),也支持自定义风格模型,授权层级最高可获得完整版权所有权。

  • 可生成超过 250 种风格的音乐,提供编辑和多格式导出,包括 MIDI 工作流。
  • AIVA 声明 Pro 方案提供生成作品的版权所有权;商业使用仍须遵守当前方案和许可条款。 (截至 2026-10-11)

概念美术与视觉风格开发

Midjourney

专用

Midjourney, Inc. · 官网

用于概念美术和视觉风格开发的图像生成与编辑服务。文档中的默认版本为 V8.2,提供个性化和 Edit Model;参考功能取决于所选版本。

  • V8.2 于 2026 年 7 月 24 日成为 Midjourney 的默认版本;该版本包含 Edit Model,它取代了 Omni Reference、Character Reference 和 Retexture 工作流。 (截至 2026-10-11) [docs.midjourney.com]
  • 据 Midjourney 官方版本文档,V7 于 2025 年 4 月 3 日发布,引入了 Draft Mode 和 Omni Reference。 (截至 2026-10-11)

Krea

套件

Krea AI · 官网

用于概念设计和视觉风格开发的 AI 创意一体化平台:实时图像生成、通过集成模型生成视频、文生 3D 和图生 3D 物体生成、画质放大,以及用于自定义风格的 LoRA 微调。

  • 实时渲染可将简单形状转换为照片级真实的图像;支持基于用户数据的 LoRA 微调。
  • 集成第三方视频模型,包括 Veo 3、Kling 和 Runway。
  • 提供 AI 3D 生成工作流,支持文生 3D 物体和图生 3D 物体。

历史条目

Sora (discontinued)

专用

OpenAI · 官网

待删除,暂时保留。移入历史条目:2026-10-11。

历史条目,已停用。OpenAI 的 Sora 2 曾是一款可根据文本或图像生成带音频视频片段的模型,但 Sora 2 模型和 Videos API 已于 2026 年 9 月 24 日关停,不再可用;OpenAI 表示没有一对一的替代 API。

  • OpenAI 已于 2026 年 9 月 24 日关停 Sora 2 模型和 Videos API;该公司表示没有一对一的替代 API。 (截至 2026-09-25) [developers.openai.com]
  • 关停之前,Sora 2 可根据自然语言或图像输入生成带同步音频、细节丰富的视频片段,输出包括竖屏 720x1280 和横屏 1280x720。 (截至 2026-09-25)