如何使用 AI 制作音乐视频(Music Video / MV)

修改于

和 AI 讨论这篇文章

ChatGPTClaude

用 AI 做一支 MV:从一首歌,到一支完整的音乐视频

整个流程都可以在 ChatGPT AppCodex CLI 中推进,你只需要在里面指挥 AI 做事。不需要自己额外学习和操作第三方制作软件,也不用来回切换各种工具的界面。后面提到的软件和服务,让 AI 去研究、配置和调用就可以。

这篇文章里的调研、整理素材、建模、剪辑等工作,都是交给 AI 去研究和执行的。你主要负责告诉它想要什么、挑选喜欢的结果,以及给它反馈。遇到注册、登录、充值或必须由你确认的步骤,再按它的提示接手。下面这些方法,你可以直接拿去要求 AI 做。

一、准备工作

硬件:先让 AI 检查存储空间是否够用。如果你的硬盘不够大,就帮它准备一个 NAS 或者外置 SSD,后面的素材下载和整理交给它。

模型:我最推荐的是 GPT-6。Effort 选项我一直用的是 Extra High——其他档位可能也可以,但我自己没有尝试过。

GPT-6 跟之前的模型相比,对图形和图像的理解有巨量提升,因此它做出来的视频在整体审美风格上也有飞跃式的进步。跟 GPT-5.6 或者其他模型比起来,这真的是一个飞跃,强烈推荐。

二、核心原则:先让 AI 学习,再让它创作

第一件事:对于任何复杂的东西,永远不要试图让 AI 平白无故地凭空创造,因为 AI 模型并不是万能的。第一步永远是让 AI 先学习:找参考、分析参考,再总结做法。

1. 让 AI 建立原始素材库

我一般会这样要求它:

  1. 去网上找一百到几百个最好的音乐 MV,下载下来深入学习;
  2. 从多个维度总结它们好在哪里,制定出一套打分标准;
  3. 总结一些定性和定量的最佳实践,整理成一个 checklist。

这样等 AI 做完你的 MV 之后,就可以让它对照这个 checklist 打分,找出哪里做得好、哪里还需要改。你再根据自己的观看感受给它反馈,让它继续打磨。这就是原始素材库的用处,它非常重要。

2. 让 AI 调研现成的方法

素材库建完之后,继续给 AI 布置这两个任务:

  1. 去网上找找别人已经做好的东西,看看有没有开放的 skills 可以直接用;
  2. 搜一下别人是如何用 AI 制作 music video 的——无论是文章还是 skills——总结一下他们的做法,看看有没有我们能复用的部分。

3. 让 AI 沉淀成 guidance 并持续迭代

让 AI 把它总结出来的"如何制作音乐 MV"沉淀成一份 guidance。在之后的制作过程中,如果它按照这份 guidance 做出来的东西不理想,就让它结合你的反馈,继续修改作品、更新 guidance。

到这里,"如何制作 MV"的方法论基本就讲完了。接下来,让 AI 按两步推进:先做音乐,再做视频。

先学习,再创作:从优秀 MV 中总结评分标准与制作指南,再根据作品复盘持续更新

三、第一步:制作音乐

生成音乐

制作音乐我比较喜欢 Suno 的模型。我一般先让 AI 帮我构思歌词(lyrics)、风格(styles)和标题(title)。因为 Suno 没有 API,网页生成这一步,我自己目前习惯手动操作。如果你希望把这一步也交给 AI,就先让它研究能否通过浏览器代操作,需要你接手时再告诉你。

中间可能需要"抽卡"。你负责听、挑选和反馈,让 AI 根据你的感受调整歌词和风格,再继续尝试,直到找到你喜欢的音乐。

生成好的音乐就是一个 WAV 文件加一堆 metadata。你可以把 URL 发给 AI,让它把所有 metadata 和 WAV 源文件都保存下来,这样它回头就有一份完整的信息。

生成带时间轴的歌词

制作音乐过程中有一件很重要的事:Suno 生成的音乐有歌词,但歌词和时间轴对不上。所以你要让 AI 自己去研究,怎样生成一个带时间轴的歌词文件(比如 SRT 格式)。

它会自己想办法,大概率会用本地模型来识别。如果识别结果不够好,就让 AI 继续研究 OpenRouter,因为上面的模型比较多。模型怎么选、怎么接入、怎么比较效果,都交给它。需要你开通账号、充值或配置 API key 时,让它告诉你;完成必要的授权后,再让它尝试不同模型,看有没有办法提高识别准确度。

如果你不知道 OpenRouter 是什么也没关系,把这段话发给 AI,告诉它:"我不知道什么是 OpenRouter,你自己去弄,什么时候需要我注册、充钱,告诉我就行。"因为 GPT-6 的 Chrome Use 和 Computer Use 能力非常强,它一定能把事情操作到只需要你接手的程度,你只管注册付钱。

有了这个之后,GPT-6 就一定有办法根据音乐和原始歌词,生成一个带时间轴的文件,这对后面的流程非常有帮助。

四、第二步:制作视频

1. 生成 Storyboard

下一步一般是让它生成 storyboard。storyboard 具体是什么不用深究,你只要告诉它:这是 source of truth,后面所有内容都要基于这个 storyboard 来生成。

你可以把它理解为一段完整的描述:包括每个时间段、每个镜头要做什么,以及整体的音乐风格等等。

音乐、带时间轴的歌词与分镜共用同一条时间轴,在卡点处切换镜头(示意图)

2. 选择生图 / 生视频的工具

接下来,让 AI 按这个流程制作:先生成图片 → 由图片生成视频 → 剪辑 → 对口型。下面列的工具,是你可以告诉 AI 去研究和使用的选项。

首选:Grok CLI(xAI 旗下)

生图和图生视频最便宜的方式是走 Grok CLI,用的是 xAI(Elon Musk)旗下的 Grok 模型。你不知道是什么也没关系,直接让 GPT-6 帮你 set up,你只管充钱。

推荐它的原因是:在能生图和生视频的工具里,它是唯一一个有 subscription 模式的,其他基本都是 API,而 subscription 显然比 API 便宜很多。做一支成熟的 MV,大概率需要 AI 生成 50 到 100 个视频,这笔成本并不小,用 subscription 方案会便宜很多。

可选:Google Gemini + Vertex

比如你买 200 刀的 Gemini plan,它会送你 100 刀的 Vertex credit(也就是 Google Cloud 的 credit),就可以让 AI 接入 Google Cloud 上的模型,用这些额度生成图片和视频。

Google Cloud 的 set up 比较麻烦,但你不需要自己折腾,只要告诉 AI 可以这么做,它会用 Chrome 和 Computer Use 帮你全部搞定。

兜底与替代方案

如果没有让 AI 配置其他生图工具,Codex 会用自己的 credit 去生图。GPT-6 Codex 的生图能力很强,这个不用担心,但生成视频它就没什么办法了。所以我还是建议开 Grok subscription,再让 AI 完成工具配置。

如果你不喜欢 Grok,也可以让 AI 接入第三方 API。我比较推荐 fal 这个平台,用起来相对顺手,具体接哪个模型、怎么调用,都交给 AI 去研究和配置。

总之,你把可用的工具、预算和想要的效果告诉 AI,让它负责研究、配置和执行。需要你处理账号或付款时,它再提醒你。

3. 几个进阶技巧

识别乐器:你可以让 AI 识别这段音乐用了什么乐器,并生成对应乐器的视频,这样看起来会更像一点。

跳舞对节奏:AI 生成的视频肯定不会自带你音乐的节奏,这个没法强制。一个方法是让 AI 动态调整视频速度,去对齐音乐节奏。GPT-6 做得到——它会自己去找论文研究人物肢体动作和节奏的对应关系,然后生成波峰波谷的图来完成对齐。

卡点:卡点这件事 AI 可以做得很好,因为它能找到音频中的那个点在哪里。你可以要求它在卡点处切换视频,或者做一些动态效果,都很容易实现。

复杂运镜:Blender 白模 + Seedance 2.5

如果你对镜头的拉近、拉远等变化要求非常高,直接用 AI 生视频往往不够,因为通常只能传首图(比如 Grok CLI 就只支持传首图)。有一个相对高级的技巧,你可以让 GPT-6 按下面的步骤来做:

  1. 让 AI 用 Blender 这个 3D 建模软件建白模。你告诉它人物怎么站、镜头怎么动,具体建模由它完成;
  2. 让它根据你要求的镜头变化,利用白模先生成一段带运镜变化的视频;
  3. 让它把这段白模视频作为 reference,连同按你的要求准备好的人物、风格等参考图片,一起传给 Seedance 2.5(fal 上面也有)。

这样它就能相对稳定地根据白模里的运镜和对应人物,生成符合预期的视频。如果你要讲故事,需要在多人物、固定机位之间不断切换,单纯靠 AI 生视频很难保证一致性,但让 AI 按"白模 + Seedance 2.5"这套工作流来做,就可以做到。你负责看镜头效果、提出修改意见,建模、生成参考视频和调用模型都由它完成。

Blender 白模运镜视频与人物风格参考共同指导视频生成

4. 对口型

对口型也交给 AI:让它准备好音频和画面,调用对口型模型处理。这样的模型现在有很多,我用过比较好的是 fal 上面一个叫 OmniHuman 1.5 的模型,可能是我测过的这么多模型里最好的一个。你可以直接让 AI 去研究怎么用它。

5. 提升分辨率

AI 完成前面的制作后,大概得到的是一个 720p 的视频。如果你希望做成 1080p,就让它在 OpenRouter 或 fal 上找一个 720p 升 1080p 的超分模型,让它自己测评、比较效果和价格,再选一个性价比高的模型完成处理。这类模型用起来差不太多,我没有特别推荐的。

五、第三步:收尾与发布

反馈与打磨

AI 做出初版之后,你可以不断反馈:告诉它哪里做得好、哪里做得不好,以及要在哪个位置打 logo。让它根据你的意见修改、导出新版本,你再看效果。

打包与缩略图

接着让 AI 把所有东西打包成一个 package,并制作 thumbnail(缩略图)。因为上传到不同平台需要不同尺寸,让它把缩略图按以下几个比例各做一版:

  • 1:1
  • 4:3
  • 3:4
  • 16:9

上传到各平台

现在 GPT-6 的 Computer Use 和 Chrome Use 都很强,你直接跟它说上传到什么平台,让它在 Chrome 上完成上传和发布准备。遇到登录、验证或发布确认,需要你接手时,它再告诉你。

中文平台通常没有 API;英文平台大部分都有,包括 YouTube。有没有 API、应该走哪条上传路径、怎么配置,都让 AI 去查、去做。需要你开通账号或授权时,让它把具体步骤带到你面前。

六、成本

整体而言,制作一个 1080p、3 到 4 分钟的 music video,成本大概在 20 美元左右,性价比非常高。

写在最后

如果你完全不理解这篇文章里说的是什么,也没有关系。直接把这篇文章发给你的 AI,告诉它:"参照这篇文章,帮我把 MV 做出来。调研、选工具、配置和制作都由你负责,需要我提供素材、挑选结果、注册、充值或确认时,再告诉我。"

最近的 MV

全部音乐
全部内容