如何使用 AI 制作音乐视频(Music Video / MV)

整个流程都可以在 ChatGPT App 或 Codex CLI 中推进,你只需要在里面指挥 AI 做事。不需要自己额外学习和操作第三方制作软件,也不用来回切换各种工具的界面。后面提到的软件和服务,让 AI 去研究、配置和调用就可以。
这篇文章里的调研、整理素材、建模、剪辑等工作,都是交给 AI 去研究和执行的。你主要负责告诉它想要什么、挑选喜欢的结果,以及给它反馈。遇到注册、登录、充值或必须由你确认的步骤,再按它的提示接手。下面这些方法,你可以直接拿去要求 AI 做。
一、准备工作
硬件:先让 AI 检查存储空间是否够用。如果你的硬盘不够大,就帮它准备一个 NAS 或者外置 SSD,后面的素材下载和整理交给它。
模型:我最推荐的是 GPT-6。Effort 选项我一直用的是 Extra High——其他档位可能也可以,但我自己没有尝试过。
GPT-6 跟之前的模型相比,对图形和图像的理解有巨量提升,因此它做出来的视频在整体审美风格上也有飞跃式的进步。跟 GPT-5.6 或者其他模型比起来,这真的是一个飞跃,强烈推荐。
二、核心原则:先让 AI 学习,再让它创作
第一件事:对于任何复杂的东西,永远不要试图让 AI 平白无故地凭空创造,因为 AI 模型并不是万能的。第一步永远是让 AI 先学习:找参考、分析参考,再总结做法。
1. 让 AI 建立原始素材库
我一般会这样要求它:
- 去网上找一百到几百个最好的音乐 MV,下载下来深入学习;
- 从多个维度总结它们好在哪里,制定出一套打分标准;
- 总结一些定性和定量的最佳实践,整理成一个 checklist。
这样等 AI 做完你的 MV 之后,就可以让它对照这个 checklist 打分,找出哪里做得好、哪里还需要改。你再根据自己的观看感受给它反馈,让它继续打磨。这就是原始素材库的用处,它非常重要。
2. 让 AI 调研现成的方法
素材库建完之后,继续给 AI 布置这两个任务:
- 去网上找找别人已经做好的东西,看看有没有开放的 skills 可以直接用;
- 搜一下别人是如何用 AI 制作 music video 的——无论是文章还是 skills——总结一下他们的做法,看看有没有我们能复用的部分。
3. 让 AI 沉淀成 guidance 并持续迭代
让 AI 把它总结出来的"如何制作音乐 MV"沉淀成一份 guidance。在之后的制作过程中,如果它按照这份 guidance 做出来的东西不理想,就让它结合你的反馈,继续修改作品、更新 guidance。
到这里,"如何制作 MV"的方法论基本就讲完了。接下来,让 AI 按两步推进:先做音乐,再做视频。

三、第一步:制作音乐
生成音乐
制作音乐我比较喜欢 Suno 的模型。我一般先让 AI 帮我构思歌词(lyrics)、风格(styles)和标题(title)。因为 Suno 没有 API,网页生成这一步,我自己目前习惯手动操作。如果你希望把这一步也交给 AI,就先让它研究能否通过浏览器代操作,需要你接手时再告诉你。
中间可能需要"抽卡"。你负责听、挑选和反馈,让 AI 根据你的感受调整歌词和风格,再继续尝试,直到找到你喜欢的音乐。
生成好的音乐就是一个 WAV 文件加一堆 metadata。你可以把 URL 发给 AI,让它把所有 metadata 和 WAV 源文件都保存下来,这样它回头就有一份完整的信息。
生成带时间轴的歌词
制作音乐过程中有一件很重要的事:Suno 生成的音乐有歌词,但歌词和时间轴对不上。所以你要让 AI 自己去研究,怎样生成一个带时间轴的歌词文件(比如 SRT 格式)。
它会自己想办法,大概率会用本地模型来识别。如果识别结果不够好,就让 AI 继续研究 OpenRouter,因为上面的模型比较多。模型怎么选、怎么接入、怎么比较效果,都交给它。需要你开通账号、充值或配置 API key 时,让它告诉你;完成必要的授权后,再让它尝试不同模型,看有没有办法提高识别准确度。
如果你不知道 OpenRouter 是什么也没关系,把这段话发给 AI,告诉它:"我不知道什么是 OpenRouter,你自己去弄,什么时候需要我注册、充钱,告诉我就行。"因为 GPT-6 的 Chrome Use 和 Computer Use 能力非常强,它一定能把事情操作到只需要你接手的程度,你只管注册付钱。
有了这个之后,GPT-6 就一定有办法根据音乐和原始歌词,生成一个带时间轴的文件,这对后面的流程非常有帮助。
四、第二步:制作视频
1. 生成 Storyboard
下一步一般是让它生成 storyboard。storyboard 具体是什么不用深究,你只要告诉它:这是 source of truth,后面所有内容都要基于这个 storyboard 来生成。
你可以把它理解为一段完整的描述:包括每个时间段、每个镜头要做什么,以及整体的音乐风格等等。

2. 选择生图 / 生视频的工具
接下来,让 AI 按这个流程制作:先生成图片 → 由图片生成视频 → 剪辑 → 对口型。下面列的工具,是你可以告诉 AI 去研究和使用的选项。
首选:Grok CLI(xAI 旗下)
生图和图生视频最便宜的方式是走 Grok CLI,用的是 xAI(Elon Musk)旗下的 Grok 模型。你不知道是什么也没关系,直接让 GPT-6 帮你 set up,你只管充钱。
推荐它的原因是:在能生图和生视频的工具里,它是唯一一个有 subscription 模式的,其他基本都是 API,而 subscription 显然比 API 便宜很多。做一支成熟的 MV,大概率需要 AI 生成 50 到 100 个视频,这笔成本并不小,用 subscription 方案会便宜很多。
可选:Google Gemini + Vertex
比如你买 200 刀的 Gemini plan,它会送你 100 刀的 Vertex credit(也就是 Google Cloud 的 credit),就可以让 AI 接入 Google Cloud 上的模型,用这些额度生成图片和视频。
Google Cloud 的 set up 比较麻烦,但你不需要自己折腾,只要告诉 AI 可以这么做,它会用 Chrome 和 Computer Use 帮你全部搞定。
兜底与替代方案
如果没有让 AI 配置其他生图工具,Codex 会用自己的 credit 去生图。GPT-6 Codex 的生图能力很强,这个不用担心,但生成视频它就没什么办法了。所以我还是建议开 Grok subscription,再让 AI 完成工具配置。
如果你不喜欢 Grok,也可以让 AI 接入第三方 API。我比较推荐 fal 这个平台,用起来相对顺手,具体接哪个模型、怎么调用,都交给 AI 去研究和配置。
总之,你把可用的工具、预算和想要的效果告诉 AI,让它负责研究、配置和执行。需要你处理账号或付款时,它再提醒你。
3. 几个进阶技巧
识别乐器:你可以让 AI 识别这段音乐用了什么乐器,并生成对应乐器的视频,这样看起来会更像一点。
跳舞对节奏:AI 生成的视频肯定不会自带你音乐的节奏,这个没法强制。一个方法是让 AI 动态调整视频速度,去对齐音乐节奏。GPT-6 做得到——它会自己去找论文研究人物肢体动作和节奏的对应关系,然后生成波峰波谷的图来完成对齐。
卡点:卡点这件事 AI 可以做得很好,因为它能找到音频中的那个点在哪里。你可以要求它在卡点处切换视频,或者做一些动态效果,都很容易实现。
复杂运镜:Blender 白模 + Seedance 2.5
如果你对镜头的拉近、拉远等变化要求非常高,直接用 AI 生视频往往不够,因为通常只能传首图(比如 Grok CLI 就只支持传首图)。有一个相对高级的技巧,你可以让 GPT-6 按下面的步骤来做:
- 让 AI 用 Blender 这个 3D 建模软件建白模。你告诉它人物怎么站、镜头怎么动,具体建模由它完成;
- 让它根据你要求的镜头变化,利用白模先生成一段带运镜变化的视频;
- 让它把这段白模视频作为 reference,连同按你的要求准备好的人物、风格等参考图片,一起传给 Seedance 2.5(fal 上面也有)。
这样它就能相对稳定地根据白模里的运镜和对应人物,生成符合预期的视频。如果你要讲故事,需要在多人物、固定机位之间不断切换,单纯靠 AI 生视频很难保证一致性,但让 AI 按"白模 + Seedance 2.5"这套工作流来做,就可以做到。你负责看镜头效果、提出修改意见,建模、生成参考视频和调用模型都由它完成。

4. 对口型
对口型也交给 AI:让它准备好音频和画面,调用对口型模型处理。这样的模型现在有很多,我用过比较好的是 fal 上面一个叫 OmniHuman 1.5 的模型,可能是我测过的这么多模型里最好的一个。你可以直接让 AI 去研究怎么用它。
5. 提升分辨率
AI 完成前面的制作后,大概得到的是一个 720p 的视频。如果你希望做成 1080p,就让它在 OpenRouter 或 fal 上找一个 720p 升 1080p 的超分模型,让它自己测评、比较效果和价格,再选一个性价比高的模型完成处理。这类模型用起来差不太多,我没有特别推荐的。
五、第三步:收尾与发布
反馈与打磨
AI 做出初版之后,你可以不断反馈:告诉它哪里做得好、哪里做得不好,以及要在哪个位置打 logo。让它根据你的意见修改、导出新版本,你再看效果。
打包与缩略图
接着让 AI 把所有东西打包成一个 package,并制作 thumbnail(缩略图)。因为上传到不同平台需要不同尺寸,让它把缩略图按以下几个比例各做一版:
- 1:1
- 4:3
- 3:4
- 16:9
上传到各平台
现在 GPT-6 的 Computer Use 和 Chrome Use 都很强,你直接跟它说上传到什么平台,让它在 Chrome 上完成上传和发布准备。遇到登录、验证或发布确认,需要你接手时,它再告诉你。
中文平台通常没有 API;英文平台大部分都有,包括 YouTube。有没有 API、应该走哪条上传路径、怎么配置,都让 AI 去查、去做。需要你开通账号或授权时,让它把具体步骤带到你面前。
六、成本
整体而言,制作一个 1080p、3 到 4 分钟的 music video,成本大概在 20 美元左右,性价比非常高。
写在最后
如果你完全不理解这篇文章里说的是什么,也没有关系。直接把这篇文章发给你的 AI,告诉它:"参照这篇文章,帮我把 MV 做出来。调研、选工具、配置和制作都由你负责,需要我提供素材、挑选结果、注册、充值或确认时,再告诉我。"
最近的 MV
全部音乐继续阅读
全部内容过去十年创作的内容,终于变成了 AI 能读的知识库
最近有不少人问我,ranchen.org 里面那些内容到底是怎么弄出来的。这个网站现在汇集了我过去散落在不同地方的一千多个内容:LinkedIn 文章、视频、播客,还有一些别的平台上的记录。看起来像是突然冒出来一个完整的个人知识库,其实背后没有什么神奇的东西。 它本质上就是一件很朴素的事:把过去说过的话,从各个平台上搬...
200 刀的 coding plan,请无脑开
前段时间我参加一个访谈,顺口提到自己每个月大概会用掉 100 亿 Token。 当时我没有觉得这是一个特别值得展开的数字。因为在我自己的工作流里,AI 已经不是偶尔打开问两句的工具,而是每天都在跑代码、读文件、改项目、做内容、拆业务的基础设施。100 亿 Token 听起来大,但放在这种使用密度里,并没有那么夸张。 有...
Fable 5 读完了我的一千篇文章给我的一封信
生成信息:Claude Code / Fable 5 / effort: max。 原始 prompt: 这个是我的 personal 的文章的 repo,核心的内容在 ranchen.org-website/content 不要看其他 folder 里面的文章。 请阅读他们,然后给我写一封信,只有一次机会,只能给我写...


