用Flux+H3+ffmpeg,52分钟出了一条60秒的《AI:第二大脑》概念片。
技术流程完美:Flux出6张首帧10分钟,H3图生视频6段30分钟,Edge TTS旁白2分钟,ffmpeg剪辑10分钟。全程无报错,画面质量OK。
然后我导出成品一看——
像6段好看的屏保。没有情绪,没有节奏,看完什么也记不住。
花了一下午复盘,发现6个致命错误:
错误一:写了N/A,H3就真的不给音乐 6段prompt都写了"non_diegetic_music: N/A"。结果H3输出的音频只有-68dB,基本静音。唯独有一段我随手写了个"orchestral swell",那条出来-18.4dB,音乐完全正常。 教训:永远不要写N/A。即使你觉得自己不需要配乐,也要写一段简单的音乐描述,H3会根据prompt生成对应音量的音频。
错误二:先做画面,最后才想起配乐 观念蒙太奇的情绪70%靠音乐传递。我反着来——先出画面,再找配乐,结果画面和音乐完全对不上。 正确流程:先选BGM,卡好节拍,用节拍点决定镜头切换时机。
错误三:Edge TTS念哲学金句 "直觉只能看见昨天,数据只能描述今天"——这种话用机器人声音说出来,像在念说明书。 Edge TTS只适合通知播报,不适合情绪表达。概念片必须用真人录音或IndexTTS2.5克隆有感情的音色。
错误四:6个镜头全是静态摆拍 桌面、窗前、特写、走路、纸张、航拍——每个镜头都是"好看的空画面",没有动作,没有变化,没有事件。 观念蒙太奇不是把好看的镜头拼在一起,每个镜头必须有内在意涵和情绪递进。
错误五:旁白是正确的废话 "掌握它的人重构规则,忽视它的人被时代折叠"——这种话听过100遍了,没有新鲜感。 好的旁白要有具体画面、具体数字、具体场景,不是抽象概念的堆砌。
错误六:节奏没有呼吸 6段都是相似时长的缓慢推进,没有快慢对比,没有高潮低谷。 蒙太奇节奏要有呼吸——快切→慢推→停顿→爆发→静止。
结论 技术管线已验证,52分钟全流程可行。但"能出片"≠"出好片"。下次做概念片,先定音乐和旁白,再用画面服务情绪,而不是反过来。
一句话总结:画面好看不等于有感染力,没有配乐的概念片就是屏保。
#AI视频 #H3 #视频制作 #AI创作 #观念蒙太奇 #翻车复盘 #MiniMax #我这行的AI路



