AI 影片生成不是「描述得越華麗越好」,而是一套控制工程:選對模式、管好提示詞的優先順序、一段只做一件事。本文整理平台無關的通用方法。
先選對模式
| 需求 | 建議模式 | 原因 |
|---|---|---|
| 沒有圖片、先試概念 | 文生影片 | 快速探索場景、氛圍與奇觀 |
| 固定人物、產品或店面 | 圖生影片 | 以基準圖降低身份與外觀漂移 |
| 明確從 A 狀態到 B 狀態 | 首尾幀 | 控制動作結果與接點 |
| 多個狀態連續變化 | 多幀/關鍵幀 | 以多個節點控制進程 |
| 長片或多場景 | 分段生成+剪輯 | 每段任務清楚,便於重做與品檢 |
| 純圖文與字幕內容 | 圖像+後製 | 不必強行生成複雜影片 |
平台功能(可選時長、比例、首尾幀、參考圖、負面提示欄)依當下介面確認;沒有的功能改用分段、截幀或後製替代。
提示詞的三層優先順序
必要層:主體/身份、場景、單一核心動作、主要鏡頭方向。 控制層:場景反應、節奏、段尾狀態、固定光線與色調。 風格層:材質、粒子、底片感、特殊光效與少量禁止項。
提示詞不是欄位越多越好——先確保必要層沒有衝突,再依風險加控制層;不服務本鏡的內容刪掉。提示詞很長仍失控時,只保留必要層與一個場景反應。
文生 vs 圖生:寫法完全不同
文生影片要描述完整世界,但仍以一個主動作為核心:
一段【時長/比例】影片。【主體與固定特徵】位於【具體場景】,從【起點】開始【單一核心動作】;動作使【物件、衣料、光線或空氣反應】。鏡頭以【景別與一種主要運鏡】呈現,光線【方向與質地】,最後停在【段尾狀態】。避免【2–5 個最相關風險】。
圖生影片中圖片已負責外觀,提示詞主要寫「怎麼動」:
以首幀為準,保持人物/產品、場景、光線與色調一致。主體從【起點】開始【單一核心動作】,帶動【場景反應】。鏡頭【一種主要運鏡】,最後停在【可接狀態】。
圖生的大忌:用文字改圖片裡的東西(把黑色產品說成白色),或同時要求換衣服+換背景+轉身+奔跑+環繞鏡頭。
動作設計:單一核心動作
每段先決定一個動作:抬眼、拿起、轉身、打開、倒入、走近、放下、推門、遞交。複雜行為拆成因果動作鏈:
手指碰杯緣 → 杯中液面晃動 → 蒸氣被手勢推散 → 鏡頭靠近杯沿水痕
再配一個場景反應讓畫面活起來:衣料摺線拉開、液面晃動、蒸氣被推開、反光沿物件移動、陰影因手勢改變。
鏡頭與動作的協調原則
- 臉部與口型重要 → 固定或極慢推鏡,避免大幅環繞
- 手部操作重要 → 中近景特寫、鏡頭穩定、動作拆短
- 產品外觀重要 → 減少遮擋、翻轉與快速旋轉
- 大動作重要 → 全景或中景,降低材質與微表情要求
- 奇觀變形 → 用首尾幀或多幀控制關鍵狀態
分段接力 SOP
長內容靠接力,不靠硬撐一段長生成:
- 規劃本段起點與可接的段尾
- 生成後檢查實際尾幀,不盲目使用最後一格
- 從最後一段穩定畫面截取接續幀
- 下一段延續身份、物件位置、光線與鏡頭方向
- 每完成 2–3 段先進時間軸試接
- 變臉、產品變形或場景錯亂時回到問題段重生,不硬延長
可接元素:手遮鏡、產品靠近鏡頭、光暈填滿前景、門框、霧氣、同方向移動。
假一鏡到底
真長鏡頭只適合單純的動作與場景。複雜內容用「假一鏡到底」:固定主場景與鏡頭方向、每段段尾留可接元素、用遮擋/光線/聲音連接、後製用短溶解與聲音先行修接點。
常見失敗與修正
| 失敗 | 修正 |
|---|---|
| 動作沒發生 | 主語與動詞前移,刪除不相關風格詞 |
| 動作太亂 | 一段只留一個核心動作,拆成多段 |
| 人物漂移 | 改圖生影片、縮短片段、固定參考圖 |
| 產品變形 | 用真實產品圖、減少遮擋與旋轉 |
| 手部錯誤 | 降低動作幅度、改完成態、切特寫或避開手部 |
| 接段跳躍 | 用穩定尾幀作新首幀,保持方向與光線 |
| 文字亂碼 | 畫面不生成文字,改後製疊字 |
逐鏡品檢
主體身份與產品外觀 → 是否完成指定動作 → 手、臉、嘴、眼神比例 → 光線與場景連續性 → 段尾是否可接 → 是否出現亂碼或未授權標誌。
延伸閱讀
內容工廠作品 · 免費使用