MiniMax H3 可以同時讀取文字、圖片、影片與音訊。
因此,很多人會自然認為:
我提供的參考素材愈多,模型掌握的資訊愈完整,生成影片應該就會愈準。
答案是不一定。
更多素材確實可能幫助模型理解角色、商品、動作與聲音,但也可能帶來更多互相衝突的訊息。
例如你同時上傳:
- 三張不同角度的人物照片。
- 一段另一位演員的動作影片。
- 一首節奏很快的音樂。
- 一段要求安靜慢動作的文字指令。
模型可能不知道應該優先保留哪一張臉、哪一套服裝、哪一種速度,以及哪一種鏡頭氣氛。
參考素材真正有用的條件,不是數量最多,而是每份素材都具有清楚、單一而且不互相衝突的用途。
為什麼參考素材愈多,反而可能愈不穩定?
一份參考素材通常不只包含一項資訊。
一張人物照片可能同時包含:
- 臉部與髮型。
- 服裝與配件。
- 人物姿勢。
- 背景環境。
- 光線與攝影角度。
一段動作影片也可能同時包含:
- 另一位人物的外觀。
- 動作速度。
- 鏡頭移動。
- 場景與服裝。
- 原本的聲音與節奏。
當模型同時接收多份素材時,它必須判斷哪些特徵要保留、哪些可以忽略。
如果使用者沒有明確說明,模型可能把不同素材中的特徵混合在一起。
結果可能變成:
- 人物臉部接近第一張照片,服裝卻來自第二張照片。
- 商品外觀正確,按鈕位置卻在動作過程中改變。
- 鏡頭原本應該緩慢推近,卻因參考音樂而快速移動。
- 場景要求清晨,最後卻採用參考影片中的夜間光線。
- 明明要求沒有對話,人物仍出現嘴部動作。
多模態模型看得懂更多種類的資料,不代表它會自動知道哪一份資料最重要。
三張人物圖片,一定比一張更能保持角色一致嗎?
不一定,要看三張圖片是否真的代表同一個角色。
比較有幫助的三張圖片,通常具有:
- 相同人物。
- 相同髮型。
- 相同服裝。
- 接近的光線。
- 正面、側面及三分之二角度等互補視角。
這些照片能幫助模型看清楚人物在不同角度下的外觀。
但如果三張照片分別使用:
- 不同髮型。
- 不同年齡妝容。
- 不同服裝。
- 不同照片風格。
- 差異很大的臉部表情。
模型反而可能把它們理解成三種可以混合的版本。
正式製作前,應先決定:
- 哪一張是主要身分參考。
- 其他圖片只補充哪個角度。
- 服裝與髮型以哪一張為準。
可以明確寫:
第一張圖片是主要角色外觀,臉部、髮型、服裝與配件都以第一張為準。第二張和第三張只補充側面與背面角度,不得用來改變角色造型。
同時提供人物圖片和動作影片,會發生什麼?
人物圖片可以固定主角外觀,動作影片則能示範複雜姿勢、手部操作與鏡頭運動。
兩者搭配得好,確實比只用文字描述更清楚。
但動作影片通常也有自己的演員、服裝和場景。
如果沒有設定範圍,模型可能把參考影片中的人物特徵帶進生成結果。
比較清楚的指令是:
人物臉部、髮型、服裝與身形只以角色圖片為準。參考影片只提供拿起商品、轉身和放回桌面的動作順序,不採用影片中的演員、服裝、場景、光線與聲音。
如果只需要攝影方式,可以進一步縮小:
只參考影片中由中景緩慢推近至商品特寫的鏡頭運動,不參考人物動作與其他畫面內容。
範圍愈清楚,模型愈容易理解不同素材之間的分工。
增加音訊參考,會讓影片動作更自然嗎?
有可能,但也可能產生新的衝突。
音訊除了提供聲音,還會傳達:
- 節奏快慢。
- 情緒。
- 動作應該發生的時間點。
- 場景氣氛。
如果你提供節奏快速的音樂,卻要求人物緩慢、安靜地完成一項手工動作,模型可能不知道要跟隨哪一種節奏。
音訊參考最好只負責明確項目。
例如:
這段音訊只用來參考雨聲的密度和空間感,不使用其中的音樂、人聲與節奏。
或者:
這段音訊只決定動作節拍,每一個主要動作配合一次節奏點,但不得複製歌詞、人聲、旋律與聲音身分。
不需要音訊參考時,直接用文字要求自然環境聲,可能比加入一段內容複雜的錄音更容易控制。
什麼時候應該增加參考素材?
增加素材應該是為了解決已經看見的具體問題。
例如:
- 側臉經常改變:增加一張同造型的側面照片。
- 手部動作不清楚:增加一段只展示手部操作的影片。
- 鏡頭方向錯誤:加入一段簡單的鏡頭運動參考。
- 商品背面細節消失:增加一張商品背面圖片。
- 環境聲不自然:增加一段乾淨、沒有其他內容的環境聲。
不要因為第一版不理想,就把所有找到的素材全部加入。
每加入一份素材,都應能回答:
這份素材準備解決哪一個明確問題?
回答不出來,就代表它可能不是必要參考。
什麼時候應該刪除參考素材?
如果出現以下情況,可以先減少素材:
- 人物外觀在不同版本間來回變化。
- 服裝、場景或光線不斷漂移。
- 模型忽略主要參考圖片。
- 動作與鏡頭彼此衝突。
- 影片出現未要求的人聲或音樂。
- 修改 Prompt 後仍無法判斷是哪份資料造成問題。
最簡單的除錯方式,是先退回:
- 一張主要外觀圖片。
- 一個主要動作。
- 一種鏡頭運動。
- 一項聲音要求。
確認基本鏡頭穩定後,再一次增加一份素材。
AI 影片除錯和堆積素材相反:先減到只剩必要條件,才能看見真正造成錯誤的來源。
可以讓模型自己判斷每份素材的用途嗎?
可以,但結果不一定符合你的真正目的。
例如模型看到一張人物圖片和一段影片,可能自行推測:
- 圖片提供角色。
- 影片提供整體視覺風格。
但你原本可能只想使用影片裡的手部動作。
模型不是不知道素材內容,而是不知道你最在意哪一部分。
因此,即使工具具備多模態理解能力,創作者仍應說明:
- 主要參考是什麼。
- 次要素材只補充什麼。
- 哪些內容不能互相混用。
素材很多時,應該怎麼排優先順序?
可以把參考資料分成三個層級。
第一層:必須完全保留。
- 人物身分。
- 商品外觀。
- 不可改變的服裝或場景。
第二層:只提供特定動作或形式。
- 人物動作。
- 鏡頭移動。
- 光線方向。
- 環境聲。
第三層:可以依生成結果調整。
- 背景細節。
- 裝飾物。
- 次要光影。
- 不影響內容的氣氛元素。
可以在 Prompt 中寫:
角色和商品外觀具有最高優先順序,不得改變。動作影片只提供操作順序,鏡頭參考只提供推近方式。背景裝飾可以依空間自然調整,但不得遮擋商品或增加其他人物。
為什麼一個鏡頭只安排一個主要動作?
參考素材數量不是唯一問題。
一段影片同時要求太多事情,也會增加失敗機率。
例如八秒內要求人物:
- 走進房間。
- 換上另一套衣服。
- 拿起商品。
- 向鏡頭展示。
- 和另一個人交談。
- 最後離開場景。
即使提供大量圖片和動作影片,模型仍要在很短時間內完成多次姿勢、空間與人物關係變化。
更穩定的做法是拆成:
- 第一段:人物走到工作檯前。
- 第二段:人物拿起商品。
- 第三段:鏡頭靠近商品細節。
- 第四段:人物把商品放回原位。
每段只提供完成該動作必要的素材。
可以直接使用這段精簡素材 Prompt
請先不要綜合模仿所有參考素材。圖片一是最高優先的角色與服裝參考;圖片二只補充角色側面角度;商品圖片只負責產品形狀、顏色、材質與細節。參考影片只提供手把商品拿起並轉向鏡頭的動作,不採用影片中的人物、服裝、背景、聲音與光線。請生成一段六秒影片,只完成這一個動作。鏡頭保持中景並緩慢推近。不要對話、嘴部動作、額外人物、可讀文字或 Logo。無法同時保留角色和商品外觀時,應減少動作,不得重新設計主體。
如何用最少素材開始測試?
第一次可以只準備:
- 一張清楚的主要參考圖片。
- 一段只包含一個動作的文字指令。
- 三項不可改變的限制。
例如:
使用參考圖片中的人物、服裝和陶杯。人物把陶杯緩慢放到木桌上,鏡頭保持固定中景。不得改變人物臉部、陶杯顏色與把手位置。不要對話、可讀文字或額外人物。
生成後先檢查:
- 人物是否一致。
- 商品是否正確。
- 主要動作是否完成。
只有在某一項仍然不清楚時,再加入相對應的素材。
參考素材清楚,就能保證影片完全正確嗎?
不能保證。
即使素材數量適當、用途清楚,AI 影片仍可能出現:
- 臉部漂移。
- 手指變形。
- 商品細節改變。
- 物體突然消失。
- 聲音與動作不同步。
素材分工的作用,是降低衝突並提高可控制性,不是讓生成模型變成完全精準的傳統攝影工具。
涉及商品廣告、教學示範或真實人物時,仍要逐段檢查。
哪些內容不能只看畫面漂亮?
- 商品尺寸、顏色與功能。
- 包裝內真正包含的配件。
- 人物肖像與聲音授權。
- 品牌與商標。
- 新聞及真實事件畫面。
- 可能被觀眾當成實拍證據的內容。
AI 影片看起來自然,不代表呈現的內容一定真實。
發布前還要確認素材權利,以及觀眾是否需要知道內容經過 AI 生成或修改。
今天最重要的答案
MiniMax H3 能同時理解文字、圖片、影片與聲音,讓創作者不必只靠一段文字描述所有細節。
但多模態能力不是素材數量競賽。
真正有效的流程是:
- 先用最少素材完成一個主要動作。
- 指定每份素材只負責一件事。
- 只有遇到具體問題時才增加參考。
- 每次增加一份素材後重新檢查結果。
- 素材發生衝突時,以刪減而不是繼續堆疊來除錯。
給 MiniMax H3 的參考素材不是愈多愈準;真正決定結果的,是素材是否一致、分工是否清楚,以及每個鏡頭是否只要求模型完成一項可以控制的工作。
今天,和 AI 一起進步一點。
每天學會一個 AI 技巧。
每天節省一點時間。
每天提升一點能力。
SasaDaily,陪你一起成長。