MiniMax H3 可以同時讀取文字、圖片、影片與音訊。

因此,很多人會自然認為:

我提供的參考素材愈多,模型掌握的資訊愈完整,生成影片應該就會愈準。

答案是不一定。

更多素材確實可能幫助模型理解角色、商品、動作與聲音,但也可能帶來更多互相衝突的訊息。

例如你同時上傳:

  • 三張不同角度的人物照片。
  • 一段另一位演員的動作影片。
  • 一首節奏很快的音樂。
  • 一段要求安靜慢動作的文字指令。

模型可能不知道應該優先保留哪一張臉、哪一套服裝、哪一種速度,以及哪一種鏡頭氣氛。

參考素材真正有用的條件,不是數量最多,而是每份素材都具有清楚、單一而且不互相衝突的用途。

為什麼參考素材愈多,反而可能愈不穩定?

一份參考素材通常不只包含一項資訊。

一張人物照片可能同時包含:

  • 臉部與髮型。
  • 服裝與配件。
  • 人物姿勢。
  • 背景環境。
  • 光線與攝影角度。

一段動作影片也可能同時包含:

  • 另一位人物的外觀。
  • 動作速度。
  • 鏡頭移動。
  • 場景與服裝。
  • 原本的聲音與節奏。

當模型同時接收多份素材時,它必須判斷哪些特徵要保留、哪些可以忽略。

如果使用者沒有明確說明,模型可能把不同素材中的特徵混合在一起。

結果可能變成:

  • 人物臉部接近第一張照片,服裝卻來自第二張照片。
  • 商品外觀正確,按鈕位置卻在動作過程中改變。
  • 鏡頭原本應該緩慢推近,卻因參考音樂而快速移動。
  • 場景要求清晨,最後卻採用參考影片中的夜間光線。
  • 明明要求沒有對話,人物仍出現嘴部動作。
多模態模型看得懂更多種類的資料,不代表它會自動知道哪一份資料最重要。

三張人物圖片,一定比一張更能保持角色一致嗎?

不一定,要看三張圖片是否真的代表同一個角色。

比較有幫助的三張圖片,通常具有:

  • 相同人物。
  • 相同髮型。
  • 相同服裝。
  • 接近的光線。
  • 正面、側面及三分之二角度等互補視角。

這些照片能幫助模型看清楚人物在不同角度下的外觀。

但如果三張照片分別使用:

  • 不同髮型。
  • 不同年齡妝容。
  • 不同服裝。
  • 不同照片風格。
  • 差異很大的臉部表情。

模型反而可能把它們理解成三種可以混合的版本。

正式製作前,應先決定:

  • 哪一張是主要身分參考。
  • 其他圖片只補充哪個角度。
  • 服裝與髮型以哪一張為準。

可以明確寫:

第一張圖片是主要角色外觀,臉部、髮型、服裝與配件都以第一張為準。第二張和第三張只補充側面與背面角度,不得用來改變角色造型。

同時提供人物圖片和動作影片,會發生什麼?

人物圖片可以固定主角外觀,動作影片則能示範複雜姿勢、手部操作與鏡頭運動。

兩者搭配得好,確實比只用文字描述更清楚。

但動作影片通常也有自己的演員、服裝和場景。

如果沒有設定範圍,模型可能把參考影片中的人物特徵帶進生成結果。

比較清楚的指令是:

人物臉部、髮型、服裝與身形只以角色圖片為準。參考影片只提供拿起商品、轉身和放回桌面的動作順序,不採用影片中的演員、服裝、場景、光線與聲音。

如果只需要攝影方式,可以進一步縮小:

只參考影片中由中景緩慢推近至商品特寫的鏡頭運動,不參考人物動作與其他畫面內容。

範圍愈清楚,模型愈容易理解不同素材之間的分工。

增加音訊參考,會讓影片動作更自然嗎?

有可能,但也可能產生新的衝突。

音訊除了提供聲音,還會傳達:

  • 節奏快慢。
  • 情緒。
  • 動作應該發生的時間點。
  • 場景氣氛。

如果你提供節奏快速的音樂,卻要求人物緩慢、安靜地完成一項手工動作,模型可能不知道要跟隨哪一種節奏。

音訊參考最好只負責明確項目。

例如:

這段音訊只用來參考雨聲的密度和空間感,不使用其中的音樂、人聲與節奏。

或者:

這段音訊只決定動作節拍,每一個主要動作配合一次節奏點,但不得複製歌詞、人聲、旋律與聲音身分。

不需要音訊參考時,直接用文字要求自然環境聲,可能比加入一段內容複雜的錄音更容易控制。

什麼時候應該增加參考素材?

增加素材應該是為了解決已經看見的具體問題。

例如:

  • 側臉經常改變:增加一張同造型的側面照片。
  • 手部動作不清楚:增加一段只展示手部操作的影片。
  • 鏡頭方向錯誤:加入一段簡單的鏡頭運動參考。
  • 商品背面細節消失:增加一張商品背面圖片。
  • 環境聲不自然:增加一段乾淨、沒有其他內容的環境聲。

不要因為第一版不理想,就把所有找到的素材全部加入。

每加入一份素材,都應能回答:

這份素材準備解決哪一個明確問題?

回答不出來,就代表它可能不是必要參考。

什麼時候應該刪除參考素材?

如果出現以下情況,可以先減少素材:

  • 人物外觀在不同版本間來回變化。
  • 服裝、場景或光線不斷漂移。
  • 模型忽略主要參考圖片。
  • 動作與鏡頭彼此衝突。
  • 影片出現未要求的人聲或音樂。
  • 修改 Prompt 後仍無法判斷是哪份資料造成問題。

最簡單的除錯方式,是先退回:

  • 一張主要外觀圖片。
  • 一個主要動作。
  • 一種鏡頭運動。
  • 一項聲音要求。

確認基本鏡頭穩定後,再一次增加一份素材。

AI 影片除錯和堆積素材相反:先減到只剩必要條件,才能看見真正造成錯誤的來源。

可以讓模型自己判斷每份素材的用途嗎?

可以,但結果不一定符合你的真正目的。

例如模型看到一張人物圖片和一段影片,可能自行推測:

  • 圖片提供角色。
  • 影片提供整體視覺風格。

但你原本可能只想使用影片裡的手部動作。

模型不是不知道素材內容,而是不知道你最在意哪一部分。

因此,即使工具具備多模態理解能力,創作者仍應說明:

  • 主要參考是什麼。
  • 次要素材只補充什麼。
  • 哪些內容不能互相混用。

素材很多時,應該怎麼排優先順序?

可以把參考資料分成三個層級。

第一層:必須完全保留。

  • 人物身分。
  • 商品外觀。
  • 不可改變的服裝或場景。

第二層:只提供特定動作或形式。

  • 人物動作。
  • 鏡頭移動。
  • 光線方向。
  • 環境聲。

第三層:可以依生成結果調整。

  • 背景細節。
  • 裝飾物。
  • 次要光影。
  • 不影響內容的氣氛元素。

可以在 Prompt 中寫:

角色和商品外觀具有最高優先順序,不得改變。動作影片只提供操作順序,鏡頭參考只提供推近方式。背景裝飾可以依空間自然調整,但不得遮擋商品或增加其他人物。

為什麼一個鏡頭只安排一個主要動作?

參考素材數量不是唯一問題。

一段影片同時要求太多事情,也會增加失敗機率。

例如八秒內要求人物:

  • 走進房間。
  • 換上另一套衣服。
  • 拿起商品。
  • 向鏡頭展示。
  • 和另一個人交談。
  • 最後離開場景。

即使提供大量圖片和動作影片,模型仍要在很短時間內完成多次姿勢、空間與人物關係變化。

更穩定的做法是拆成:

  • 第一段:人物走到工作檯前。
  • 第二段:人物拿起商品。
  • 第三段:鏡頭靠近商品細節。
  • 第四段:人物把商品放回原位。

每段只提供完成該動作必要的素材。

可以直接使用這段精簡素材 Prompt

請先不要綜合模仿所有參考素材。圖片一是最高優先的角色與服裝參考;圖片二只補充角色側面角度;商品圖片只負責產品形狀、顏色、材質與細節。參考影片只提供手把商品拿起並轉向鏡頭的動作,不採用影片中的人物、服裝、背景、聲音與光線。請生成一段六秒影片,只完成這一個動作。鏡頭保持中景並緩慢推近。不要對話、嘴部動作、額外人物、可讀文字或 Logo。無法同時保留角色和商品外觀時,應減少動作,不得重新設計主體。

如何用最少素材開始測試?

第一次可以只準備:

  • 一張清楚的主要參考圖片。
  • 一段只包含一個動作的文字指令。
  • 三項不可改變的限制。

例如:

使用參考圖片中的人物、服裝和陶杯。人物把陶杯緩慢放到木桌上,鏡頭保持固定中景。不得改變人物臉部、陶杯顏色與把手位置。不要對話、可讀文字或額外人物。

生成後先檢查:

  • 人物是否一致。
  • 商品是否正確。
  • 主要動作是否完成。

只有在某一項仍然不清楚時,再加入相對應的素材。

參考素材清楚,就能保證影片完全正確嗎?

不能保證。

即使素材數量適當、用途清楚,AI 影片仍可能出現:

  • 臉部漂移。
  • 手指變形。
  • 商品細節改變。
  • 物體突然消失。
  • 聲音與動作不同步。

素材分工的作用,是降低衝突並提高可控制性,不是讓生成模型變成完全精準的傳統攝影工具。

涉及商品廣告、教學示範或真實人物時,仍要逐段檢查。

哪些內容不能只看畫面漂亮?

  • 商品尺寸、顏色與功能。
  • 包裝內真正包含的配件。
  • 人物肖像與聲音授權。
  • 品牌與商標。
  • 新聞及真實事件畫面。
  • 可能被觀眾當成實拍證據的內容。

AI 影片看起來自然,不代表呈現的內容一定真實。

發布前還要確認素材權利,以及觀眾是否需要知道內容經過 AI 生成或修改。

今天最重要的答案

MiniMax H3 能同時理解文字、圖片、影片與聲音,讓創作者不必只靠一段文字描述所有細節。

但多模態能力不是素材數量競賽。

真正有效的流程是:

  • 先用最少素材完成一個主要動作。
  • 指定每份素材只負責一件事。
  • 只有遇到具體問題時才增加參考。
  • 每次增加一份素材後重新檢查結果。
  • 素材發生衝突時,以刪減而不是繼續堆疊來除錯。

給 MiniMax H3 的參考素材不是愈多愈準;真正決定結果的,是素材是否一致、分工是否清楚,以及每個鏡頭是否只要求模型完成一項可以控制的工作。

今天,和 AI 一起進步一點。

每天學會一個 AI 技巧。

每天節省一點時間。

每天提升一點能力。

SasaDaily,陪你一起成長。

推薦閱讀