製作一段 AI 短片,過去常常要經過好幾個工具。

你可能先用圖片模型建立角色,再把圖片放進影片工具,接著另外製作旁白、音效與背景音樂,最後才進剪輯軟體把全部內容對在一起。

每換一次工具,就可能出現:

  • 角色外觀改變。
  • 畫面動作和音效不同步。
  • 鏡頭節奏不符合原本構想。
  • 產品顏色或外型被重新生成。
  • 需要反覆匯出與重新上傳素材。

MiniMax H3 想解決的,就是這段被切成很多工具的流程。

它可以把文字、圖片、影片與音訊當成同一組創作資料,直接理解角色、動作、鏡頭、聲音及節奏,再產生一段最高 2K、最長 15 秒的有聲影片。

MiniMax H3 是什麼?

MiniMax H3 是 MiniMax 在 2026 年 7 月 31 日推出的多模態影片生成模型。

它目前支援:

  • 文字轉影片。
  • 圖片轉影片。
  • 指定第一幀與最後一幀。
  • 使用圖片、影片與音訊作為參考。
  • 依照指令修改既有影片。

官方提供的影片長度範圍約為 4 至 15 秒,最高可輸出 2K 解析度。

和只接受文字或單張圖片的影片工具相比,H3 更重要的差異是:

你可以把不同類型的參考素材放進同一次生成,讓模型理解它們彼此之間的關係。

你不只是在描述「要生成什麼畫面」,也可以同時告訴模型「角色長什麼樣、動作參考哪支影片、聲音使用什麼節奏,以及最後要停在哪一個畫面」。

一般使用者可以在哪裡使用?

一般創作者可以透過 Hailuo AI 的網頁介面選擇 MiniMax H3。

開發者則可以透過 MiniMax API,把模型接入:

  • 影片製作平台。
  • 電商內容系統。
  • 廣告素材流程。
  • 遊戲與角色內容工具。
  • 社群短片自動化系統。

在網頁介面中,使用者可以依需求選擇:

  • 從文字開始生成。
  • 上傳第一張圖片讓它動起來。
  • 同時指定開場與結尾畫面。
  • 加入角色、動作、鏡頭或聲音參考。

第一次使用時,不需要立即準備很多素材。

先用一張清楚圖片與一段簡單動作指令測試,通常更容易看懂模型如何處理畫面。

第一個特色:可以直接生成有聲影片

MiniMax H3 可以在生成畫面的同時,產生原生立體聲音訊。

聲音可能包括:

  • 環境聲。
  • 腳步與物件聲音。
  • 背景音樂。
  • 人物說話。
  • 和畫面動作相配的音效。

例如你可以要求:

一名陶藝師把剛完成的陶杯放到木桌上,窗外下著小雨。鏡頭慢慢靠近杯子的釉面,保留雨聲、陶器碰到桌面的輕微聲音,以及安靜的室內氣氛。不要人物說話。

模型可以同時處理:

  • 人物動作。
  • 鏡頭靠近。
  • 雨聲。
  • 陶器接觸桌面的聲音。
  • 整體情緒。

這能減少先生成無聲畫面,再另外尋找音效的時間。

但生成聲音仍可能出現:

  • 動作與聲音時間不完全一致。
  • 背景音量過大。
  • 人物嘴型與語音不同步。
  • 不需要的音樂或對話。

如果你不需要人物說話,最好直接寫明:

No dialogue. No speaking. No lip movement. Use only environmental sound and natural object sounds.

第二個特色:文字、圖片、影片與音訊可以一起參考

一般圖片轉影片工具,通常只能看一張起始圖片,再依 Prompt 猜測後續動作。

MiniMax H3 則能同時接受多種參考內容。

例如商品廣告可以提供:

  • 商品正面照片。
  • 商品側面照片。
  • 品牌希望參考的鏡頭運動影片。
  • 背景音樂或節奏參考。
  • 文字形式的場景與動作要求。

模型會嘗試把這些內容放進同一段影片。

這對需要維持特定外觀的內容特別有幫助,例如:

  • 商品。
  • 角色。
  • 服裝。
  • 場景風格。
  • 攝影節奏。

但參考素材愈多,不代表結果一定愈準。

如果圖片、影片與文字互相衝突,模型可能不知道該優先遵循哪一項。

例如:

  • 圖片中的人物穿黑色衣服,Prompt 卻要求白色衣服。
  • 參考影片是快速手持鏡頭,文字卻要求穩定慢鏡頭。
  • 音樂節奏很快,畫面要求卻是安靜緩慢。

比較好的做法,是讓每一份素材只負責一件事。

圖片負責角色與商品外觀,影片負責動作或鏡頭,音訊負責聲音節奏,文字負責完整場景與限制。

第三個特色:可以指定第一幀與最後一幀

有些 AI 影片開頭很好看,最後卻不知道停在哪裡。

MiniMax H3 支援第一幀與最後一幀控制。

你可以提供:

  • 影片開始時的畫面。
  • 影片結束時希望到達的畫面。
  • 兩者之間應該發生的動作。

例如:

  • 第一幀是一個尚未拆封的商品盒。
  • 最後一幀是商品完整陳列在桌面上。
  • 中間要求雙手拆封、取出商品並轉向鏡頭。

這種方式適合:

  • 商品開箱。
  • 前後對照。
  • 空間轉換。
  • 服裝變化。
  • 故事轉折。

但兩張圖片差異過大時,仍可能出現不自然的變形。

例如人物姿勢、鏡位、場景與光線全部不同,模型就需要在幾秒內完成太多轉換。

最好讓首尾畫面至少保留:

  • 相同人物或商品。
  • 接近的鏡頭角度。
  • 可理解的空間關係。
  • 合理的動作路徑。

第四個特色:可以參考既有影片的動作與鏡頭

你可以提供一段參考影片,請 H3 學習其中的:

  • 人物動作。
  • 鏡頭移動。
  • 剪輯節奏。
  • 表演速度。
  • 場景轉換方式。

例如,一家服飾品牌有一段模特兒旋轉展示外套的參考影片。

品牌可以提供新的服裝圖片,再要求模型參考原影片的:

  • 轉身速度。
  • 鏡頭跟拍。
  • 衣服擺動。
  • 最後停下的姿勢。

這比只寫「模特兒自然轉身」更容易傳達具體動作。

但使用參考影片時,要注意:

  • 素材是否由自己拍攝。
  • 是否有權使用人物肖像。
  • 是否包含受保護的角色或品牌。
  • 是否正在模仿特定創作者的完整作品。

能夠上傳,不代表一定擁有重製與商業使用的權利。

第五個特色:可以修改既有影片

MiniMax H3 不只從零生成,也能依照指令修改已有影片。

可能的修改包括:

  • 替換人物服裝。
  • 改變背景場景。
  • 移除或增加物件。
  • 調整天氣與光線。
  • 改變視覺風格。
  • 加入新的音效與氣氛。

例如一段商品展示影片原本拍攝於一般房間,可以要求:

保留商品、手部動作、鏡頭位置和原本時間長度,把背景改成乾淨的木工工作室,使用上午自然光,不增加人物,不改變商品顏色、尺寸、材質與表面紋理。

這類指令的重點是先寫出:

  • 哪些內容必須保留。
  • 哪些內容可以改變。
  • 哪些內容絕對不能產生變化。

如果只寫「幫我變得更專業」,模型可能連商品本身都重新設計。

第一個實用場景:把商品照片變成社群短片

小型品牌不一定有預算每一項商品都重新拍影片。

可以先準備:

  • 商品正面照片。
  • 側面與細節照片。
  • 實際使用情境。
  • 不可改變的產品特徵。

再要求 H3 生成:

  • 商品緩慢旋轉。
  • 鏡頭靠近材質細節。
  • 手部實際使用。
  • 環境音與輕微物件聲。

可以使用:

使用參考圖片中的商品外觀、顏色、比例、材質與細節。生成一段 9:16 的八秒商品展示短片。第一段為桌面中景,手把商品放入畫面;第二段鏡頭緩慢靠近表面細節;最後停在完整商品正面。不得改變 Logo、按鈕位置、包裝文字、顏色和產品尺寸。不要人物說話,只保留自然環境音與輕微操作聲。

生成後仍要對照真實商品檢查:

  • 顏色。
  • 尺寸比例。
  • 按鈕與接口。
  • 材質。
  • 包裝內容。

AI 影片不能把不存在的功能或配件呈現成真實商品。

第二個實用場景:讓文章封面變成短影音開場

內容創作者可以把文章封面或分鏡圖片上傳,製作短影音中的動態開場。

例如一篇文章討論 AI 資料中心,可以要求:

  • 機房燈光逐步亮起。
  • 工程人員進入畫面檢查設備。
  • 鏡頭從光纖模組移到伺服器機架。
  • 保留空白區域放置繁體中文字幕。

這比讓模型直接生成整支四十秒影片更容易控制。

比較穩定的方式是:

  • 每張圖生成五至八秒。
  • 每一段只安排一項主要動作。
  • 字幕仍在剪輯工具中加入。
  • 最後把多段短片組合成完整內容。
AI 影片目前更適合生成可控制的短鏡頭,而不是一次承擔整支影片的角色、故事、字幕與節奏。

第三個實用場景:建立同一角色的多個故事鏡頭

如果要製作連續故事,可以把角色參考圖固定使用在不同片段中。

每一段都重複說明:

  • 角色外觀。
  • 服裝。
  • 年齡與髮型。
  • 場景時間。
  • 不可改變的特徵。

例如:

  • 第一段:角色走進早餐店。
  • 第二段:角色查看混亂的訂單。
  • 第三段:角色重新整理工作流程。
  • 第四段:店內出餐恢復順暢。

不要在同一個十五秒片段裡塞入四個完整場景。

分開生成,再用相同參考素材維持角色一致,通常比較容易修改。

第四個實用場景:修改已經拍好的素材

有時不是缺少影片,而是原影片有一項不理想。

例如:

  • 背景太雜亂。
  • 光線不符合品牌。
  • 桌面出現不需要的物品。
  • 產品展示環境不夠完整。

H3 可以嘗試修改場景,同時保留原本的人物動作與鏡頭。

但涉及商品、教學或新聞內容時,應避免修改到會改變事實的部分。

例如:

  • 不能把普通材料改成高級材質。
  • 不能增加產品不存在的功能。
  • 不能把測試情境改成實際成功案例。
  • 不能讓新聞人物看起來做過沒有發生的事情。

怎麼寫比較適合 H3 的 Prompt?

可以分成六個部分:

  • 主體:人物、商品或場景。
  • 動作:這幾秒內實際發生什麼。
  • 鏡頭:遠近、角度與移動方式。
  • 聲音:環境音、音效、音樂或對話。
  • 結尾:最後停在哪個畫面。
  • 限制:哪些內容不能改變或出現。

例如:

一名亞洲麵包師在清晨的獨立烘焙坊,把剛出爐的麵包放上冷卻架。中景側面鏡頭,鏡頭先保持穩定,再緩慢靠近麵包表面的蒸氣與紋理。保留烤盤輕響、紙張摩擦與安靜店內環境聲。最後停在麵包師檢查成品的畫面。不要對話、不要嘴部動作、不要改變人物服裝、不要出現可讀文字、Logo 或額外人物。

如果有參考圖片,可以再補充:

人物外觀、服裝、工作檯、麵包形狀與空間配置,以參考圖片為準。影片參考只用於鏡頭移動,不改變角色與場景。

哪些指令容易讓結果失敗?

一次安排太多動作。

例如十五秒內要求角色進門、換衣服、拿商品、跑到戶外、駕車離開並進入另一棟建築。

參考素材互相矛盾。

圖片、影片與文字要求不同人物、服裝或鏡頭。

使用抽象形容詞代替動作。

例如只寫「做出一段很有力量、很感人的影片」,卻沒有描述畫面會發生什麼。

沒有說明必須保留的內容。

模型可能重新設計商品、人物或場景。

讓模型直接生成大量文字。

AI 影片裡的文字仍可能出現錯字、變形與閃爍。

正式標題與字幕最好在剪輯階段加入。

它能完全解決人物一致性嗎?

不能保證。

使用多張角色參考、固定服裝與清楚鏡頭,通常能提高一致性。

但仍可能出現:

  • 臉部細節變化。
  • 手指與肢體異常。
  • 衣服顏色或配件改變。
  • 不同鏡頭中的身形差異。
  • 多人物互動時位置混亂。

正式製作時,可以:

  • 每段只安排一至兩個人物。
  • 避免過快、過複雜的肢體動作。
  • 縮短每個鏡頭。
  • 使用清楚而一致的參考圖。
  • 生成多個版本後再挑選。

原生有聲就不需要剪輯了嗎?

仍然需要。

原生聲音可以減少找素材的時間,但正式發布前仍要檢查:

  • 畫面和音效是否同步。
  • 是否出現不需要的對話。
  • 聲音是否忽然中斷。
  • 背景音樂是否蓋過重點。
  • 是否需要繁體中文字幕。
  • 多個片段之間的音量是否一致。

H3 可以生成鏡頭,剪映、CapCut、Premiere 或其他剪輯工具仍負責:

  • 鏡頭排列。
  • 字幕。
  • 音量。
  • 轉場。
  • 品牌片尾。

能用它模仿別人的聲音嗎?

技術上可以使用音訊作為參考,但不代表可以任意複製別人的聲音。

使用聲音前應確認:

  • 本人是否同意。
  • 是否具有商業使用權。
  • 是否會讓觀眾誤以為真人說過這些內容。
  • 平台是否要求標示 AI 生成。

不要用未經同意的名人、客戶、員工或家人聲音製作內容。

涉及廣告、新聞、政治或正式背書時,聲音與人物身分更需要清楚揭露。

免費使用就代表可以商用嗎?

不代表。

能否商用需要同時確認:

  • 目前帳號方案。
  • MiniMax 與 Hailuo AI 的最新服務條款。
  • 上傳素材的權利。
  • 生成內容中的人物與品牌。
  • 音樂、聲音及參考影片的授權。

產品方案、點數與商業使用規則可能更新。

正式替客戶製作或用於廣告前,應重新查看當時的條款,而不是只依照別人的舊教學。

第一次測試可以怎麼做?

先不要做完整故事。

挑一張清楚、沒有敏感內容的圖片,完成一個單純動作。

例如:

  • 手把商品放到桌面。
  • 人物從畫面右側走到中央。
  • 鏡頭緩慢靠近一項完成成果。
  • 燈光從昏暗逐漸變亮。

接著檢查:

  • 主體是否保持一致。
  • 動作是否自然。
  • 鏡頭是否遵循指令。
  • 聲音是否符合場景。
  • 最後一幀是否可以接下一個鏡頭。

第一段成功後,再加入第二份參考素材。

不要一開始就同時加入九張圖片、多段影片與聲音,否則很難判斷哪項素材造成結果偏離。

可以直接使用這段商品影片 Prompt

使用參考圖片中的真實商品作為唯一產品主體,完整保留它的顏色、比例、材質、表面細節、按鈕、接口與包裝結構。生成一段八秒、9:16 的寫實商品短片。開場為商品放在工作檯上的中景,兩隻手自然拿起商品並轉向鏡頭;鏡頭接著緩慢靠近一項關鍵材質細節;最後把商品放回原位並停在完整正面。只生成自然操作聲與安靜環境音,不要人物說話,不要嘴部動作,不要增加不存在的配件、功能、文字或 Logo,不得改變商品外觀。

MiniMax H3 適合哪些人?

  • 需要製作 Shorts、Reels 與 TikTok 的內容創作者。
  • 希望把商品照片變成影片的小型品牌。
  • 製作故事分鏡與概念片的創作者。
  • 需要大量短鏡頭的行銷團隊。
  • 希望透過 API 建立影片服務的開發者。

哪些情況不適合只靠 H3?

  • 需要長時間、完整連續劇情。
  • 產品外觀必須百分之百精準。
  • 涉及新聞事實與真人事件重現。
  • 需要大量可讀文字與表格。
  • 涉及未取得同意的人臉或聲音。
  • 不能接受任何人物與動作變形。

這些內容可以把 H3 當成概念與素材生成工具,但仍要使用實拍、後製或人工審核完成。

今天最重要的判斷

MiniMax H3 最值得注意的,不只是能生成最高 2K 的影片。

它真正改變的是創作輸入方式:

  • 文字說明場景。
  • 圖片固定角色與商品。
  • 影片提供動作和鏡頭。
  • 音訊控制聲音與節奏。

這些內容可以在同一個模型中被理解,不必完全拆成四套互不相連的工具。

但工具整合得更多,也代表使用者必須更清楚地說明:

  • 每份素材負責什麼。
  • 哪些內容必須保留。
  • 哪些內容可以修改。
  • 哪些人物、聲音與素材具備使用權。

MiniMax H3 最實用的方式,不是一次生成整支完整影片,而是用清楚的角色、動作、鏡頭與聲音參考,先製作幾秒鐘可控制的有聲鏡頭,再透過剪輯組成真正可以發布的內容。

今天,和 AI 一起進步一點。

每天學會一個 AI 技巧。

每天節省一點時間。

每天提升一點能力。

SasaDaily,陪你一起成長。

推薦閱讀