製作一段 AI 短片,過去常常要經過好幾個工具。
你可能先用圖片模型建立角色,再把圖片放進影片工具,接著另外製作旁白、音效與背景音樂,最後才進剪輯軟體把全部內容對在一起。
每換一次工具,就可能出現:
- 角色外觀改變。
- 畫面動作和音效不同步。
- 鏡頭節奏不符合原本構想。
- 產品顏色或外型被重新生成。
- 需要反覆匯出與重新上傳素材。
MiniMax H3 想解決的,就是這段被切成很多工具的流程。
它可以把文字、圖片、影片與音訊當成同一組創作資料,直接理解角色、動作、鏡頭、聲音及節奏,再產生一段最高 2K、最長 15 秒的有聲影片。
MiniMax H3 是什麼?
MiniMax H3 是 MiniMax 在 2026 年 7 月 31 日推出的多模態影片生成模型。
它目前支援:
- 文字轉影片。
- 圖片轉影片。
- 指定第一幀與最後一幀。
- 使用圖片、影片與音訊作為參考。
- 依照指令修改既有影片。
官方提供的影片長度範圍約為 4 至 15 秒,最高可輸出 2K 解析度。
和只接受文字或單張圖片的影片工具相比,H3 更重要的差異是:
你可以把不同類型的參考素材放進同一次生成,讓模型理解它們彼此之間的關係。
你不只是在描述「要生成什麼畫面」,也可以同時告訴模型「角色長什麼樣、動作參考哪支影片、聲音使用什麼節奏,以及最後要停在哪一個畫面」。
一般使用者可以在哪裡使用?
一般創作者可以透過 Hailuo AI 的網頁介面選擇 MiniMax H3。
開發者則可以透過 MiniMax API,把模型接入:
- 影片製作平台。
- 電商內容系統。
- 廣告素材流程。
- 遊戲與角色內容工具。
- 社群短片自動化系統。
在網頁介面中,使用者可以依需求選擇:
- 從文字開始生成。
- 上傳第一張圖片讓它動起來。
- 同時指定開場與結尾畫面。
- 加入角色、動作、鏡頭或聲音參考。
第一次使用時,不需要立即準備很多素材。
先用一張清楚圖片與一段簡單動作指令測試,通常更容易看懂模型如何處理畫面。
第一個特色:可以直接生成有聲影片
MiniMax H3 可以在生成畫面的同時,產生原生立體聲音訊。
聲音可能包括:
- 環境聲。
- 腳步與物件聲音。
- 背景音樂。
- 人物說話。
- 和畫面動作相配的音效。
例如你可以要求:
一名陶藝師把剛完成的陶杯放到木桌上,窗外下著小雨。鏡頭慢慢靠近杯子的釉面,保留雨聲、陶器碰到桌面的輕微聲音,以及安靜的室內氣氛。不要人物說話。
模型可以同時處理:
- 人物動作。
- 鏡頭靠近。
- 雨聲。
- 陶器接觸桌面的聲音。
- 整體情緒。
這能減少先生成無聲畫面,再另外尋找音效的時間。
但生成聲音仍可能出現:
- 動作與聲音時間不完全一致。
- 背景音量過大。
- 人物嘴型與語音不同步。
- 不需要的音樂或對話。
如果你不需要人物說話,最好直接寫明:
No dialogue. No speaking. No lip movement. Use only environmental sound and natural object sounds.
第二個特色:文字、圖片、影片與音訊可以一起參考
一般圖片轉影片工具,通常只能看一張起始圖片,再依 Prompt 猜測後續動作。
MiniMax H3 則能同時接受多種參考內容。
例如商品廣告可以提供:
- 商品正面照片。
- 商品側面照片。
- 品牌希望參考的鏡頭運動影片。
- 背景音樂或節奏參考。
- 文字形式的場景與動作要求。
模型會嘗試把這些內容放進同一段影片。
這對需要維持特定外觀的內容特別有幫助,例如:
- 商品。
- 角色。
- 服裝。
- 場景風格。
- 攝影節奏。
但參考素材愈多,不代表結果一定愈準。
如果圖片、影片與文字互相衝突,模型可能不知道該優先遵循哪一項。
例如:
- 圖片中的人物穿黑色衣服,Prompt 卻要求白色衣服。
- 參考影片是快速手持鏡頭,文字卻要求穩定慢鏡頭。
- 音樂節奏很快,畫面要求卻是安靜緩慢。
比較好的做法,是讓每一份素材只負責一件事。
圖片負責角色與商品外觀,影片負責動作或鏡頭,音訊負責聲音節奏,文字負責完整場景與限制。
第三個特色:可以指定第一幀與最後一幀
有些 AI 影片開頭很好看,最後卻不知道停在哪裡。
MiniMax H3 支援第一幀與最後一幀控制。
你可以提供:
- 影片開始時的畫面。
- 影片結束時希望到達的畫面。
- 兩者之間應該發生的動作。
例如:
- 第一幀是一個尚未拆封的商品盒。
- 最後一幀是商品完整陳列在桌面上。
- 中間要求雙手拆封、取出商品並轉向鏡頭。
這種方式適合:
- 商品開箱。
- 前後對照。
- 空間轉換。
- 服裝變化。
- 故事轉折。
但兩張圖片差異過大時,仍可能出現不自然的變形。
例如人物姿勢、鏡位、場景與光線全部不同,模型就需要在幾秒內完成太多轉換。
最好讓首尾畫面至少保留:
- 相同人物或商品。
- 接近的鏡頭角度。
- 可理解的空間關係。
- 合理的動作路徑。
第四個特色:可以參考既有影片的動作與鏡頭
你可以提供一段參考影片,請 H3 學習其中的:
- 人物動作。
- 鏡頭移動。
- 剪輯節奏。
- 表演速度。
- 場景轉換方式。
例如,一家服飾品牌有一段模特兒旋轉展示外套的參考影片。
品牌可以提供新的服裝圖片,再要求模型參考原影片的:
- 轉身速度。
- 鏡頭跟拍。
- 衣服擺動。
- 最後停下的姿勢。
這比只寫「模特兒自然轉身」更容易傳達具體動作。
但使用參考影片時,要注意:
- 素材是否由自己拍攝。
- 是否有權使用人物肖像。
- 是否包含受保護的角色或品牌。
- 是否正在模仿特定創作者的完整作品。
能夠上傳,不代表一定擁有重製與商業使用的權利。
第五個特色:可以修改既有影片
MiniMax H3 不只從零生成,也能依照指令修改已有影片。
可能的修改包括:
- 替換人物服裝。
- 改變背景場景。
- 移除或增加物件。
- 調整天氣與光線。
- 改變視覺風格。
- 加入新的音效與氣氛。
例如一段商品展示影片原本拍攝於一般房間,可以要求:
保留商品、手部動作、鏡頭位置和原本時間長度,把背景改成乾淨的木工工作室,使用上午自然光,不增加人物,不改變商品顏色、尺寸、材質與表面紋理。
這類指令的重點是先寫出:
- 哪些內容必須保留。
- 哪些內容可以改變。
- 哪些內容絕對不能產生變化。
如果只寫「幫我變得更專業」,模型可能連商品本身都重新設計。
第一個實用場景:把商品照片變成社群短片
小型品牌不一定有預算每一項商品都重新拍影片。
可以先準備:
- 商品正面照片。
- 側面與細節照片。
- 實際使用情境。
- 不可改變的產品特徵。
再要求 H3 生成:
- 商品緩慢旋轉。
- 鏡頭靠近材質細節。
- 手部實際使用。
- 環境音與輕微物件聲。
可以使用:
使用參考圖片中的商品外觀、顏色、比例、材質與細節。生成一段 9:16 的八秒商品展示短片。第一段為桌面中景,手把商品放入畫面;第二段鏡頭緩慢靠近表面細節;最後停在完整商品正面。不得改變 Logo、按鈕位置、包裝文字、顏色和產品尺寸。不要人物說話,只保留自然環境音與輕微操作聲。
生成後仍要對照真實商品檢查:
- 顏色。
- 尺寸比例。
- 按鈕與接口。
- 材質。
- 包裝內容。
AI 影片不能把不存在的功能或配件呈現成真實商品。
第二個實用場景:讓文章封面變成短影音開場
內容創作者可以把文章封面或分鏡圖片上傳,製作短影音中的動態開場。
例如一篇文章討論 AI 資料中心,可以要求:
- 機房燈光逐步亮起。
- 工程人員進入畫面檢查設備。
- 鏡頭從光纖模組移到伺服器機架。
- 保留空白區域放置繁體中文字幕。
這比讓模型直接生成整支四十秒影片更容易控制。
比較穩定的方式是:
- 每張圖生成五至八秒。
- 每一段只安排一項主要動作。
- 字幕仍在剪輯工具中加入。
- 最後把多段短片組合成完整內容。
AI 影片目前更適合生成可控制的短鏡頭,而不是一次承擔整支影片的角色、故事、字幕與節奏。
第三個實用場景:建立同一角色的多個故事鏡頭
如果要製作連續故事,可以把角色參考圖固定使用在不同片段中。
每一段都重複說明:
- 角色外觀。
- 服裝。
- 年齡與髮型。
- 場景時間。
- 不可改變的特徵。
例如:
- 第一段:角色走進早餐店。
- 第二段:角色查看混亂的訂單。
- 第三段:角色重新整理工作流程。
- 第四段:店內出餐恢復順暢。
不要在同一個十五秒片段裡塞入四個完整場景。
分開生成,再用相同參考素材維持角色一致,通常比較容易修改。
第四個實用場景:修改已經拍好的素材
有時不是缺少影片,而是原影片有一項不理想。
例如:
- 背景太雜亂。
- 光線不符合品牌。
- 桌面出現不需要的物品。
- 產品展示環境不夠完整。
H3 可以嘗試修改場景,同時保留原本的人物動作與鏡頭。
但涉及商品、教學或新聞內容時,應避免修改到會改變事實的部分。
例如:
- 不能把普通材料改成高級材質。
- 不能增加產品不存在的功能。
- 不能把測試情境改成實際成功案例。
- 不能讓新聞人物看起來做過沒有發生的事情。
怎麼寫比較適合 H3 的 Prompt?
可以分成六個部分:
- 主體:人物、商品或場景。
- 動作:這幾秒內實際發生什麼。
- 鏡頭:遠近、角度與移動方式。
- 聲音:環境音、音效、音樂或對話。
- 結尾:最後停在哪個畫面。
- 限制:哪些內容不能改變或出現。
例如:
一名亞洲麵包師在清晨的獨立烘焙坊,把剛出爐的麵包放上冷卻架。中景側面鏡頭,鏡頭先保持穩定,再緩慢靠近麵包表面的蒸氣與紋理。保留烤盤輕響、紙張摩擦與安靜店內環境聲。最後停在麵包師檢查成品的畫面。不要對話、不要嘴部動作、不要改變人物服裝、不要出現可讀文字、Logo 或額外人物。
如果有參考圖片,可以再補充:
人物外觀、服裝、工作檯、麵包形狀與空間配置,以參考圖片為準。影片參考只用於鏡頭移動,不改變角色與場景。
哪些指令容易讓結果失敗?
一次安排太多動作。
例如十五秒內要求角色進門、換衣服、拿商品、跑到戶外、駕車離開並進入另一棟建築。
參考素材互相矛盾。
圖片、影片與文字要求不同人物、服裝或鏡頭。
使用抽象形容詞代替動作。
例如只寫「做出一段很有力量、很感人的影片」,卻沒有描述畫面會發生什麼。
沒有說明必須保留的內容。
模型可能重新設計商品、人物或場景。
讓模型直接生成大量文字。
AI 影片裡的文字仍可能出現錯字、變形與閃爍。
正式標題與字幕最好在剪輯階段加入。
它能完全解決人物一致性嗎?
不能保證。
使用多張角色參考、固定服裝與清楚鏡頭,通常能提高一致性。
但仍可能出現:
- 臉部細節變化。
- 手指與肢體異常。
- 衣服顏色或配件改變。
- 不同鏡頭中的身形差異。
- 多人物互動時位置混亂。
正式製作時,可以:
- 每段只安排一至兩個人物。
- 避免過快、過複雜的肢體動作。
- 縮短每個鏡頭。
- 使用清楚而一致的參考圖。
- 生成多個版本後再挑選。
原生有聲就不需要剪輯了嗎?
仍然需要。
原生聲音可以減少找素材的時間,但正式發布前仍要檢查:
- 畫面和音效是否同步。
- 是否出現不需要的對話。
- 聲音是否忽然中斷。
- 背景音樂是否蓋過重點。
- 是否需要繁體中文字幕。
- 多個片段之間的音量是否一致。
H3 可以生成鏡頭,剪映、CapCut、Premiere 或其他剪輯工具仍負責:
- 鏡頭排列。
- 字幕。
- 音量。
- 轉場。
- 品牌片尾。
能用它模仿別人的聲音嗎?
技術上可以使用音訊作為參考,但不代表可以任意複製別人的聲音。
使用聲音前應確認:
- 本人是否同意。
- 是否具有商業使用權。
- 是否會讓觀眾誤以為真人說過這些內容。
- 平台是否要求標示 AI 生成。
不要用未經同意的名人、客戶、員工或家人聲音製作內容。
涉及廣告、新聞、政治或正式背書時,聲音與人物身分更需要清楚揭露。
免費使用就代表可以商用嗎?
不代表。
能否商用需要同時確認:
- 目前帳號方案。
- MiniMax 與 Hailuo AI 的最新服務條款。
- 上傳素材的權利。
- 生成內容中的人物與品牌。
- 音樂、聲音及參考影片的授權。
產品方案、點數與商業使用規則可能更新。
正式替客戶製作或用於廣告前,應重新查看當時的條款,而不是只依照別人的舊教學。
第一次測試可以怎麼做?
先不要做完整故事。
挑一張清楚、沒有敏感內容的圖片,完成一個單純動作。
例如:
- 手把商品放到桌面。
- 人物從畫面右側走到中央。
- 鏡頭緩慢靠近一項完成成果。
- 燈光從昏暗逐漸變亮。
接著檢查:
- 主體是否保持一致。
- 動作是否自然。
- 鏡頭是否遵循指令。
- 聲音是否符合場景。
- 最後一幀是否可以接下一個鏡頭。
第一段成功後,再加入第二份參考素材。
不要一開始就同時加入九張圖片、多段影片與聲音,否則很難判斷哪項素材造成結果偏離。
可以直接使用這段商品影片 Prompt
使用參考圖片中的真實商品作為唯一產品主體,完整保留它的顏色、比例、材質、表面細節、按鈕、接口與包裝結構。生成一段八秒、9:16 的寫實商品短片。開場為商品放在工作檯上的中景,兩隻手自然拿起商品並轉向鏡頭;鏡頭接著緩慢靠近一項關鍵材質細節;最後把商品放回原位並停在完整正面。只生成自然操作聲與安靜環境音,不要人物說話,不要嘴部動作,不要增加不存在的配件、功能、文字或 Logo,不得改變商品外觀。
MiniMax H3 適合哪些人?
- 需要製作 Shorts、Reels 與 TikTok 的內容創作者。
- 希望把商品照片變成影片的小型品牌。
- 製作故事分鏡與概念片的創作者。
- 需要大量短鏡頭的行銷團隊。
- 希望透過 API 建立影片服務的開發者。
哪些情況不適合只靠 H3?
- 需要長時間、完整連續劇情。
- 產品外觀必須百分之百精準。
- 涉及新聞事實與真人事件重現。
- 需要大量可讀文字與表格。
- 涉及未取得同意的人臉或聲音。
- 不能接受任何人物與動作變形。
這些內容可以把 H3 當成概念與素材生成工具,但仍要使用實拍、後製或人工審核完成。
今天最重要的判斷
MiniMax H3 最值得注意的,不只是能生成最高 2K 的影片。
它真正改變的是創作輸入方式:
- 文字說明場景。
- 圖片固定角色與商品。
- 影片提供動作和鏡頭。
- 音訊控制聲音與節奏。
這些內容可以在同一個模型中被理解,不必完全拆成四套互不相連的工具。
但工具整合得更多,也代表使用者必須更清楚地說明:
- 每份素材負責什麼。
- 哪些內容必須保留。
- 哪些內容可以修改。
- 哪些人物、聲音與素材具備使用權。
MiniMax H3 最實用的方式,不是一次生成整支完整影片,而是用清楚的角色、動作、鏡頭與聲音參考,先製作幾秒鐘可控制的有聲鏡頭,再透過剪輯組成真正可以發布的內容。
今天,和 AI 一起進步一點。
每天學會一個 AI 技巧。
每天節省一點時間。
每天提升一點能力。
SasaDaily,陪你一起成長。