今晚最值得關注的 AI 消息,不是又有哪一家公司推出更大的模型,而是先進模型的能力正在透過另一種方式跨越國界。
Reuters 檢視超過 80 篇中國學術論文與專利後發現,部分與中國軍方及國防機構有關的研究者,曾使用 OpenAI、Anthropic 等美國 AI 模型產生的輸出,訓練可由自己控制的小型專用模型。
這種方法稱為「模型蒸餾」。
它原本是 AI 產業常見的技術,可以讓較小、較便宜的模型,學習大型模型在特定任務上的部分能力。
真正引發爭議的,不是模型蒸餾本身,而是當一家公司花費巨額資金建立的能力,能否在未經同意的情況下被大量提取、轉移到另一個模型,甚至用於軍事與安全系統。
什麼是模型蒸餾?
大型前沿模型需要大量資料、先進晶片、資料中心與資金才能訓練。
模型蒸餾則是讓一個大型「教師模型」,協助訓練較小的「學生模型」。
教師模型可以產生:
- 問題與答案。
- 程式碼。
- 分類結果。
- 範例資料。
- 解決問題的方法與步驟。
這些輸出再被當成訓練資料,讓小模型學會特定任務。
小模型並不是完整複製教師模型。
它通常不會直接取得原始模型的參數、架構與全部能力,而是學習被挑選出來的行為。
模型蒸餾就像讓一位能力很強的老師,準備大量示範題,再用這些示範訓練一位只負責特定工作的學生。
為什麼需要把模型變小?
最強大的 AI 模型通常需要大型雲端資料中心才能運作。
但許多實際場景沒有穩定網路,也沒有足夠的運算能力。
較小的蒸餾模型可以部署在:
- 手機與個人裝置。
- 工廠設備。
- 汽車與無人載具。
- 企業內部伺服器。
- 無法連接外部網路的封閉系統。
- 需要即時反應的邊緣設備。
它們通常速度較快、成本較低,也比較容易針對單一工作進行調整。
因此,模型蒸餾本身具有許多合理用途。
這次調查發現了什麼?
Reuters 表示,檢視的文件顯示,與中國人民解放軍及其他軍事機構相關的研究者,廣泛研究如何把外部大型模型的能力轉移到本土系統。
應用方向包括:
- 軍事程式碼分析。
- 社群內容監控。
- 無人機影像處理。
- 目標辨識。
- 戰術決策支援。
- 無法連線時仍能運作的本地 AI。
這些案例並不代表所有中國 AI 研究都依賴美國模型。
但它們顯示,外國模型可以被當成一種技術捷徑,協助建立不必持續連接原始服務的專用系統。
第一個案例:用 GPT-3.5 處理軍事程式碼
Reuters 引述一篇由中國人民解放軍相關單位研究者發表的論文。
研究者面臨的問題是,敏感軍事程式碼不適合直接長期交給外部模型處理。
他們採取的方法是:
- 使用 GPT-3.5 協助摘要與處理程式碼。
- 把產生的內容整理成訓練資料。
- 訓練一個中國本土模型。
- 讓新模型在軍方自己的封閉網路中運作。
這個流程的意義是,外部模型不必進入正式軍事系統,它產生的部分能力仍可能被轉移進去。
即使敏感資料沒有永久留在外國平台,外國模型提供的分析方法與能力,仍可能成為本地模型的訓練材料。
第二個案例:使用 Claude 產生監控模型訓練資料
另一項研究使用 Anthropic 的 Claude 3 Haiku,產生文字分類所需的合成訓練資料。
研究目標涉及社群媒體監控與內容分類。
合成資料的優點是,不必完全依靠人工逐筆標示大量文字。
大型模型可以先產生或整理範例,再由小模型學習分類。
Anthropic 表示,公司不向中國或由北京控制的企業提供 Claude 商業服務,並會利用監測系統尋找違反使用政策的行為。
但研究者仍可能透過第三方管道、境外帳號或已取得的輸出進行後續訓練。
第三個案例:讓小模型進入無人機
大型模型通常無法直接放進一台小型無人機中。
它需要的記憶體、電力與運算能力太高。
但經過壓縮或蒸餾的小模型,可以在較有限的硬體上執行影像分析。
Reuters 引述的研究案例包括:
- 分析無人機即時影像。
- 協助導航。
- 在通訊中斷時繼續運作。
- 支援目標判斷。
另有研究把目標辨識模型部署到戰術硬體,模擬無人機、船艦及無人潛航器共同執行海上任務。
這顯示模型蒸餾不只是降低雲端帳單,也能把 AI 帶進對反應速度、連線與設備體積要求很高的軍事場景。
為什麼「推理步驟」特別重要?
早期的模型蒸餾,可能只讓學生模型學習最後答案。
現在的研究則更重視大型模型如何拆解與處理問題。
例如,不只是告訴小模型:
答案是第三個選項。
而是示範:
- 先看哪些資訊。
- 如何排除不合理選項。
- 如何比較不同證據。
- 最後如何得到結論。
這類解題示範能讓小模型在相似問題上表現得更好。
也因此,大型模型花費巨額資金訓練出的推理能力,逐漸被視為需要保護的核心資產。
模型蒸餾是違法的嗎?
不能一概而論。
模型蒸餾是業界廣泛使用的技術。
AI 公司也會使用自己的大型模型,訓練較小、較便宜的產品。
真正的爭議通常在於:
- 是否取得模型提供者同意。
- 是否違反服務條款。
- 是否透過大量帳號規避使用限制。
- 是否提取受到保護的商業能力。
- 是否用於被禁止的軍事或監控用途。
- 是否涉及智慧財產或不公平競爭。
因此,問題不是「所有蒸餾都不可以」,而是什麼情況屬於正常技術使用,什麼情況變成未經授權的能力提取。
為什麼美國特別擔心中國使用模型蒸餾?
美國長期使用晶片出口管制,限制中國取得最先進的 AI 處理器。
政策邏輯是,缺少高階晶片,就更難從頭訓練最大的前沿模型。
但模型蒸餾提供另一條路:
- 不必完整重建大型模型。
- 先向外部模型大量取得範例。
- 只學習特定任務所需能力。
- 把結果部署到較便宜的硬體。
這不會讓小模型瞬間成為完整前沿模型,但可能縮短特定用途的開發時間。
晶片管制限制的是訓練大型模型的能力;模型蒸餾爭議處理的,則是已經訓練完成的能力能否被另一方快速學走。
模型蒸餾可以完全取代先進晶片嗎?
不可以。
蒸餾能降低小型專用模型的開發與部署成本,但它仍有明顯限制。
- 學生模型通常只學到部分能力。
- 複雜問題的表現可能明顯下降。
- 無法直接取得教師模型的全部知識。
- 教師模型不會提供訓練時未具備的能力。
- 建立真正前沿模型仍需大量晶片、資料與研究。
因此,模型蒸餾是捷徑,但不是從零建立最強 AI 的完整替代方案。
安全限制也會一起被轉移嗎?
不一定。
大型商業模型通常包含:
- 內容安全政策。
- 敏感任務限制。
- 使用者身分與風險監測。
- 阻止部分危險輸出的機制。
- 違規帳號停用措施。
學生模型可能只學習任務能力,沒有完整複製這些安全機制。
模型被下載或部署到封閉系統後,原始公司也很難繼續監測用途。
Anthropic 提醒,蒸餾後的模型可能失去原有安全限制,使敏感能力進入原公司無法控制的系統。
模型公司可以怎麼防止能力被大量提取?
可能採取的方式包括:
- 偵測大量重複或系統化查詢。
- 限制帳號與 API 使用速度。
- 辨識多帳號協同提取行為。
- 針對敏感任務限制完整推理輸出。
- 追蹤異常的地域與付款模式。
- 對特定高風險功能要求額外驗證。
但防護並不容易。
正常企業也可能需要大量查詢來建立客服、分類或資料處理系統。
如果限制過度嚴格,可能同時阻礙合法開發者。
不顯示完整推理過程能解決問題嗎?
可能降低部分能力提取風險,但不是完整答案。
即使模型只提供最終結果,研究者仍能透過大量範例訓練較小模型。
而且在教育、研究、程式除錯及高風險決策中,使用者也需要知道模型使用了哪些證據與方法。
模型公司必須在幾個目標之間取得平衡:
- 讓回答可以被人檢查。
- 避免洩露內部敏感資訊。
- 降低系統化能力提取。
- 保留正常開發者的使用價值。
這會不會讓所有開放模型都變得危險?
不能這樣簡化。
開放模型可以帶來:
- 讓研究者檢查安全問題。
- 讓中小企業自行部署。
- 降低對少數雲端公司的依賴。
- 支援低資源語言與專業用途。
- 讓更多國家建立自己的 AI 能力。
但模型一旦開放,也可能:
- 移除原有安全限制。
- 被改造成高風險用途。
- 進入原開發者無法監督的系統。
- 更容易被軍事與監控機構採用。
真正需要討論的是風險分級、使用責任與高能力模型的管理方式,而不是把所有開放或封閉模型都視為絕對安全。
這和即將進行的美中 AI 對話有什麼關係?
美國與中國預計討論 AI 安全、治理及高風險用途。
模型蒸餾可能成為其中一項爭議。
雙方可能討論:
- 如何定義未經授權的模型能力提取。
- 軍事機構能否使用外國商業模型。
- 模型公司應提供哪些使用紀錄。
- 如何處理跨境帳號與第三方服務。
- 哪些 AI 軍事用途需要共同限制。
但雙方立場存在明顯差距。
美國擔心中國利用美國模型繞過科技限制;中國則批評美國以安全為理由維持技術優勢。
因此,對話未必能立即產生共同規則。
這對一般企業有什麼影響?
模型蒸餾不只發生在國家與軍事競爭。
企業也可能用大型模型產生訓練資料,建立自己的小型專用 AI。
例如:
- 客服分類模型。
- 文件審查模型。
- 商品辨識模型。
- 工廠設備異常偵測。
- 只能在公司內網運行的助手。
正式使用前要確認:
- 模型服務條款是否允許。
- 訓練資料中是否包含客戶個資。
- 教師模型產生的錯誤是否被學生模型學習。
- 新模型是否保留必要安全限制。
- 誰負責測試與後續維護。
把模型變小,不代表風險也會跟著變小。
蒸餾後的模型會不會學到錯誤?
會。
學生模型可能同時學到:
- 教師模型的正確做法。
- 教師模型的偏見。
- 錯誤答案。
- 過度自信的表達方式。
- 資料中原本存在的問題。
如果訓練資料全部由同一個教師模型產生,錯誤可能被大量複製。
因此,蒸餾流程仍需要:
- 真實資料驗證。
- 人工標註樣本。
- 獨立測試資料。
- 高風險案例測試。
- 安全與偏見評估。
為什麼這件事不只是智慧財產問題?
如果爭議只涉及商業競爭,焦點可能是服務條款、授權與損失。
但當轉移後的模型進入:
- 無人載具。
- 網路攻防。
- 監控系統。
- 目標辨識。
- 軍事決策支援。
問題就會同時涉及國家安全、出口管制及戰爭責任。
一個原本為一般商業服務設計的模型,可能間接成為另一個軍事系統的訓練來源。
未來可能出現哪些新規則?
各國可能考慮:
- 要求模型公司保留高風險使用紀錄。
- 限制特定軍事與情報機構使用商業模型。
- 把大規模未授權蒸餾納入出口或科技管制。
- 要求蒸餾模型重新進行安全評估。
- 建立跨國通報與停用機制。
- 區分一般模型壓縮與系統化能力提取。
但規則若定義過於寬泛,可能影響正常研究與新創公司。
政策必須清楚區分技術本身、取得方式和實際用途。
今晚最重要的判斷
這次調查揭露的真正問題,不是中國研究者發現了一項全新的秘密技術。
模型蒸餾早已是 AI 產業普遍使用的方法。
真正改變的是它所處的環境:
- 前沿模型的能力愈來愈接近戰略資產。
- 晶片出口管制讓取得能力的替代方法更重要。
- 大型模型開始參與軍事、監控與資安工作。
- 模型輸出本身也可能成為需要保護的技術來源。
美國可以限制高階晶片出口,模型公司也可以封鎖特定地區帳號。
但只要模型能在網路上回答問題,它的部分能力就可能被觀察、整理並重新訓練到另一個系統中。
AI 時代的技術管制,已經不能只追蹤晶片運到哪裡,還要面對模型的知識、解題方式與能力,如何透過輸出跨越公司、平台與國界。
今天,和 AI 一起進步一點。
每天學會一個 AI 技巧。
每天節省一點時間。
每天提升一點能力。
SasaDaily,陪你一起成長。