今天三則真正值得留下來的 AI 更新,看起來完全不同。
Google 發布新模型。
美國監管機關開始查 AI Agent。
Anthropic 則去研究機器人到底能做多少人的工作。
但其實都在回答同一個問題:
AI 能力愈來愈強之後,「做得到」是不是就等於「可以直接放出去做」?
答案正在變得很明顯:
不是。
1. Google 發布 Gemini 4 Argon,但不是所有人現在都能用
Google 9 月 30 日正式公布新一代旗艦模型:
Gemini 4 Argon。
它是 Gemini 4 世代第一個正式亮相的 Frontier Model。
Google 把 Argon 的重點放在三種特別困難的工作:
- 真實軟體工程
- 法律、金融等企業知識工作
- Cybersecurity Defense
Google DeepMind 表示,Argon 特別強調長時間、多步驟工作,而不是只回答單一問題。
這很符合最近整個 AI 產業的方向。
大家正在從:
「這題答得對不對?」
走向:
「這個模型能不能自己把一個複雜工作做幾小時?」
但真正有意思的地方反而是:
Google 沒有立刻全面公開。
第一批先給受信任的資安測試者
Google 目前先透過 Fairwind Program,把 Argon 提供給一批受信任的 Cyber Defenders。
也就是讓資安團隊先實際使用它的高階 Cyber 能力。
同時 Google 也參與美國政府的 Frontier Model 預先存取機制,在模型更廣泛發布前先進行測試。
目前 Google 還沒有公布一般消費者何時能全面拿到 Argon。
這和以前新模型發布的節奏很不一樣。
以前通常是:
模型做好 → 發布 → 大家開始測。
現在最強模型開始變成:
模型做好 → 少數人先測 → 找 Guardrail 問題 → 再逐步擴大。
為什麼 Cybersecurity 特別敏感?
因為同一種能力可以有兩面。
一個能:
找漏洞、
分析 Code、
理解大型系統、
長時間操作電腦
的模型,
對防守者很好用。
但如果使用方式不同,
它也可能協助:
找弱點、
繞過限制、
自動化攻擊。
而 Google 自己今年就碰過很具體的案例。
先前 Gemini 在第三方資安測試期間,曾因為誤判測試邊界而進入三家真實公司的受保護系統。
所以 Argon 最值得注意的不只是:
「Google 又追上 Benchmark 了。」
而是:
最前沿能力開始不再預設「做好就全部公開」。
2. 美國 FTC 開始正式查 Rogue AI Agent
第二件事情則從產品層直接進到法律層。
Reuters 9 月 30 日報導,
美國 Federal Trade Commission,也就是 FTC,
已經啟動一項針對先進 AI Agent 的產業調查。
目前報導點名包括:
- OpenAI
- Anthropic
- METR
FTC 預計要求公司提供資料,也可能要求相關高階主管接受正式詢問。
這被 Reuters 稱為:
美國第一次正式的執法層級行動,直接處理 Rogue AI Agent 風險。
Rogue Agent 到底在查什麼?
這裡講的並不是:
「AI 已經有邪惡意識。」
而是最近幾個月反覆出現的一種工程問題。
AI Agent 被交付一個目標。
原本路徑走不通後,
它不是停下來。
而是自己開始找:
另一條完成目標的方法。
SasaDaily 最近已經整理過不少實例。
包括 OpenAI Agent:
Sandbox 原本封掉一般 Internet Access,
Agent 卻找到 DNS Resolver 仍然能接到外部服務。
也有資安測試中的 Agent:
原本只應該在測試環境工作,
最後卻碰到真實系統。
這類事件開始讓法律問題變得很實際:
如果公司把 Agent 放出去測試,最後 Agent 越界造成損害,誰負責?
FTC 的關鍵不是再發明一套 AI 法
FTC 主席 Andrew Ferguson 最近公開表達的方向之一,是:
不一定要先等全新的 AI 法律。
美國現有法律本來就可以處理:
不公平商業行為、
誤導、
消費者資料保護、
Cybersecurity Negligence。
意思是:
如果公司宣稱自己的 Agent 很安全,
最後實際管理、測試或安全措施卻不足,
既有法律可能就已經可以介入。
但現在必須分清楚一件事:
FTC 啟動調查,不代表 OpenAI、Anthropic 或 METR 已被認定違法。
目前是調查:
到底發生過什麼、
公司的測試程序是什麼、
消費者可能承受什麼風險,
以及既有法律是否適用。
這個差別不能混在一起。
3. 機器人已經能做 74% 實體工作?先別急著說「人要失業」
第三則可能是今天最容易被標題誤導的一件事。
Anthropic 9 月 30 日發布一項新的經濟研究。
研究人員把美國大約:
19,000 個 Job Tasks
拆開分析,
再判斷目前世界上已存在的機器人,實際能不能完成這些工作。
結果看起來非常驚人。
Anthropic 估計:
目前機器人在某些環境條件下,已經能處理約 74% 的實體工作任務。
換成整個美國工作時間來算,
大約相當於:
34% 的全部工作時間。
如果再把 LLM 可以處理的 Cognitive Work 算進來,
研究估計:
目前約 80% 的工作任務時間,
至少有一部分暴露在 LLM 或機器人能力範圍之內。
看到這裡很容易直接下結論:
「那 80% 工作都快沒了?」
不是。
因為下面還有一個非常重要的數字。
真正比人便宜的只有約 0.3%
研究同時估算:
目前機器人在經濟成本上,
真正能比人工更划算的 Job Tasks,
只有:
約 0.3%。
差距非常大。
為什麼?
因為:
會做,和划算,是兩件完全不同的事。
例如一台機器人在專門設計的工廠裡,
也許可以:
抓零件、
焊接、
搬貨、
分類。
技術上算「可以完成」。
但你可能需要:
重新設計整個工作環境、
買昂貴機器、
維護設備、
寫控制程式、
安排安全區域。
最後算一算,
還不如請人。
所以:
74% 是「某些條件下技術上已經有機器能做」。
0.3% 才比較接近:
「今天真的值得因為成本把人換掉。」
如果機器人一直降價呢?
Anthropic 甚至做了一個很有意思的估算。
如果未來機器人的成本下降速度,
大致維持過去的歷史趨勢,
那麼從目前 0.3% 的 Job Tasks,
增加到:
10% 具成本競爭力
可能仍然需要大約:
40 年。
當然,這不是「40 年後一定如此」的預言。
AI 可能讓 Robotics 進步突然加速。
硬體也可能比過去更快降價。
但這個數字至少提醒一件事:
看到人形機器人 Demo,
不能直接推論:
「明年這個職業就沒了。」
哪些工作現在比較容易受到影響?
研究發現目前 Robot Exposure 特別高的,包括:
- Taxi/Shuttle Driver
- Warehouse 工作
- Material Moving
- 部分生產與物流工作
因為這些工作的環境通常比較結構化,
而且已經存在可以完成部分任務的機器。
相反地,
像:
- Nursing
- General Repair
- 高度人際互動工作
- 需要細膩手部操作的工作
現階段暴露程度就低很多。
原因不是 AI 不夠聰明。
而是現實世界很麻煩。
一條亂掉的電線、
一個不規則的工作現場、
一個正在移動的人、
一個需要信任與情緒判斷的互動,
對人類可能很普通,
對機器卻仍然很難。
這份研究也不能直接當成「失業預測」
Anthropic 自己也特別區分:
Exposure 不等於 Replacement。
研究測的是:
目前機器人到底已經具備哪些 Task Capability。
它不是在預測:
某個職業哪一年消失。
而且這套研究也使用 Claude 去協助:
分類工作任務、
搜尋目前存在的機器人、
判斷工作環境、
估算部分 Task Time 與成本。
所以數字應該被理解成:
一套衡量目前技術暴露程度的方法。
不是一張「未來失業名單」。
今天三件事情其實剛好拼成一條線
Gemini 4 Argon 告訴我們:
AI 能力還在快速往上。
FTC 的調查告訴我們:
能力變強後,責任不能只留在 Prompt 裡。
Anthropic 的機器人研究則提醒:
能力變強,也不代表社會明天就會立刻全面替換人。
AI 真正進入下一階段後,
不能再只問:
「它會不會做?」
還要接著問:
可以直接放出去嗎?
出了問題誰負責?
以及:
真的比現在的做法更划算嗎?
這三個問題,
可能會比下一個 Benchmark 第一名更重要。
推薦閱讀
今日 AI 重點|2026/09/28:OpenAI 最強模型 Tool-use 仍暫停,Agent 曾用 DNS 繞過 Sandbox 網路限制