今天三則 AI 新聞,
表面上完全不一樣。
第一則:
AI 開始真正「看得懂圖片」。
第二則:
跑 AI 的伺服器可能變貴。
第三則:
人形機器人已經可以把 100 公尺跑進 10 秒。
但把三件事情放在一起,
其實都在說:
AI 正在離開單純聊天的世界。
以前我們最常比較的是:
哪個模型回答比較好?
現在競爭開始變成:
看不看得懂真實世界?
跑不跑得動?
以及:
整套東西到底付不付得起?
第一則:DeepSeek V4 Flash Vision 上線,低成本模型開始長出「眼睛」
DeepSeek 8 月 21 日推出一個新的實驗模型:
DeepSeek-V4-Flash-Vision-Exp。
最大的變化不是:
模型又多了一個版本。
而是原本以文字、推理與 Agent 工作為主的 V4 Flash,
現在正式加入:
圖片理解。
也就是說,
開發者可以同時把:
文字。
圖片。
文件畫面。
網站截圖。
圖表。
介面狀態
交給模型分析。
DeepSeek 將它定位為實驗性模型,並表示純文字能力與正式版 V4 Flash 大致維持同一層級;真正新增的,是處理視覺資訊的能力。
為什麼這件事比「可以看圖片」更重要?
因為 Agent 真正進入工作以後,
世界並不是:
全部都有 API。
很多工作其實長這樣:
先看一張 PDF。
確認表格裡寫了什麼。
再看網站畫面。
找到某個欄位。
接著判斷:
下一步該點哪裡。
所以如果 AI 只能理解:
文字 Prompt,
它其實少了一雙:
眼睛。
例如最簡單的工作
假設一間小公司收到供應商提供的產品型錄。
裡面有:
產品照片。
尺寸表。
圖示。
規格。
包裝資訊。
以前如果模型只能吃文字,
你可能還得先:
OCR。
整理。
把資料另外轉成文字。
現在視覺模型的方向是:
直接把:
原始畫面
交給 AI。
讓它先理解:
畫面上到底有什麼。
這也是為什麼「Vision」會和 Agent 綁得愈來愈緊
真正的 Computer Use,
通常需要一個循環:
看。
↓
判斷。
↓
操作。
↓
再看。
↓
再判斷。
如果 AI 不知道按完按鈕後,
畫面發生了什麼,
Agent 就很難真正持續工作。
所以多模態不是:
「聊天機器人多一個圖片功能。」
更大的意義是:
AI 開始取得操作真實數位環境所需要的感知能力。
DeepSeek 這次還加入 Files API
另一個很實際的更新是:
圖片可以先上傳,
再在不同請求裡重複引用。
這代表企業如果一直要分析同一批:
圖表。
產品圖片。
文件。
不一定每一次都重新傳完整資料。
這其實是很典型的:
從 Demo
走向:
Workflow。
因為真正企業應用最在乎的往往不是:
AI 能不能看一張圖。
而是:
能不能每天重複做幾千次。
不過「Vision 上線」不代表圖片裡的每一件事都會看對
這一點一定要保留。
模型能接受圖片,
只是代表:
多了一種輸入能力。
不代表:
OCR 永遠正確。
圖表數字永遠正確。
介面座標永遠正確。
小字一定讀得到。
所以未來真正使用多模態 Agent,
還是要問:
哪些工作看錯了可以追回?
哪些一旦看錯就不能直接執行?
這會比單純比較 Benchmark 更重要。
第二則:AI 軟體愈來愈便宜,Nvidia 伺服器卻據報準備漲逾 15%
這一則剛好和昨天早報形成非常有意思的對照。
昨天我們才看到:
OpenAI 把 GPT-5.6 Sol API 價格往下調。
今天另一端卻傳來:
AI 伺服器可能要變貴。
Reuters 8 月 22 日引述 Bloomberg News 報導,
Nvidia 據報已通知部分主要客戶,
搭載其 AI 晶片的新伺服器,
價格可能上調:
超過 15%。
主要原因之一是:
記憶體成本大幅上升。
受影響的系統據報包括搭載 Vera Rubin 與 Grace Blackwell 系列晶片的伺服器,部分調價可能反映在 2027 年初出貨的系統上。Nvidia 截至該報導發布時並未正式評論,因此目前仍應寫成「據報」,而不是 Nvidia 已正式公布統一漲價 15%。
為什麼不是 GPU 本身漲價,整台伺服器也會變貴?
因為一台 AI Server,
從來不是只有:
GPU。
還有大量:
HBM。
DRAM。
儲存。
CPU。
高速網路。
電源。
液冷。
機櫃。
主機板。
當其中一個重要元件出現:
供不應求,
整台系統成本就會跟著上去。
現在最值得看的其實是「記憶體」
AI 模型愈大,
推論量愈多,
對高速記憶體需求就愈高。
也就是說:
晶片公司可以設計更快的 GPU,
但如果資料來不及送進去,
GPU 仍然會:
等。
這和我們以前一直說的問題一樣:
AI 資料中心不是單顆晶片的比賽。
而是整套系統。
所以 AI 正出現一個很奇怪的價格方向
軟體端:
模型 API 價格一直降。
硬體端:
高階伺服器某些成本反而可能上升。
為什麼?
因為模型競爭者愈來愈多。
但能提供:
高階記憶體。
先進封裝。
晶片。
資料中心電力
的供應鏈,
短期沒有辦法像模型 API 一樣:
按一下按鈕就增加一倍。
這會影響誰?
最先有感的不一定是:
一般 ChatGPT 使用者。
而是:
雲端公司。
AI 新創。
大型企業。
資料中心。
因為如果一批 AI 伺服器原本預算:
1 億美元,
硬體成本多 15%,
就可能多:
1,500 萬美元。
規模愈大,
差距愈大。
這也意味著未來模型公司不能只靠降價搶市場
假設:
API 價格每年下降 30%。
很好。
可是背後:
伺服器。
記憶體。
電力。
融資
卻一直上升。
模型公司最後還是要回答:
這個價格戰能打多久?
真正的成本優勢,
最後一定會回到:
晶片效率。
記憶體效率。
模型壓縮。
資料中心利用率。
電力成本。
甚至:
供應鏈議價能力。
第三則:人形機器人正式百米跑出 9.39 秒,比人類世界紀錄還快
如果前兩則還發生在:
電腦與資料中心,
第三則已經直接跑到:
田徑場。
第二屆世界人形機器人運動會,
8 月 22 日在北京開幕。
在正式 100 公尺項目中,
一台人形機器人跑出:
9.39 秒。
這個時間比 Usain Bolt 保持的人類男子 100 公尺世界紀錄:
9.58 秒
還快。Reuters 與 AP 都報導了這次比賽結果。
還有一個更快的 9.32 秒,但要分清楚
在正式比賽開始前,
Honor 的人形機器人:
Lightning
曾在準備測試中跑出:
9.32 秒。
峰值速度據報達:
14.5 公尺/秒。
但是:
9.32 秒是:
準備測試。
而不是正式比賽冠軍成績。
正式比賽報導中的 100 公尺成績是:
9.39 秒。
這兩個數字不能混在一起。
但現在先不要急著說「機器人已經比人類強」
百米速度,
只代表一種能力:
跑得快。
真正要在人類環境工作,
還需要:
平衡。
抓取。
手部精細操作。
環境判斷。
遇到陌生狀況重新規劃。
長時間穩定工作。
安全停下。
這些全部比:
往前衝 100 公尺
複雜很多。
而這也是今年機器人運動會最值得看的改變
官方今年不只安排:
跑步。
跳躍。
競技。
還增加:
工廠。
飯店。
家庭。
零售。
消防
等真實場景任務。
部分比賽也要求機器人:
完全自主完成。
也就是說,
主辦方正在把問題從:
「這台機器人能不能表演?」
慢慢改成:
「它能不能在真實環境自己完成工作?」
這才是 Physical AI 真正的大考
如果只是:
固定場地。
固定路線。
固定動作。
機器人可以靠大量調校,
做到非常驚人的效果。
可是現實世界不是固定劇本。
例如一台飯店機器人,
今天電梯口突然有:
行李。
小孩。
其他客人。
清潔推車。
它就必須重新判斷。
所以真正的 Physical AI,
不是:
跑得快。
而是:
能感知、能決策、能行動,而且環境改變後仍然能繼續完成任務。
把今天三件事情放在一起
DeepSeek 告訴我們:
AI 開始:
看。
人形機器人告訴我們:
AI 開始:
動。
Nvidia 伺服器價格則提醒:
所有這些能力背後,
仍然要有人:
付錢。
這就是今天真正的共同趨勢
過去的大模型競爭,
很像:
比考試。
誰 Benchmark:
第一。
誰推理:
比較強。
誰 Coding:
比較好。
現在競爭開始變成:
第一層:感知
能不能看懂:
圖片。
畫面。
文件。
環境。
第二層:行動
能不能:
點。
操作。
走。
跑。
抓。
完成任務。
第三層:成本
這些能力如果每天使用:
100 萬次,
到底花多少錢?
AI 會愈來愈像一個「完整系統」
未來我們談一個 AI,
可能不再只是:
「它是哪個模型?」
而是:
模型。
Vision。
Agent。
Tools。
Memory。
Robot。
GPU。
Memory Chips。
Network。
Data Center。
Electricity。
全部連在一起。
這也是為什麼:
單純 Benchmark 第一
最後不一定代表:
商業上第一。
對一般使用者來說,最直接的改變是什麼?
就是 AI 的入口會愈來愈少依賴:
打字。
你可以直接:
拍照片。
傳文件。
讓它看螢幕。
讓它聽聲音。
甚至讓它控制:
真正的機器。
也就是:
人類不必先把世界全部翻成文字,
AI 才能理解。
但風險也會一起變大
AI 如果:
文字答錯,
通常還有機會:
不採用。
AI 如果:
看錯畫面,
又立即:
操作。
問題就完全不同。
如果操作的只是:
測試 App,
可能重來。
如果操作的是:
工廠機械。
車輛。
付款。
醫療設備。
真正 Physical AI,
安全邊界就會比聊天機器人:
嚴格很多。
所以接下來真正重要的問題,不是「AI 會不會有眼睛和手」
答案其實已經非常明顯:
會。
真正的問題是:
眼睛看錯的時候,手會不會跟著做錯?
以及:
我們有沒有在它行動以前留下確認點?
這也會是未來 AI Agent 和機器人真正走進日常工作的核心問題。
今天早上的一句判斷
2026 年的 AI,
已經不再只是:
誰最會聊天。
而開始變成:
誰看得懂世界。
誰能在世界裡行動。
以及:
誰能把這一切做到足夠便宜。
DeepSeek 在補:
眼睛。
機器人在補:
身體。
資料中心則必須替這些能力準備:
晶片。
記憶體。
能源。
最後真正成熟的 AI,
可能不是某一個:
最聰明的模型。
而是一套:
看得到、做得到、而且長期養得起的完整系統。
今天,和 AI 一起進步一點。
每天學會一個 AI 技巧。
每天節省一點時間。
每天提升一點能力。
SasaDaily,陪你一起成長。