今天三則 AI 新聞,

表面上完全不一樣。

第一則:

AI 開始真正「看得懂圖片」。

第二則:

跑 AI 的伺服器可能變貴。

第三則:

人形機器人已經可以把 100 公尺跑進 10 秒。

但把三件事情放在一起,

其實都在說:

AI 正在離開單純聊天的世界。

以前我們最常比較的是:

哪個模型回答比較好?

現在競爭開始變成:

看不看得懂真實世界?

跑不跑得動?

以及:

整套東西到底付不付得起?

第一則:DeepSeek V4 Flash Vision 上線,低成本模型開始長出「眼睛」

DeepSeek 8 月 21 日推出一個新的實驗模型:

DeepSeek-V4-Flash-Vision-Exp。

最大的變化不是:

模型又多了一個版本。

而是原本以文字、推理與 Agent 工作為主的 V4 Flash,

現在正式加入:

圖片理解。

也就是說,

開發者可以同時把:

文字。

圖片。

文件畫面。

網站截圖。

圖表。

介面狀態

交給模型分析。

DeepSeek 將它定位為實驗性模型,並表示純文字能力與正式版 V4 Flash 大致維持同一層級;真正新增的,是處理視覺資訊的能力。

為什麼這件事比「可以看圖片」更重要?

因為 Agent 真正進入工作以後,

世界並不是:

全部都有 API。

很多工作其實長這樣:

先看一張 PDF。

確認表格裡寫了什麼。

再看網站畫面。

找到某個欄位。

接著判斷:

下一步該點哪裡。

所以如果 AI 只能理解:

文字 Prompt,

它其實少了一雙:

眼睛。

例如最簡單的工作

假設一間小公司收到供應商提供的產品型錄。

裡面有:

產品照片。

尺寸表。

圖示。

規格。

包裝資訊。

以前如果模型只能吃文字,

你可能還得先:

OCR。

整理。

把資料另外轉成文字。

現在視覺模型的方向是:

直接把:

原始畫面

交給 AI。

讓它先理解:

畫面上到底有什麼。

這也是為什麼「Vision」會和 Agent 綁得愈來愈緊

真正的 Computer Use,

通常需要一個循環:

看。

判斷。

操作。

再看。

再判斷。

如果 AI 不知道按完按鈕後,

畫面發生了什麼,

Agent 就很難真正持續工作。

所以多模態不是:

「聊天機器人多一個圖片功能。」

更大的意義是:

AI 開始取得操作真實數位環境所需要的感知能力。

DeepSeek 這次還加入 Files API

另一個很實際的更新是:

圖片可以先上傳,

再在不同請求裡重複引用。

這代表企業如果一直要分析同一批:

圖表。

產品圖片。

文件。

不一定每一次都重新傳完整資料。

這其實是很典型的:

從 Demo

走向:

Workflow。

因為真正企業應用最在乎的往往不是:

AI 能不能看一張圖。

而是:

能不能每天重複做幾千次。

不過「Vision 上線」不代表圖片裡的每一件事都會看對

這一點一定要保留。

模型能接受圖片,

只是代表:

多了一種輸入能力。

不代表:

OCR 永遠正確。

圖表數字永遠正確。

介面座標永遠正確。

小字一定讀得到。

所以未來真正使用多模態 Agent,

還是要問:

哪些工作看錯了可以追回?

哪些一旦看錯就不能直接執行?

這會比單純比較 Benchmark 更重要。

第二則:AI 軟體愈來愈便宜,Nvidia 伺服器卻據報準備漲逾 15%

這一則剛好和昨天早報形成非常有意思的對照。

昨天我們才看到:

OpenAI 把 GPT-5.6 Sol API 價格往下調。

今天另一端卻傳來:

AI 伺服器可能要變貴。

Reuters 8 月 22 日引述 Bloomberg News 報導,

Nvidia 據報已通知部分主要客戶,

搭載其 AI 晶片的新伺服器,

價格可能上調:

超過 15%。

主要原因之一是:

記憶體成本大幅上升。

受影響的系統據報包括搭載 Vera Rubin 與 Grace Blackwell 系列晶片的伺服器,部分調價可能反映在 2027 年初出貨的系統上。Nvidia 截至該報導發布時並未正式評論,因此目前仍應寫成「據報」,而不是 Nvidia 已正式公布統一漲價 15%。

為什麼不是 GPU 本身漲價,整台伺服器也會變貴?

因為一台 AI Server,

從來不是只有:

GPU。

還有大量:

HBM。

DRAM。

儲存。

CPU。

高速網路。

電源。

液冷。

機櫃。

主機板。

當其中一個重要元件出現:

供不應求,

整台系統成本就會跟著上去。

現在最值得看的其實是「記憶體」

AI 模型愈大,

推論量愈多,

對高速記憶體需求就愈高。

也就是說:

晶片公司可以設計更快的 GPU,

但如果資料來不及送進去,

GPU 仍然會:

等。

這和我們以前一直說的問題一樣:

AI 資料中心不是單顆晶片的比賽。

而是整套系統。

所以 AI 正出現一個很奇怪的價格方向

軟體端:

模型 API 價格一直降。

硬體端:

高階伺服器某些成本反而可能上升。

為什麼?

因為模型競爭者愈來愈多。

但能提供:

高階記憶體。

先進封裝。

晶片。

資料中心電力

的供應鏈,

短期沒有辦法像模型 API 一樣:

按一下按鈕就增加一倍。

這會影響誰?

最先有感的不一定是:

一般 ChatGPT 使用者。

而是:

雲端公司。

AI 新創。

大型企業。

資料中心。

因為如果一批 AI 伺服器原本預算:

1 億美元,

硬體成本多 15%,

就可能多:

1,500 萬美元。

規模愈大,

差距愈大。

這也意味著未來模型公司不能只靠降價搶市場

假設:

API 價格每年下降 30%。

很好。

可是背後:

伺服器。

記憶體。

電力。

融資

卻一直上升。

模型公司最後還是要回答:

這個價格戰能打多久?

真正的成本優勢,

最後一定會回到:

晶片效率。

記憶體效率。

模型壓縮。

資料中心利用率。

電力成本。

甚至:

供應鏈議價能力。

第三則:人形機器人正式百米跑出 9.39 秒,比人類世界紀錄還快

如果前兩則還發生在:

電腦與資料中心,

第三則已經直接跑到:

田徑場。

第二屆世界人形機器人運動會,

8 月 22 日在北京開幕。

在正式 100 公尺項目中,

一台人形機器人跑出:

9.39 秒。

這個時間比 Usain Bolt 保持的人類男子 100 公尺世界紀錄:

9.58 秒

還快。Reuters 與 AP 都報導了這次比賽結果。

還有一個更快的 9.32 秒,但要分清楚

在正式比賽開始前,

Honor 的人形機器人:

Lightning

曾在準備測試中跑出:

9.32 秒。

峰值速度據報達:

14.5 公尺/秒。

但是:

9.32 秒是:

準備測試。

而不是正式比賽冠軍成績。

正式比賽報導中的 100 公尺成績是:

9.39 秒。

這兩個數字不能混在一起。

但現在先不要急著說「機器人已經比人類強」

百米速度,

只代表一種能力:

跑得快。

真正要在人類環境工作,

還需要:

平衡。

抓取。

手部精細操作。

環境判斷。

遇到陌生狀況重新規劃。

長時間穩定工作。

安全停下。

這些全部比:

往前衝 100 公尺

複雜很多。

而這也是今年機器人運動會最值得看的改變

官方今年不只安排:

跑步。

跳躍。

競技。

還增加:

工廠。

飯店。

家庭。

零售。

消防

等真實場景任務。

部分比賽也要求機器人:

完全自主完成。

也就是說,

主辦方正在把問題從:

「這台機器人能不能表演?」

慢慢改成:

「它能不能在真實環境自己完成工作?」

這才是 Physical AI 真正的大考

如果只是:

固定場地。

固定路線。

固定動作。

機器人可以靠大量調校,

做到非常驚人的效果。

可是現實世界不是固定劇本。

例如一台飯店機器人,

今天電梯口突然有:

行李。

小孩。

其他客人。

清潔推車。

它就必須重新判斷。

所以真正的 Physical AI,

不是:

跑得快。

而是:

能感知、能決策、能行動,而且環境改變後仍然能繼續完成任務。

把今天三件事情放在一起

DeepSeek 告訴我們:

AI 開始:

看。

人形機器人告訴我們:

AI 開始:

動。

Nvidia 伺服器價格則提醒:

所有這些能力背後,

仍然要有人:

付錢。

這就是今天真正的共同趨勢

過去的大模型競爭,

很像:

比考試。

誰 Benchmark:

第一。

誰推理:

比較強。

誰 Coding:

比較好。

現在競爭開始變成:

第一層:感知

能不能看懂:

圖片。

畫面。

文件。

環境。

第二層:行動

能不能:

點。

操作。

走。

跑。

抓。

完成任務。

第三層:成本

這些能力如果每天使用:

100 萬次,

到底花多少錢?

AI 會愈來愈像一個「完整系統」

未來我們談一個 AI,

可能不再只是:

「它是哪個模型?」

而是:

模型。

Vision。

Agent。

Tools。

Memory。

Robot。

GPU。

Memory Chips。

Network。

Data Center。

Electricity。

全部連在一起。

這也是為什麼:

單純 Benchmark 第一

最後不一定代表:

商業上第一。

對一般使用者來說,最直接的改變是什麼?

就是 AI 的入口會愈來愈少依賴:

打字。

你可以直接:

拍照片。

傳文件。

讓它看螢幕。

讓它聽聲音。

甚至讓它控制:

真正的機器。

也就是:

人類不必先把世界全部翻成文字,

AI 才能理解。

但風險也會一起變大

AI 如果:

文字答錯,

通常還有機會:

不採用。

AI 如果:

看錯畫面,

又立即:

操作。

問題就完全不同。

如果操作的只是:

測試 App,

可能重來。

如果操作的是:

工廠機械。

車輛。

付款。

醫療設備。

真正 Physical AI,

安全邊界就會比聊天機器人:

嚴格很多。

所以接下來真正重要的問題,不是「AI 會不會有眼睛和手」

答案其實已經非常明顯:

會。

真正的問題是:

眼睛看錯的時候,手會不會跟著做錯?

以及:

我們有沒有在它行動以前留下確認點?

這也會是未來 AI Agent 和機器人真正走進日常工作的核心問題。

今天早上的一句判斷

2026 年的 AI,

已經不再只是:

誰最會聊天。

而開始變成:

誰看得懂世界。

誰能在世界裡行動。

以及:

誰能把這一切做到足夠便宜。

DeepSeek 在補:

眼睛。

機器人在補:

身體。

資料中心則必須替這些能力準備:

晶片。

記憶體。

能源。

最後真正成熟的 AI,

可能不是某一個:

最聰明的模型。

而是一套:

看得到、做得到、而且長期養得起的完整系統。

今天,和 AI 一起進步一點。

每天學會一個 AI 技巧。

每天節省一點時間。

每天提升一點能力。

SasaDaily,陪你一起成長。

推薦閱讀

AI 一分鐘教學|2026/08/04:換成便宜 AI 模型前,先用同一組 20 題做「成本、正確率、修改時間」測試

AI 晶片已經算得夠快,為什麼現在還要改用「光」來搬資料?