你的一句話,在後端跑過幾層
你在網頁打一句話,AI 回你一段答案。看起來是兩個點:你、跟模型。但中間其實疊了好幾層,每一層各做一件事。這一集,我把這條真實的後端管線拆給你看,並回答一個很多人卡住的問題:自己家裡的 GPU,到底怎麼跟雲端的算力並駕齊驅?
很多人以為 AI 應用就是「網頁把字送給模型,模型回一段話」,兩個點。但真的把後端拆開,中間還有反向代理、有跑對話邏輯的協調層、有真正載入模型的伺服器。每一層只負責一件事,串起來,才是你看到的那一次對話。先把這一串看清楚,後面的問題就都好懂了。
我把它拆成四層。第一層是前臺,負責接收你的輸入,可以是網頁、桌面、也可以是手機。第二層是迴圈,它是協調者,決定這一步該做什麼。第三層是推理服務,真正把模型載入、跑運算、吐出文字的地方。第四層是硬體,也就是 GPU 或 CPU,提供最底層的算力。這四層搞清楚了,你就抓到整個 AI 應用的骨架。
這是一次真實自架環境挖出來的管線,不是示意圖。你的瀏覽器,先經過對外的通道、再到反向代理,進到協調層。協調層要用模型時,透過一個模型外掛、再經過一個小小的轉發橋,才連到本機的模型伺服器。為什麼要那座橋?因為模型伺服器預設只聽本機、不對外,而協調層跑在容器裡,連不到,中間就得有一座橋幫它轉一手。工具也是一樣,協調層透過外掛去呼叫搜尋、網頁讀取這些工具。
agent 之所以會「自己動手」,靠的就是協調層裡那個迴圈。它先想:這一步該做什麼;然後做:去呼叫模型,或呼叫一個工具;接著看:把結果拿回來;再想:根據結果決定下一步。這樣一圈一圈轉,直到它覺得可以給出答案為止。這也是為什麼帶工具的 agent 比純聊天慢——它不是一次來回,是好幾圈。
這裡有個很重要、但很多人忽略的點:那個迴圈本身,其實非常便宜。它做的只是解析、判斷該呼叫什麼、把結果餵回去,幾乎不吃算力。真正貴、真正吃資源的,是模型推理那一步。所以你可以把迴圈跑在一台很普通的小機器上,推理丟給後面更強的機器。迴圈當指揮,推理服務當苦力——這個分工,是理解整個架構的鑰匙。
這件事打破了一個常見的認知。很多人以為,要用 agent,就得在自己電腦上裝一個東西、跑起來下指令。但既然迴圈很便宜、又可以放在任何地方,那它放在 server 端就好。使用者這邊,只要一個網頁對話框。對使用者來說就是聊天;對系統來說,背後有一個迴圈在 server 上一圈圈轉。所以「一人一個 agent」不代表每個人桌面都要裝東西——大家用網頁,迴圈統一放後端。
講到算力,先校準一個很多人搞混的地方:GPU 本身,不會回答任何問題。它只是一塊算力,做別人叫它做的矩陣運算。真正「回答」的,是推理服務——它載入模型的權重,收到你的問題,跑一次運算,吐出文字。本機常用的是 Ollama,要衝吞吐量的會用 vLLM。所以「買了 GPU 就有 AI」是錯的,中間一定要有推理服務把模型架在 GPU 上。
那自己家裡的 GPU,跟雲端的算力,到底怎麼比?先講老實話:如果比原始速度和最大的模型,本地追不上雲端——人家有專用硬體和規模。但本地贏在雲端給不了的地方:資料完全不出門、可以斷網、沒有每分鐘的額度限制、量大的時候長期更省。所以不是誰絕對比較好,是你的條件決定用哪邊。
那本地要怎麼「追近」雲端?有四招。第一招:開源模型已經夠好了。qwen、llama、gpt-oss 這些,對絕大多數任務都夠用,你不需要去追雲端那種頂規的超大模型。第二招:量化。把模型從高精度壓成低精度,記憶體可以省下三到四倍,速度還更快。本來要好幾張卡才跑得動的模型,量化後一張消費級顯卡就跑得起來。
第三招:推理服務的優化。像 vLLM 這類工具,用連續批次、快取這些技術,把一張 GPU 的利用率榨到接近極限,吞吐量可以拉得很接近雲端。第四招:專用硬體。真的需要,就把算力堆上去,用更強的卡、或多張卡。這四招合起來,本地跟雲端的差距,就從「天差地遠」縮小到「特定任務夠用」。
所以結論不是「本地打贏雲端」,而是「選對甜蜜點」。牽涉到資料安全、需要斷網、要掌握資料主權的,放本地;要用最強、最快模型的,用雲端。把關鍵、敏感的決策留在自己手上,把大量、可外流的苦工丟給雲端。這才是成熟的用法——不是二選一,是各就各位。
最後把視野拉高。那個迴圈的本質是:一個協調者,反覆呼叫一個能力、把結果餵回、再決定下一步。如果被呼叫的是「模型加固定工具」,那就是單一 agent。如果被呼叫的,是「另一個會自己思考的 agent」,那就是 A2A,agent 對 agent。把工具換成 agent,內圈就長成外圈——底層的協調模式,完全一樣。看懂這個迴圈,你就同時看懂了單 agent、多 agent、還有各種 harness 的定位。
留給你一句話:AI 應用的骨架,是一個便宜的迴圈,加上一個昂貴的算力層。迴圈當指揮、算力當苦力;指揮可以放在小機器上,苦力可以是本地也可以是雲端。想清楚哪一段放哪裡,你就不會再被「要不要自己買 GPU」這種問題卡住——因為答案永遠是:看你要解決的,是速度,還是主權。