📍 真實場景
小型接案工程師阿翔,正在幫一家連鎖火鍋店做電話訂位語音機器人
他串了一個推理能力很強的大型語言模型當作電話應答引擎,讓客人可以直接打電話訂位、改時間、問營業時間
😖 卡住的地方:每次客人問完問題,電話那頭都會先安靜停頓0.4到2秒AI才開始回答,有些客人以為斷線就直接掛掉重打,導致訂位掉單,老闆已經在質疑要不要收掉這個功能
💡 這堂課會告訴他問題不一定出在他寫的程式,而是出在模型的生成架構——並用一個瀏覽器demo讓他直接『看到』擴散式模型跟傳統模型生成文字的方式差在哪裡,順便知道換模型大概要花多少錢
🧭 這到底是什麼(白話版)
你打電話給客服機器人時,從你講完話到AI開始回答之間的那段空白,叫做延遲(latency)從你發出請求到AI開始回應之間,讓你乾等的那段時間。這篇材料在講的Mercury 2.5,是Inception這家公司推出的最新款擴散式語言模型(diffusion LLM)原本是用在AI畫圖,讓電腦從一片雜訊逐步『去噪』還原成清晰圖片的技術,現在被搬來生成文字,主打賣點就是又快又便宜,還維持住不錯的答題品質。
傳統主流的AI(大多數聊天機器人背後的模型)走的是自回歸生成(autoregressive)傳統LLM的生成方式,一次只吐一個字,而且一定要先看過前面所有內容才能決定下一個字是什麼,這裡的『字』在AI眼中其實是一個個tokenAI處理文字時切出來的最小單位,可能是一個字、一個詞,或半個詞。句子越長、要串接的步驟越多,累積的等待時間就越明顯。Mercury 2.5走的擴散路線不一樣:它先生成一份『大致但不完美』的整批草稿,再用好幾輪『同步精煉』把全部文字一起修順,因為每一輪都是整批一起處理,速度可以拉到每秒1107個token,材料裡說這是目前已知訓練過最大的擴散式語言模型。
材料還提到幾個開發者會在意的規格:它能記住上下文長度(context window)AI一次能讀進去、記得住的內容上限,通常用token數計算260K token的對話或資料;支援可調式推理(tunable reasoning)讓開發者自己決定AI要『想』多久、多深入,在速度和答題品質之間抓平衡,也支援平行工具呼叫(parallel tool calls)AI可以同時發動好幾個外部工具或功能呼叫,不用一個做完才做下一個,還能直接吐出符合固定格式的schema對齊JSON(schema-aligned JSON)保證AI回傳的資料一定符合你要求的固定欄位格式,不會東漏西缺。這些設計湊在一起,就是為了讓開發者能直接拿它串成正式上線的agent,而不是只能拿來做demo。
🎯 為什麼值得你花時間
終於不用『捨速度換品質』Mercury 2.5比上一代提升40%的智慧程度,答題品質已經追上像GPT-5.6 Luna(Low)、Gemini 3.5 Flash-Lite、Claude Haiku 4.5這類走『低成本、快速』路線的頂尖模型,但骨子裡的架構讓它能同時維持低延遲、低成本,不是『先求快、犧牲品質』的妥協版本。
價格砍到幾乎不用猶豫上市優惠打8折,只要每百萬input token $0.04、output token $0.15;對每天要打幾萬次API的agent應用來說,這個單價差距在跑量後會被放大很多倍,等於直接降低了『敢不敢拿AI做正式產品』的門檻。
不是實驗室跑分,是真的扛過正式流量材料提到Mercury 2上市後已經有數千名開發者串接、數十家企業正式上線使用,用量成長超過十倍;Mercury 2.5是拿這些真實生產環境的失敗案例回頭校準訓練出來的,不是關起門來刷榜的成果。
⚙️ 它是怎麼運作的
1
傳統做法:一步一步排隊等像搜尋agent這種應用,原本一個請求背後要跑規劃查詢、改寫查詢、重新排序結果、整理成結構化資料、彙整摘要、核對答案,總共大約6次模型呼叫;如果每一次呼叫都是慢的自回歸模型,前一步沒做完後一步不能開始,累積起來使用者就要等很久。
▼
2
Mercury 2.5把每一步都變快因為擴散式架構本身就是整批同步處理,不是一個字一個字硬擠,所以單次呼叫在常見的NVIDIA GPU上可以跑到每秒1107個token;6次呼叫串起來還能撐在『一次使用者互動』的時間感受之內。
▼
3
語音場景:把停頓感壓到聽不出來材料舉了OpenCall(電話客服agent)的實測案例:換成Mercury後,P50(一半情況)的回應延遲降到0.2秒以下,P99(幾乎所有情況,包含最糟的那一次)從原本要好幾分鐘,壓到只剩1秒,使用者幾乎感受不到AI在『想』。
▼
4
開發者多拿到的武器除了快,材料也提到它支援可調式推理(自己決定要不要讓AI多想一下)、平行工具呼叫(一次同時呼叫好幾個外部功能),還有260K的上下文長度,讓一整段對話或工具鏈狀態都不用被截斷。
▼
5
價格怎麼定,才敢真的拿去正式上線正常定價是每百萬input token $0.20、output token $0.75,材料寫上市還打8折——只要$0.04/$0.15;對於一天要打好幾萬次API的agent應用,這個單價差距在跑量之後會被放大很多倍。
自回歸生成 vs. 擴散式生成(Mercury 2.5)的差異
| 比較面向 | 傳統自回歸LLM | Mercury 2.5(擴散式LLM) |
|---|
| 生成方式 | 一個token接著一個token依序生成,每一步都要看過前面所有內容 | 先生成一份整批草稿,再用好幾輪同步『去噪精煉』一起修正 |
| 多步驟agent鏈(像搜尋agent的6道呼叫) | 每一步都要等前一步的模型跑完才能開始,步驟越多越慢 | 單次呼叫本身就快(1107 token/秒),6步串起來也還撐得住 |
| 語音agent的實測延遲(OpenCall案例) | 原本P99要好幾分鐘 | P99壓到1秒,P50不到0.2秒 |
| 上市優惠單價(每百萬token) | 依各家模型而定,通常速度與品質要互相妥協 | input $0.04、output $0.15(原價打2折) |
🛠️ 動手做:看看AI怎麼『整批顯影』寫出一句話,而不是一個字一個字擠出來
- 點一下下拉選單,選擇「短句」或「長句」,感受句子長度對兩種生成方式的影響差異。
- 按下「開始生成」,同時觀察左邊自回歸生成(一個字一個字跳出來)跟右邊擴散生成(整片雜訊方塊同步變清楚)。
- 看兩邊的完成訊息:自回歸會顯示總共推論了幾次(等於字數),擴散會顯示總共跑了幾輪整批精煉。
- 換成「長句」再跑一次,比較兩種模式的步驟數差距是不是被拉得更大——這就是為什麼Mercury 2.5在多步驟agent鏈(像搜尋agent的六道呼叫)裡特別吃香。
- 提醒:畫面上的秒數是為了讓你看得出節奏刻意設計的模擬速度,不是Mercury 2.5的真實跑分數字,重點是感受『步驟次數』的差距。
👇 下面是活的,直接操作
🧠 工程思維透鏡(資深工程師看到的是什麼)
🔭 為什麼Inception敢把擴散式架構直接推上語音、搜尋這種正式營運場景,而不是只留在Demo階段?
材料提到他們是靠『數千名開發者、數十家企業』的真實流量回饋,加上正式環境的失敗案例去校準評測、聚焦訓練方向,而不是只看跑分表現。這反映一種資深工程判斷:讓真實生產訊號回頭『餵』給下一輪訓練,比一味追求榜單分數更能保證正式上線時真的扛得住。
🔭 為什麼要把『可調式推理』跟『平行工具呼叫』兜在同一顆模型裡,而不是拆成兩個產品?
像搜尋agent這種多步驟串接的應用,如果每一步都要換模型、換API,整合的複雜度跟延遲都會往上疊。把『要想多深』的控制粒度跟『能不能同時呼叫多個工具』的能力,一起收進同一個介面,等於幫開發者省掉agent架構裡大量的膠水程式碼,這是很典型的『介面簡化換取整合效率』的工程取捨。
🔭 上市直接打8折,而不是先用原價觀察市場反應,透露了什麼產品策略?
對延遲敏感、高頻呼叫的agent場景(語音、搜尋)來說,單價的些微差異,會隨著呼叫次數被放大很多倍。用大幅折扣降低早期採用門檻,換來的是更多真實流量、更多生產環境的失敗案例;這些資料又能回頭餵進下一輪的評測校準循環——等於是把定價當成蒐集訓練訊號的槓桿,而不只是單純的促銷手法。
🔭 材料為什麼特別強調P50跟P99這兩個數字,而不是只講平均延遲?
在電話語音這種場景,使用者感受到的從來不是平均值,而是『最糟的那一次』。P99從好幾分鐘砍到1秒,代表這個模型連最壞情況都很穩,這種對『最差表現』的重視,正是資深工程師在判斷一個系統『能不能真的上線』時,實際會去看的指標,而不是被平均數字沖淡掉風險。
📝 隨堂考(點選答案,立即回饋)
Q1. Mercury 2.5之所以能達到每秒1107個token的速度,最主要靠的是什麼?
✅ 材料明確指出它是目前已知訓練過最大的擴散式語言模型,速度來自架構本身的整批平行處理,不是靠縮小模型或跳過評測;而且它的上下文其實高達260K,並非只處理短上下文。
Q2. OpenCall案例中,切換到Mercury後P99延遲從『好幾分鐘』變成多少?
✅ 材料原文提到P99回應時間從好幾分鐘降到只要1秒,P50則從0.4秒降到0.2秒以下。
Q3. 為什麼材料說『在語音場景中,延遲不是基礎設施細節,而是使用者會聽到的停頓』?
✅ 材料把延遲直接連結到通話者實際聽到的停頓,代表這個指標會直接影響使用者是否掛電話,不是抽象的系統效能數字。
Q4. 上市優惠價之後,Mercury 2.5的input token價格是每百萬token多少?
✅ 原價是每百萬input token $0.20、output token $0.75,上市優惠打8折後分別是$0.04與$0.15。
Q5. 材料中提到一次搜尋請求可能觸發幾個模型呼叫(從規劃查詢到核對答案)?
✅ 材料列出plan the search、rewrite queries、rerank results、structure facts、summarize sources、check the answer共六道流程,每一道都是一次模型呼叫。
🃏 翻牌記憶卡(先想答案,再點開對答)
擴散式語言模型(diffusion LLM)點我翻面
不是一個字一個字生成,而是先打好整批草稿,再用好幾輪同步『去噪精煉』修成通順文字,所以可以平行處理、速度快。
Mercury 2.5的推理速度點我翻面
在常見的NVIDIA GPU上可以跑到每秒1107個token,是目前已知訓練過最大的擴散式語言模型。
Mercury 2.5的上下文長度點我翻面
260K token,可以撐住一整段對話或整條工具鏈的狀態,不用被截斷。
OpenCall案例的關鍵數字點我翻面
換成Mercury後,P99回應時間從好幾分鐘降到1秒,P50從0.4秒降到0.2秒以下。
上市優惠價格點我翻面
每百萬input token $0.04、output token $0.15,是原價($0.20/$0.75)打2折的結果。
為什麼搜尋agent特別在意速度點我翻面
一次搜尋常常要串連規劃查詢、改寫查詢、重新排序、結構化整理、摘要、核對答案,共大約6道模型呼叫,每一道慢一點,加起來使用者就等不下去。