阿凱的 agent 要一直讀資料、規劃步驟、呼叫工具,常常要跑好幾個小時才能完成客戶交辦的一個任務
AI agent 時代,模型常常要連續工作好幾個小時——讀資料、想計畫、呼叫工具,每吐出一個字都要把整個模型重新算一遍,這個「模型算出答案」的過程叫做推理(inference)讓已經訓練好的AI模型針對你的問題產生答案的過程,跟訓練不同——訓練是教模型學會東西,推理是模型學會後拿出來用,也是目前AI agent最大的速度瓶頸。業界因此發明了一招:先找一個小又快的草稿模型(draft model)一個體積小、速度快的AI模型,先幫大模型偷跑猜接下來可能出現的好幾個字,猜對了大模型就不用自己一個字一個字慢慢算,省下大量時間,快速猜出接下來一串字,再讓真正的大模型一次驗證整串,猜對的部分直接採用,猜錯的才丟掉重算。
但過去這個「偷跑」的動作本身還是自迴歸(autoregressive)AI模型產生文字時,一次只能吐出一個字,而且每個字都要先看到前一個字才能往下算,所以速度快不起來——草稿模型一樣得一個字一個字慢慢猜,快不了多少。今年初 Inco AI 團隊推出的 DFlash,讓「偷跑」這個動作也變成一次全部算完:一整串要猜的字同時、平行算出來,不用等前一個字先出來。這招已經被 NVIDIA、Google、Meta 等大廠採用,在 NVIDIA 的 Blackwell GPU 上最高測出 15 倍的推理速度提升,Hugging Face 上這類模型下載次數已經超過 350 萬次。
這次的 DFlash 2,則是解決了「大家一起平行用力猜」會出現的兩個副作用:猜出來的字彼此接不起來(不連貫)、越到句子後面猜得越不準。新版做法幾乎不增加額外運算時間(大約只多 1% 的運算週期),就能讓大模型每驗證一輪,平均多產出超過 20% 的內容——而且保證結果跟原本一字不差,不是用「差不多就好」去換速度。用新釋出的 Qwen3.8-27B 草稿模型實測,在 SGLang 這套推理引擎上,單一請求就能跑出一般自迴歸(autoregressive)AI模型產生文字時一次只能吐出一個字、每個字都要等前一個字先出來才能算的方式方式 2.7 到 3.4 倍的吞吐量(throughput)單位時間內AI能處理完成的工作量,通常用每秒能吐出幾個字來衡量。