注意:設好分流規則,別全部一次換判斷標準:10 個任務中 Sol 答對數 ≥ 舊模型的 90%,且單次成本低於一半,就先把「日常、量大、有測試可驗證」的任務改用 Sol。最難的任務(大型重構、科學計算、需要高度嚴謹的分析)仍留給 Astra 或同級模型。同時記得:官方評測是廠商自己報的數字,你的專案才是真正的考場;換之前保留一個能隨時切回舊模型的設定開關。
🧠 工程思維透鏡(資深工程師看到的是什麼)
🔭 「幾乎一樣強、只要五分之一價錢」對系統架構代表什麼?
最直接的影響是「模型分流」(model routing)變得更值得做:大部分請求走 Sol,只有 Sol 失敗或任務被判定為高難度時才升級到 Astra。代價是你要多維護一層判斷邏輯與失敗重試,並持續監控兩邊的品質差。以官方數字看,差距在不同任務上不一致(DeepSWE 打平、OSWorld 差約 2 個百分點、科學任務 Astra 仍領先),所以分流規則應依任務類型而不是一刀切。另外,價格降到這個程度,過去因為太貴而不敢做的功能(每次動作都讓 AI 多檢查一遍)會開始變得可行,但總花費可能因為用量變大而不降反升,要設預算上限。
🔭 0.10 美元的快取價,會怎麼改變你設計提示詞與代理人的方式?
快取只在「前面一大段內容完全相同」時才會命中,所以要把固定不變的內容(系統指令、工具說明、專案背景)放在提示詞最前面,會變動的內容(使用者這一輪的問題)放最後;任何在前段插入時間戳、隨機 ID 的習慣都會讓快取失效。好處是長對話、多輪代理人的成本大幅下降,可以放心帶更完整的上下文,減少因資訊不足而出錯的重試。風險是快取通常有存活時間限制,且你會對這個計價方式產生依賴,若之後價格調整或換供應商,成本模型要重算;建議把『快取命中率』當成一個要長期監控的指標。