📍 真實場景
白天在超商排班、晚上靠 AI 接案做網頁賺外快的阿凱
他習慣把客戶要的網頁需求丟給 Gemini,讓 AI 先生出一版原型再自己修
😖 卡住的地方:AI 生出來的網頁常常「看起來像」但按鈕點下去沒反應,還要來回問好幾次才修好,每次修都在燒 TokenAI 讀寫文字時計費的最小單位,大約每幾個中文字或英文字算一個 Token,輸出的 Token 通常比輸入貴很多 ,接案賺的錢有一部分變成 API 費用
💡 讀完你會知道新模型網頁一次生成更能用、bug 更少,輸出費用還砍半,今天就能拿一個舊案子重跑一次比較
⚡ 一句話講清楚
Google 剛推出 Gemini 3.7 Flash,是 Flash 系列Gemini 家族裡主打「快又便宜」的款式,用一點點深度換取速度與低成本,跟強調深度思考的旗艦版是不同定位 的最新一代,距離上一版 3.6 Flash 只隔三週,官方說這次改動主要來自開發者回饋,重點放在寫程式和「agent能自己規劃步驟、呼叫工具、一步步把一件事做完的 AI,不是只會單次回答問題 」這兩件事上。
在寫程式這塊,3.7 Flash 在除錯和解決問題上的表現明顯進步,用來衡量「AI 寫出的程式碼能不能一次就能用」的測驗 FrontierCode一套用來衡量 AI 寫程式功力的測驗題庫,分數越高代表寫出的程式碼一次就能跑、不用你再修的機率越高 從 34.4% 拉到 43.6%。網頁生成方面,官方讓 3.7 Flash 和 3.6 Flash 在 WebDev Arena讓兩個 AI 模型的網頁作品互相 PK、由裁判打分排名的競技場,用 Elo 分數表示勝率高低,數字越高代表越常獲勝 對打,Elo 從 1538 上升到 1588,代表同樣一句需求,3.7 Flash 更常一次做出你要的版面,不用你來回追問。
在財務、法律、生科這類需要讀懂複雜文件的知識密集領域,3.7 Flash 在專測「讀懂複雜文件」的 GDP.pdf 評測從 22.0% 進步到 34.0%,在測試「AI 能不能真的把一整套商業流程做完」的 AutomationBench不只是問答題,而是測試 AI 能不能真的把一套完整的商業工作流程從頭到尾做完的評測 從 17.0% 進步到 30.4%。價格則是即日起到年底維持每百萬輸入 Token 0.75 美元、輸出 3.75 美元,是 3.6 Flash 原價的一半。
🏃 快速上手三步(今天就能做)
1
去 AI Studio 換模型重跑一次舊案子 打開 aistudio.google.com,登入你原本的 Google 帳號,在模型下拉選單找到 gemini-3.7-flash(可能標示為 3.7 Flash 或 preview 版),把你上次做過的網頁生成需求原封不動貼進去跑一次,對照舊模型當時的輸出,看這次是不是少改幾輪就能用
▼
2
拿你手動抓過的 bug 讓它重新抓一次 挑一段你之前用 AI 寫壞、自己手動除錯過的程式碼,貼給 3.7 Flash 請它抓問題所在。判斷標準:它是否一次就點出你當初手動改掉的那個地方,而不需要你再追問三、四輪才抓到重點
▼
3
用上個月帳單試算換模型能省多少 翻出你上個月的 API 用量紀錄,抓輸入輸出大約 1:3 的比例,套入每百萬輸入 0.75 美元、輸出 3.75 美元這個新報價,跟你現在付的錢比一比,算出每月省下的金額,再決定要不要把接案工具全面換過去;注意這個價格官方寫明只到年底,不是長期價
🧠 工程思維透鏡(資深工程師看到的是什麼)
🔭 模型三週就迭代一次,對已經在跑 agent 流程的工程師是好事還是麻煩?
迭代快代表你的系統提示詞和流程要跟著版本重新校準——如果你把某個舊版本的怪癖或固定回應方式寫死進 prompt,換新模型後行為一變,原本調好的 agent 可能突然表現失常。穩妥的做法是換模型前先留一批舊的測試案例跑一輪回歸測試,而不是看到「更強、更便宜」就立刻全面切換。
🔭 打對折的促銷價,工程師在評估成本時該提防什麼?
官方寫明 0.75/3.75 美元這個價格是「即日起到年底」的介紹價,不是永久定價。如果你把接案報價或產品的成本結構整個建立在這個促銷價上,一旦年底恢復原價,原本算好的「用得起所以敢規模化用 agent」可能就不划算了,評估時該多算一版「漲回原價後還划不划算」。
🔭 官方公布的 Elo 分數、FrontierCode 這些數字能直接當作換模型的依據嗎?
這些都是廠商自己公布的跑分,測試題目和情境不一定貼合你實際接的案子類型。比較保險的做法是把這些數字當成「值得一試」的訊號,實際決定前還是要用自己手上的真實案子(如上面 quick_start 的兩個測試)驗證一次,而不是只看官方數字就整批換掉正在用的模型。
ai-lecturer 速報|藍圖 flash-brief-v1.0|零外部依賴