AI-LECTURER 速報課|2026-08-19|約 26 分鐘

GPT-5.6 Sol 視覺模型評測:座標框亂跳?問題不是模型壞了,是格式沒對齊

取材:GPT 5.6 Sol is the best "vision" model OpenAI ever released(Hacker News(AI 高人氣))
📍 真實場景
社區藥局的管理員佩君,平常要清點分裝藥盒裡的藥丸數量

她想用剛上線的 GPT-5.6 Vision API,自動幫忙從藥丸分裝盤的照片抓出每一顆藥丸的位置與數量,取代人工一顆顆數的苦差事

😖 卡住的地方:第一次測試時,AI 回傳的框框完全對不上藥丸,反而排成一整排整整齊齊貼在照片邊緣,她一度以為是自己的 API 額度用完或模型故障,重新申請了一次額度,結果框框還是一樣亂
💡 這堂課會告訴你,問題不是模型壞掉,而是每個視覺模型認定「座標」的方式不一樣——搞懂這件事,你自己動手做的偵測工具才會真的準

🧭 這到底是什麼(白話版)

上週 OpenAI 一口氣發布了 GPT-5.6 系列的三個模型:Sol、Terra、Luna。發表會主打的是「電腦操作代理」——讓 AI 自己看畫面、自己點滑鼠操作軟體,還能理解 3D 場景。但不管是操作電腦還是理解 3D,背後都需要一件事:AI 要先「看懂」畫面。像 GPT-5.6 這種能同時讀懂圖片和文字的 VLM能同時讀懂圖片和文字的AI模型,英文全名是Vision Language Model,看得準不準,直接決定了這些花俏功能能不能真的派上用場。

這篇文章的重點,其實不是 OpenAI 自己說的話,而是第三方公司 Roboflow 拿一套自己在開發的評測工具,實際去測這幾個新模型的「視覺實力」。測試涵蓋 物件偵測讓AI在照片裡框出每個物品的位置和種類,像是在照片上畫框框標記、計數、OCR讓AI把照片裡的文字辨識出來變成可以複製貼上的文字,全名是Optical Character Recognition、跟資料擷取四種任務。結果很明顯:在物件偵測這項,用 mAP@50一種評分物件偵測準不準的分數,50表示框框只要跟正確位置重疊超過一半就算對,分數越高代表框得越準 來看,上一代 GPT-5.5 只有 13.8 分,新的 Sol 一口氣衝到 46.2 分,等於是從「幾乎不能用」變成「堪用」的等級。

但這篇文章真正想提醒工程師的,不是這個漂亮的分數,而是「你自己動手套用時會踩到的坑」:不同模型認定 座標系統描述一個點在圖片裡的位置的方式,像是「從左上角量起,右邊多少像素、下面多少像素」 的方式不一樣,而且圖片太大時,模型偵測還會變得不穩定。這些才是佩君這種要真的把它接進工作流程的人,會實際撞到的牆。

🎯 為什麼值得你花時間

從「看不清楚」到「能用」的關鍵一跳物件偵測分數從 13.8 分跳到 46.2 分,不是進步一點點,而是跨過了「能不能實際拿來用」的門檻。過去想用 GPT 系列做圖片盤點、抓取照片裡的物件數量,準確度低到沒辦法信任;現在這件事第一次變得實際可行。
OpenAI 押寶的『電腦操作代理』,命脈就在視覺能力這次發表會主打的 UI 代理、3D 理解,全部都建立在「AI 看得準不準」之上。如果連照片裡的藥丸、螢幕上的按鈕都框不準,再厲害的自動操作功能也只是空話。視覺能力進步,代表這類自動化功能第一次有了可信的地基。
沒講清楚座標格式,效能直接砍半文章實測顯示,光是「座標格式講錯」這一件小事,就能讓偵測分數掉大約 15 個 mAP 點。這種坑不會出現在任何官方文件的顯眼位置,卻是工程師實際整合時最容易白白浪費一整天除錯時間的地方。

⚙️ 它是怎麼運作的

1
把圖片和提示詞一起送出去你把照片和一段文字提示(想要它找什麼、用什麼格式回答)一起打包,送給 GPT-5.6。這一步跟一般問 AI 文字問題很像,只是多附了一張圖。
2
模型是「用打字」的方式回答座標,不是直接輸出數字陣列傳統的物件偵測模型(不是 VLM)會直接吐出一組固定格式的數字。但像 GPT-5.6 這種 VLM,是把每個物件的類別和座標,當成文字一個字一個字「生」出來,跟它回答你聊天訊息的方式其實是同一套機制。
3
座標格式要講清楚,不然分數直接掉 15 分GPT-5.6 系列偏好「絕對像素、XYXY」格式(也就是「左上x、左上y、右下x、右下y」,單位是圖片實際的像素數);但像 Gemini 3.5 Flash 這款模型,卻偏好「YXYX、正規化到 0~1000」的格式。同一組數字,用錯格式解讀,框框就會畫在完全不合理的地方。
4
密集場景是照妖鏡文章特別提到藥丸、雞蛋這種「很多顆擠在一起」的照片。因為 VLM 是逐字生成答案,物件一多,要輸出的文字就變長,出現漏框、重複框、位置算錯的機率也跟著提高——這是傳統偵測器比較不會遇到的問題,因為它們一次就輸出固定維度的結果,不受物件數量影響。
5
圖片太大,模型會恍神OpenAI 官方向 Roboflow 證實,圖片在約 2000×2000 像素以上、加上 推理強度(reasoning effort)讓AI「多想一下」再回答的設定,想得越久越準,但也越貴越慢 設得比較低時,Sol 特別容易不穩定。拉高推理強度能改善,但會讓 token 用量、延遲、費用都上升;文章給的建議是:先把圖片 resize 或裁切小一點,比硬砸推理強度划算。
GPT-5.6 系列 vs 前代|物件偵測分數(mAP@50)與建議座標格式
模型mAP@50 分數建議座標格式
GPT-5.513.8文章未特別測試座標格式
GPT-5.6 Sol46.2絕對像素、XYXY
GPT-5.6 Terra44.7絕對像素、XYXY
GPT-5.6 Luna43.3絕對像素、XYXY
Gemini 3.5 Flash文中未提供對照分數正規化 0–1000、YXYX

🔍 程式碼漫遊(點有 ● 的行看白話講解)

這段程式示範怎麼呼叫 GPT-5.6,並且在提示詞裡「講清楚座標格式」——這是文章裡最關鍵、也最容易被忽略的一步,佩君第一次踩的坑就是漏了這段。

from openai import OpenAI client = OpenAI()
💬 匯入官方 SDK、建立客戶端物件,這是每次呼叫 GPT-5.6 API 前的固定開場。
image_path = "pill_tray.jpg"
💬 指定要辨識的照片,也就是佩君拍的藥丸分裝盤照片。
prompt = ( "請找出圖片中每一顆藥丸的位置。" "座標請用「絕對像素、XYXY」格式回傳," "也就是 [左上x, 左上y, 右下x, 右下y]," "單位是這張圖片實際的像素數,不要正規化成 0~1000。" "用 JSON 陣列回傳,每個物件包含 label 與 box。" )
💬 全課最關鍵的一段:文章實測發現,不主動講清楚座標格式,GPT-5.6 可能用它自己習慣的方式回答,跟你預期的對不上,分數直接掉 15 分左右。與其等結果錯了才回頭除錯,不如在提示詞裡把格式講死。
response = client.responses.create( model="gpt-5.6-sol", input=[ {"role": "user", "content": [ {"type": "input_text", "text": prompt}, {"type": "input_image", "image_url": image_path}, ]} ], )
💬 把文字提示跟圖片打包一起送出去,model 指定用視覺能力最強的 Sol。如果照片解析度超過約 2000x2000 像素,文章建議先 resize 過再送,避免大圖片讓模型變不穩定。
boxes = response.output_text print(boxes)
💬 模型會用文字(通常是 JSON 格式)把每一顆藥丸的類別和座標「打字」回來——這也是為什麼物件一多、要生成的文字變長,出錯機率就會提高的原因。

🛠️ 動手做:座標格式對不對,框框差多少?親手試試看

  1. 畫面上有一張假想的「藥丸托盤照片」,上面已經用綠色框標好正確答案(人工標註的藥丸實際位置)。
  2. 頁面下方會顯示 AI 模型回傳的一組原始座標數字,這組數字從頭到尾都沒有變,唯一會變的是「解讀方式」。
  3. 先按下「用 XYXY 絕對像素解讀」,看看紅色框是不是幾乎完全蓋住綠色的正確答案框。
  4. 再按下「用 YXYX 正規化 0-1000 解讀」,觀察同一組數字被錯誤格式解讀後,紅色框跑到哪裡去了——這就是文章說「框框排成怪異的一排、跟實際物件對不上」的真實原因。
👇 下面是活的,直接操作

🧠 工程思維透鏡(資深工程師看到的是什麼)

🔭 為什麼 Roboflow 要自己花力氣做一套基準測試,而不是直接引用 OpenAI 官方公布的數字?
廠商自己公布的成績單,通常是在對自己有利的資料集或情境下測出來的。第三方用同一套基準去比較所有廠牌的模型(包含競爭對手),才能看出真實的相對排名跟弱點。任何要幫團隊「選型」的工程師,都該養成不只看廠商發的成績單、而去找獨立評測的習慣。
🔭 同樣是視覺模型,為什麼有的吃絕對像素、有的吃正規化座標?這種基本的事不是應該早就有業界標準了嗎?
因為 VLM 輸出座標,本質上是「用文字生成數字」,不是傳統 CV 模型那種寫死的固定輸出格式。每家在訓練時餵給模型的座標表示法不同,久而久之就變成各自的「方言」。這代表把系統從 GPT 換成 Gemini(或反過來),不是改一行 model 名稱就好,提示詞裡的座標格式規範也得跟著換——這是做多模型系統時很容易被忽略的整合成本。
🔭 拉高 reasoning effort 讓大圖片偵測更穩定,這筆帳划算嗎?
這是典型的「準確度 vs 成本與延遲」取捨。OpenAI 自己承認大圖片在低推理強度下容易跑掉,拉高能改善,但代價是 token 用量、延遲、費用全部上升。文章給的建議是「先 resize 或裁切圖片」,本質上是用前處理這種便宜的工程手段,去換取不用啟用昂貴的模型設定——遇到問題先想能不能用便宜的方法繞過去,而不是直接砸錢調高參數,是很典型的工程判斷。
🔭 密集場景(藥丸、雞蛋)特別容易出包,這跟「輸出格式」有什麼關係?
因為 VLM 是逐字生成答案,物件越多,代表要生成的文字序列越長。序列越長,語言模型常見的「漂移」問題(複製上一個框、位置微調、標錯類別)就越容易出現。這跟傳統物件偵測器一次性輸出固定維度張量、完全不受物件數量影響的架構完全不同——密集場景表現差,不是模型「看不到」,而是這種文字生成式架構本身帶來的新弱點。

📝 隨堂考(點選答案,立即回饋)

Q1. 在 Roboflow 的測試中,GPT-5.6 Sol 在物件偵測的 mAP@50 分數,相較於 GPT-5.5 進步了多少?
✅ 文章明確寫出 GPT-5.5 是 13.8 分,Sol 達到 46.2 分,是數倍等級的躍進,讓物件偵測從「幾乎不能用」變成「堪用」。
Q2. 文章提到,用錯座標格式(例如該用絕對像素卻用了正規化格式)大概會讓偵測分數掉多少?
✅ 文章寫明用錯座標格式會讓 GPT-5.6 的偵測表現掉大約 15 個 mAP 點,是相當顯著的落差。
Q3. 為什麼像藥丸、雞蛋這種「很多顆擠在一起」的照片,對 VLM 來說特別難框準?
✅ 文章解釋 VLM 是把偵測結果「用文字生成」出來,不像傳統偵測器直接輸出固定維度數字,物件一多、序列變長,漏框、重複框、位置算錯的風險就跟著提高。
Q4. OpenAI 官方對「大圖片時 Sol 偵測不穩定」這個問題,給出的技術解釋和建議做法是什麼?
✅ 文章寫道 OpenAI 團隊向 Roboflow 證實,Sol 在約 2000x2000 像素以上的圖片、且推理強度較低時較不穩定,並建議 resize 或裁切圖片作為更划算的實務解法。
Q5. 這篇文章裡的評測分數,是 OpenAI 官方公布的,還是別的來源測出來的?
✅ 文章一開始就說明,這是 Roboflow 團隊用他們即將發布的 VLM 基準測試出的結果,不是 OpenAI 官方數字,這也是這份評測具有獨立參考價值的原因。

🃏 翻牌記憶卡(先想答案,再點開對答)

VLM點我翻面
能同時讀懂圖片和文字的 AI 模型(Vision Language Model),GPT-5.6、Gemini 都屬於這類模型。
mAP@50點我翻面
衡量物件偵測準不準的分數,50 表示 AI 框的位置只要跟正確答案重疊超過一半就算對;分數越高代表框得越準。
XYXY 絕對座標點我翻面
用「左上角x、左上角y、右下角x、右下角y」四個數字描述框框位置,單位是這張圖片實際的像素數。
YXYX 正規化座標點我翻面
用「上y、左x、下y、右x」四個數字描述框框位置,但數值不是像素,而是換算成 0 到 1000 的比例值,要再乘回圖片實際尺寸才能用。
推理強度(reasoning effort)點我翻面
讓 AI 模型在回答前「多想一下」的設定,調高可以讓答案更穩、更準,但會增加運算時間與費用。
GPT-5.6 三兄弟點我翻面
OpenAI 這次一口氣推出三個模型:Sol(視覺能力最強)、Terra、Luna,視覺分數依序是 Sol > Terra > Luna,但三者都比上一代 GPT-5.5 進步很多。

✅ 離開前自測(全勾=這課真的學會了)

0%