她想用剛上線的 GPT-5.6 Vision API,自動幫忙從藥丸分裝盤的照片抓出每一顆藥丸的位置與數量,取代人工一顆顆數的苦差事
上週 OpenAI 一口氣發布了 GPT-5.6 系列的三個模型:Sol、Terra、Luna。發表會主打的是「電腦操作代理」——讓 AI 自己看畫面、自己點滑鼠操作軟體,還能理解 3D 場景。但不管是操作電腦還是理解 3D,背後都需要一件事:AI 要先「看懂」畫面。像 GPT-5.6 這種能同時讀懂圖片和文字的 VLM能同時讀懂圖片和文字的AI模型,英文全名是Vision Language Model,看得準不準,直接決定了這些花俏功能能不能真的派上用場。
這篇文章的重點,其實不是 OpenAI 自己說的話,而是第三方公司 Roboflow 拿一套自己在開發的評測工具,實際去測這幾個新模型的「視覺實力」。測試涵蓋 物件偵測讓AI在照片裡框出每個物品的位置和種類,像是在照片上畫框框標記、計數、OCR讓AI把照片裡的文字辨識出來變成可以複製貼上的文字,全名是Optical Character Recognition、跟資料擷取四種任務。結果很明顯:在物件偵測這項,用 mAP@50一種評分物件偵測準不準的分數,50表示框框只要跟正確位置重疊超過一半就算對,分數越高代表框得越準 來看,上一代 GPT-5.5 只有 13.8 分,新的 Sol 一口氣衝到 46.2 分,等於是從「幾乎不能用」變成「堪用」的等級。
但這篇文章真正想提醒工程師的,不是這個漂亮的分數,而是「你自己動手套用時會踩到的坑」:不同模型認定 座標系統描述一個點在圖片裡的位置的方式,像是「從左上角量起,右邊多少像素、下面多少像素」 的方式不一樣,而且圖片太大時,模型偵測還會變得不穩定。這些才是佩君這種要真的把它接進工作流程的人,會實際撞到的牆。
| 模型 | mAP@50 分數 | 建議座標格式 |
|---|---|---|
| GPT-5.5 | 13.8 | 文章未特別測試座標格式 |
| GPT-5.6 Sol | 46.2 | 絕對像素、XYXY |
| GPT-5.6 Terra | 44.7 | 絕對像素、XYXY |
| GPT-5.6 Luna | 43.3 | 絕對像素、XYXY |
| Gemini 3.5 Flash | 文中未提供對照分數 | 正規化 0–1000、YXYX |
這段程式示範怎麼呼叫 GPT-5.6,並且在提示詞裡「講清楚座標格式」——這是文章裡最關鍵、也最容易被忽略的一步,佩君第一次踩的坑就是漏了這段。
from openai import OpenAI
client = OpenAI()image_path = "pill_tray.jpg"prompt = (
"請找出圖片中每一顆藥丸的位置。"
"座標請用「絕對像素、XYXY」格式回傳,"
"也就是 [左上x, 左上y, 右下x, 右下y],"
"單位是這張圖片實際的像素數,不要正規化成 0~1000。"
"用 JSON 陣列回傳,每個物件包含 label 與 box。"
)response = client.responses.create(
model="gpt-5.6-sol",
input=[
{"role": "user", "content": [
{"type": "input_text", "text": prompt},
{"type": "input_image", "image_url": image_path},
]}
],
)boxes = response.output_text
print(boxes)