正在整理一個 AI agent 專案的 GitHub demo,把跟 Claude、GPT 對話的紀錄丟到 repo 裡當範例
你跟 Claude Opus、GPT 或 Gemini 這類進階模型問比較難的問題時,模型其實會先在背後做一輪 reasoning trace(推理過程)模型回答前,自己內部一步一步「打草稿」思考的完整內容,想清楚了才吐出你看到的答案。但業者不想把這串草稿直接秀給你看——一來怕透露模型是怎麼「想」的商業機密,二來多輪對話要保留脈絡,所以做法是把這串草稿包成一個看不懂的 加密簽章區塊API 回傳裡的一串亂碼,是完整思考內容被鎖起來的版本,理論上只有官方系統看得懂,原封不動地夾在 API軟體之間互相要資料的窗口,你的程式或工具就是透過它跟 OpenAI、Anthropic 的伺服器對話 回傳結果裡,讓你的程式下一輪對話時再交還給模型。
這篇研究做的事,就是把這個『你看不懂』的假設打破:研究團隊寫了一套解碼流程,直接把 OpenAI、Anthropic、Google 三家的加密推理區塊還原成看得懂的文字,而且不只是理論上可行——他們把 GitHub、Hugging Face 上 6,708 份別人公開分享的 AI agent 對話紀錄拿來實測,一口氣還原出 315,320 段推理內容。
更嚴重的是還原出來的內容裡藏著真材實料的個資與機密:704 筆敏感資料,包含 62 組 API 金鑰、33 組密碼、24 組存取權杖、30 個真實 email,還有姓名、地址、內部系統網址。其中 64 筆只出現在隱藏的推理區塊裡,對話畫面上完全看不到——也就是說,就算你自己檢查過、確定公開的對話內容裡沒有洩漏任何東西,藏在背後那段你看不到的『草稿』裡還是可能有金鑰在裸奔。