OpenAI 最新向開發者表示,只要刪走 system prompt 入面重複、過細的規則,內部程式評測分數最高可升約 15%,同時 token 用量可減少多達 66%。
重點摘要:
- GPT-5.6 提示指南建議先清楚定義期望結果及停止條件,再交由模型自行揀選解題路徑。
- 內部多輪 coding-agent 測試發現,更精簡的 system prompt 可令評分提升約 10% 至 15%,token 用量減少約 41% 至 66%,成本下降約 33% 至 67%。
- 新文件新增 Programmatic Tool Calling 及 text.verbosity 設定,以前 GPT-5 的官方指南並未涵蓋。
OpenAI 重寫 GPT-5 提示「玩法」
OpenAI 連同 GPT-5.6 模型系列 一併公開新指引。GPT-5.6 已於 7 月 9 日正式全面開放,今次文件主要針對透過 API 使用模型、以及營運自動化代理(agent)的團隊。
文件建議工程師撰寫提示時,只需清楚列出:
- 用戶實際會見到的最終結果;
- 需要遵守的約束;
- 已知或可用的證據;
- 什麼情況可以視為「完成」。
其餘讓模型自行決定最有效率的解決路線。OpenAI 將這種寫法稱為「結果優先提示」(outcome-first prompting)。
這套做法與 2025 年 8 月發佈的 GPT-5 指南幾乎南轅北轍。當時官方大力推介:
- 以 XML 儲存長期指令;
- 極為詳盡的情境蒐集模板;
- 在工具呼叫前加長篇 preamble,逐步「旁白」每個步驟。
最新指引則幾乎將上述設計全部視為「雜訊」,會拉低效率及表現。
OpenAI 亦提醒,像「必定」、「絕不」這類絕對語氣的規則,應只保留在真正不可違反的地方,例如安全底線、必填欄位、以及必須嚴禁的行為。像「先問再做」、「必須等批准」等重複指令,反而會令模型不斷發出多餘的批准請求,即使那是安全而且預期中的操作。當多條規則互相衝突時,比起欠缺細節,更容易令系統行為不穩定。
延伸閱讀:道奇隊相關押注飆至 6,800 萬美元,Polymarket 與 Kalshi 押注美職季後賽
Simon Willison:GPT-5.6 工具呼叫與多代理最具看點
獨立開發者 Simon Willison 在個人網站撰文指出,今次更新中最值得留意的是 Programmatic Tool Calling 以及對多代理(multi-agent)的支援。這個功能容許模型自行撰寫及執行 JavaScript,協調多個工具呼叫的流程。
他同時表示,GPT-5.6 中的 Sol 模型在實際複雜程式工作上表現稱職,但並未在他測試的一些難度較高任務上,明顯壓倒 Anthropic 的 Claude Fable 5。
成本是這份指南之所以重要的第二個原因。根據 OpenAI 的內部測試:
- token 用量平均大幅下降約 41% 至 66%;
- 對應的開支則下降約 33% 至 67%。
這些數字,按 相關分析所言,足以改寫任何大規模 agent 系統的成本模型。
不過 OpenAI 亦明言,這些結果高度依賴實際工作負載,應視作「方向性參考」,並強烈建議開發者以自己應用程式中具代表性的任務重新驗證。
GPT-5.6 系列延續急速發佈節奏
GPT-5.6 已推出三款型號:Luna、Terra 及 Sol。輸入定價分別為每百萬 token 1 美元、2.5 美元及 5 美元,輸出則為 6 美元、15 美元及 30 美元。官方同時加入 text.verbosity 選項,用以控制模型回答長度。
今次指引「反轉」方向,其實沿自一個漸進的模式。2026 年 4 月的 GPT-5.5 指引已經叫團隊重新設計 prompt,而非將舊版硬搬上新模型;反之,2025 年 8 月的 GPT-5 指南則要求在提示中加上更多「護欄」,限制模型過度主動。
幾次版本更替下來,OpenAI 一路引導開發者寫得更少、交更多決策路線給模型處理。






