AI 模型效率評量表|不只比聰明,還要算 Token 效率

七個模型,同一份考卷(Artificial Analysis Intelligence Index v4.3.2)。資料擷取:2026-10-08。點任一列看明細。

先說清楚:這次不是我自己實測

這次我沒有先跑自己的任務實測。我把 Artificial Analysis 已經做好、公開的評測中文化,再用我自己看 Token 效率的方式去算:不只比誰聰明,還要看每題實際花多少、要等多久。來源都附在頁面最下方。

我的系統目前都是讓 GPT-6 Luna 去跑,之前實測過,我很滿意。這次 Haiku 5.5 出來,我會再找時間用我的實際任務實測。

先講結論

兩個模型的單價可以一模一樣,實際花費卻差 3 倍。原因是跑同一份考卷,有的模型輸出的 Token 總量多出 3 倍。所以比模型要看三件事:分數、每題實際花多少(單價乘上用掉的 Token)、要等多久。三件事沒有一個模型全拿第一,要依任務分配。
Haiku 5.5 vs GPT-6 Luna單價都是每百萬 Token 輸入 $0.10、輸出 $0.50。在這份評測裡 Haiku 分數高 5 分,但輸出的 Token 總量約 3.1 倍,每題成本 $0.21 對 $0.07。
長文件的價差更大Haiku 5.5 超過 10 萬 Token 單價漲 5 倍;Luna 超過 27.2 萬才加價。例:一次輸入 20 萬 Token、輸出 5 千 Token(不算快取),Haiku 約 $0.113、Luna 約 $0.023,差約 5 倍。
分數最高的最貴也最慢Opus 5.5 分數 58,這七個裡最高,每題成本是 Luna 的 85 倍,首字要等 12 分鐘以上。不是每件事都值得叫它。

速度、價格、準確度評量表

同一條跑道疊三種資訊。
模型長度=分數 粗細=每題成本 圓點=等待時間分數每題成本適合
長條刻度(分)
圓點刻度(秒)

效率排名總表

綠色=該欄第一名。「每 1 美元分數」是我拿來看 Token 效率的比較指標:分數 ÷ 每題成本。

名次只在這七個模型之間比。Artificial Analysis 各模型頁上的名次母數不同(有的寫 /182、有的寫 /225),不能跨頁直接比名次,所以本表只用原始數字重排。

綜合排名:依你的任務調權重

三個面向各自排名,第 1 名得 7 分、第 7 名得 1 分,再乘上權重加總,換算成滿分 100。權重不同,冠軍就不同。

依情境分配任務

情境優先考慮(依這份評測,待我實測)為什麼
大量雜活:搜尋、分類、格式整理GPT-6 Luna每 1 美元分數 543,是第二名的約 2.7 倍。
要準一點的日常工作、寫程式、操作電腦Haiku 5.5平價層裡分數最高(43),每題 $0.21 仍便宜;但 Max 版首字要等 7 分鐘,適合背景跑。
即時對話、要馬上回Gemini 3.8 Flash/Haiku 4.5首字 24 秒、14 秒,等待最短;Haiku 4.5 在這份考卷分數 17,比較適合簡單問答。
長文件:逐字稿、整份資料GPT-6 LunaHaiku 5.5 超過 10 萬 Token 單價漲 5 倍,Luna 到 27.2 萬才加價。
重要判斷、難題、審稿GPT-6 Sol/Sonnet 5.5/Opus 5.5分數 48 到 58。Sol 每題 $1.04,是 Sonnet、Opus 的五分之一左右,先試 Sol,不夠再升級。

怎麼算:以後新模型出來照這四步

  1. 不要只看單價。每百萬 Token 多少錢,只是牌價。
  2. 看它用掉多少 Token。Artificial Analysis 每個模型頁都有「Output tokens from Intelligence Index」,就是跑完整份考卷總共輸出多少 Token。
  3. 算每題實際成本與每 1 美元分數。
    每題實際成本 = 輸入 Token × 輸入單價 + 輸出 Token × 輸出單價(網站已算好「Cost per Intelligence Index task」,本頁直接採用)
    每 1 美元分數 = 分數 ÷ 每題實際成本
    等待時間 = 首字延遲 + 500 ÷ 每秒輸出速度(網站的「端到端回應時間」定義)
  4. 查長文件加價門檻。各家官方定價頁:超過多少 Token 會漲價、漲幾倍。你的工作常丟長文件,這條會改變結論。

資料來源

分數、速度、Token 用量、每題成本、首字延遲:Artificial Analysis 各模型頁(2026-10-08 擷取)。

Haiku 5.5 長文件加價:Claude 官方定價頁。GPT-6 Luna 長文件加價:eesel 定價整理(第三方整理,非 OpenAI 官方頁)。

台幣以 1 美元約 32 元換算。每題成本是 Artificial Analysis 考卷的平均題,實際工作的花費依任務長短不同,請看相對倍數,不要看絕對金額。