返回首頁LLM

LLM 模型排名與比較:2026 年主流大型語言模型定價與選型指南

25 min 分鐘閱讀
#LLM#AI 模型#模型評測#GPT-5#Claude#Gemini

LLM 模型排名與比較:2026 年主流大型語言模型定價與選型指南

LLM 模型排名與比較:2026 年主流大型語言模型定價與選型指南

2026 年下半,大型語言模型市場的節奏比年初更快。OpenAI 的 GPT-5.6、Anthropic 的 Claude Fable 5 與 Opus 4.8、Google 的 Gemini 3.6 Flash,加上開源與中國廠商的選項,各家在不同領域各有擅場。

關鍵變化:模型專業化趨勢明顯——沒有單一模型在所有任務上勝出。而且改版速度已經快到「排行榜今天的名次,下個月就換人」的程度,把排名當成長期選型依據,風險比想像中高。

本文整理 2026 年 7 月為止可查證的事實(官方定價、上下文長度、發布與停用時程),幫助你根據實際需求選擇最適合的模型。想深入了解 LLM 的基礎概念,可以先閱讀我們的 LLM 完整指南


關於排行榜分數:本次改版的說明

先講一件我們認為該對讀者交代的事。

本文舊版曾列出「Artificial Analysis 智能指數分數」「SWE-bench Verified 百分比」「ARC-AGI-2 分數」「MMMLU 分數」「Sonar pass rate 與程式碼行數」「繁中能力星等評分」等排名與評分數字。這次改版時我們回頭追查,無法追溯到可查證的一手來源,而且這些數字對應的機種多半已經換代或退役。

基於「不編造、不沿用無來源數據」的原則,這些評分與排名已全數移除,不以任何形式保留。

那要怎麼判斷模型好壞?兩個建議:

  1. 以自身任務實測為準(最準)。拿你真正要跑的資料,用 30~50 筆樣本讓候選模型各跑一輪,比對輸出品質與實際 token 花費。任何公開榜單都取代不了這一步。
  2. 參考公開榜單的即時結果。像 LMArena(真人盲測偏好投票)、Artificial Analysis(綜合指標與速度/成本量測)都會持續更新。本文刻意不引用它們的具體分數——因為我們沒有逐項查證,寫進來就等於要讀者相信一個我們自己沒驗過的數字。

模型排名變動極快,而且高度依賴任務類型:同一個模型在程式碼、長文件摘要、多語言客服上的相對強弱可以完全不同。看到「第一名」時,先問「哪個任務的第一名、什麼時候量的」。


主流模型深度比較

以下定價皆取自各家官方定價頁(查證日期 2026-07-22),單位為每 100 萬 token 的美元價格。

OpenAI GPT-5.6 系列

定位:現行主力世代,一次給三個價格帶

GPT-5.6 於 2026-07-09 GA,分三階:Sol(旗艦)、Terra(平衡)、Luna(高性價比)。

模型Input /1MOutput /1M定位
gpt-5.6-sol$5.00$30.00旗艦
gpt-5.6-terra$2.50$15.00平衡
gpt-5.6-luna$1.00$6.00高性價比

仍在服役的前代:

模型Input /1MOutput /1M
gpt-5.5$5.00$30.00
gpt-5.5-pro$30.00$180.00
gpt-5.4$2.50$15.00
gpt-5.4-mini$0.75$4.50
gpt-5.4-nano$0.20$1.25
gpt-5.4-pro$30.00$180.00

計價機制:Batch 約 5 折;Priority(優先處理)為標準價的 2~4 倍。

注意:本文舊版提到的 GPT-4o 已非現行機種,新專案選型不應再列入;既有專案若還掛在 GPT-4o 上,建議排入遷移評估。內部推理(thinking)tokens 仍會計費,長分析任務要另外估。

適用場景:需要完整生態系與企業支援、推理與數學為主的任務。

Anthropic Claude 系列

定位:程式碼與長文件的主力選項,並新增 Opus 之上的 Mythos 級

模型Input /1MOutput /1M備註
Claude Fable 5$10$50公開販售最高階(Mythos 級)
Claude Mythos 5$10$50限量開放
Claude Opus 4.8$5$25旗艦
Claude Opus 4.7 / 4.6 / 4.5$5$25
Claude Opus 4.1$15$75已 deprecated
Claude Sonnet 5$2$10導入優惠,至 2026-08-31
Claude Sonnet 5(2026-09-01 起)$3$15標準價
Claude Sonnet 4.6 / 4.5$3$15
Claude Haiku 4.5$1$5
Claude Haiku 3.5$0.80$4已退役(僅 Bedrock/GCP 仍可用)

三個實務上一定要知道的點

  1. 新 tokenizer 會讓帳單膨脹。Opus 4.7 以後、Fable 5、Mythos 5、Sonnet 5 使用新 tokenizer,同一段文字約多產生 30% token。這代表你不能只比單價——從舊代遷移過來時,實際成本是「費率變化 × 約 1.3 的 token 膨脹」。做跨模型、跨廠商比較時,這是最容易被忽略的一項。
  2. 100 萬 token 上下文內含不加價。Fable 5、Mythos 5、Opus 4.8/4.7/4.6、Sonnet 5、Sonnet 4.6 皆內含 100 萬 token 上下文,且以標準價計費,沒有長上下文加價。
  3. 省錢機制:Prompt caching 為 5 分鐘寫入 1.25x、1 小時寫入 2x、快取命中 0.1x;Batch API input/output 均 5 折;Web search 為 $10/1,000 次搜尋。

已退役/淘汰:Opus 4、Sonnet 4、Haiku 3.5(部分雲平台仍可用),Opus 4.1 已標記 deprecated——還在用這幾個型號的專案應排入遷移

適用場景:程式碼開發與審查、長文件分析、需要穩定輸出品質的內容任務。

Google Gemini 系列

定位:價格帶最廣,高吞吐與低成本選項最多

模型Input /1MOutput /1M
Gemini 3.6 Flash$1.50$7.50
Gemini 3.5 Flash$1.50$9.00
Gemini 3.5 Flash-Lite$0.30$2.50
Gemini 3.1 Flash-Lite$0.25(音訊 $0.50)$1.50
Gemini 3.1 Pro Preview$2.00(≤200k)/$4.00(>200k)$12.00(≤200k)/$18.00(>200k)
Gemini 3 Flash Preview$0.50$3.00
Gemini 2.5 Pro$1.25(≤200k)/$2.50(>200k)$10.00(≤200k)/$15.00(>200k)
Gemini 2.5 Flash$0.30$2.50
Gemini 2.5 Flash-Lite$0.10$0.40
Gemini Embedding$0.15

2026-07-21 最新發布(Gemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber):

  • Gemini 3.6 Flash:官方說明輸出 token 較 3.5 Flash 少 17%——同樣任務的輸出計費量會下降
  • Gemini 3.5 Flash-Lite:官方引用 Artificial Analysis 的量測為每秒 350 output token,適合高吞吐批次
  • Gemini 3.5 Flash Cyber:資安專用,僅限政府與信任夥伴透過 CodeMender 試點,無公開定價
  • Gemini 3.5 Pro 仍未發布(內部延遲),Google 已開始 pre-train Gemini 4

已停用時程(很重要)

  • Gemini 2.0 Flash、2.0 Flash-Lite → 2026-06-01 已關閉
  • Veo 2 / Veo 3 → 2026-06-30 已關閉
  • Imagen 4 → 2026-08-17 將關閉(還在用的要盡快遷移)

免費額度:Google 已不再公佈固定數字。官方速率限制頁寫明依帳號使用層級而定,需登入 AI Studio 查詢自己帳號的實際額度。網路上流傳的「每分鐘 N 次、每日 N 萬 token」之類的固定數字都已不適用。影像/影片生成類與 Pro Preview 系列無免費層級。

適用場景:多模態應用、高吞吐低成本批次、已在使用 Google Cloud 的團隊。

其他選項:DeepSeek、xAI Grok、Meta Llama

這三家我們這次沒有查證官方定價頁,因此本文不列出任何價格數字與版本號,避免寫出過期資訊。以下僅為方向性說明,實際型號與費率請以各家官網為準:

  • DeepSeek:以極具競爭力的價格提供接近主流閉源模型的效能,中文能力佳,有開源版本。需評估資料處理地點與企業合規要求。
  • xAI Grok:主打低價位與 X(Twitter)即時資訊存取,生態系相對年輕。
  • Meta Llama:開源路線,可本地部署、可自由微調,適合資料敏感或需要完全控制權的團隊;代價是要自行維運、缺乏官方技術支援。

依任務選模型(2026 年版)

以下是質性建議,不含量化評分——請把它當成「先試哪幾個」的縮小範圍工具,最終仍以你自己的實測結果為準。

程式碼生成與除錯

先試:Claude Sonnet 5(日常開發)→ Claude Opus 4.8(複雜專案)→ Claude Fable 5(大型重構、跨庫遷移等前沿難度任務)

Sonnet 5 在 2026-08-31 前是導入優惠價($2/$10),是目前性價比很突出的日常開發選項;優惠後回到 $3/$15 仍屬合理帶。GPT-5.6 Terra 值得一併納入比較。

複雜推理與邏輯分析

先試:GPT-5.6 Sol、Claude Opus 4.8、Gemini 3.1 Pro Preview

這類任務的內部推理 tokens 佔比高,估成本時務必把 thinking tokens 算進去,否則試算會嚴重低估。

多模態應用(圖文整合)

先試:Gemini 3.1 Pro Preview、Gemini 3.6 Flash、Claude Opus 4.8

Gemini 的原生多模態設計在圖文整合上通常最順;需要細緻圖像邏輯理解時再拉 Claude 進來比。

長文本處理

先試:Claude(Fable 5/Opus 4.8/Sonnet 5,皆內含 100 萬 token 上下文且不加價)、Gemini 3.1 Pro Preview

差異在計費結構:Claude 的 100 萬 token 上下文不加價;Gemini 3.1 Pro Preview 與 2.5 Pro 則以 200k 為界分級計價,超過 200k 後 input/output 單價都會跳一階。長文件量大時,這個結構差異比單價差異更影響總帳。

高吞吐批次與預算敏感專案

先試:Gemini 3.5 Flash-Lite、Gemini 2.5 Flash-Lite、GPT-5.4-nano、GPT-5.6 Luna、Claude Haiku 4.5

非即時任務一律走 Batch API(OpenAI 約 5 折、Anthropic input/output 均 5 折),這是最無痛的省錢動作。

繁體中文與跨語言任務

三家主力機種的繁中處理能力都已在可用水準以上,差異多半出在台灣在地用語與專業術語,而不是基本語言能力。這一項沒有公開榜單可以代勞,強烈建議用自家語料實測——這也是我們移除舊版繁中星等評分表的原因(那張表沒有可查證的評測方法與來源)。


價格與效能權衡

Token 價格總表(2026-07-22,取自官方定價頁)

廠商模型Input /1MOutput /1M
OpenAIgpt-5.6-sol$5.00$30.00
OpenAIgpt-5.6-terra$2.50$15.00
OpenAIgpt-5.6-luna$1.00$6.00
OpenAIgpt-5.4-mini$0.75$4.50
OpenAIgpt-5.4-nano$0.20$1.25
AnthropicClaude Fable 5$10$50
AnthropicClaude Opus 4.8$5$25
AnthropicClaude Sonnet 5(優惠至 2026-08-31)$2$10
AnthropicClaude Sonnet 5(2026-09-01 起)$3$15
AnthropicClaude Haiku 4.5$1$5
GoogleGemini 3.6 Flash$1.50$7.50
GoogleGemini 3.5 Flash-Lite$0.30$2.50
GoogleGemini 3.1 Pro Preview$2.00(≤200k)/$4.00(>200k)$12.00(≤200k)/$18.00(>200k)
GoogleGemini 2.5 Flash-Lite$0.10$0.40

上下文長度只在官方定價頁有明載時才列出:Claude 的 Fable 5、Mythos 5、Opus 4.8/4.7/4.6、Sonnet 5、Sonnet 4.6 內含 100 萬 token 且不加價;其餘機種的上下文上限請查各家官方文件。

若要換算台幣,以 1 美元約 32 元估算,實際依匯率與手續費而異。

為什麼移除了「10M tokens 成本比較」表

舊版有一張「跑 10M tokens 各要多少錢」的總成本表。這次移除,原因有二:

  1. 那張表沒有交代 input/output 的比例假設,而不同比例算出來的總額可以差好幾倍——看起來精確,實際上不可比。
  2. 表中多個機種已退役或換代。

正確做法:拿你自己工作負載的 input/output 實際比例,套上面那張官方單價表自行試算,並記得把 Claude 新 tokenizer 的約 30% token 膨脹、以及推理型模型的 thinking tokens 一併算進去。

成本優化策略(2026 年版)

  1. 智能路由(Model Routing):依任務複雜度自動分流
    • 簡單問答/分類:Gemini Flash-Lite 系列、GPT-5.4-nano、Claude Haiku 4.5
    • 程式碼任務:Claude Sonnet 5
    • 複雜推理:GPT-5.6 Sol / Claude Opus 4.8
  2. 內部 tokens(thinking tokens):推理型模型在回答前的「思考」也計費,長分析任務成本可能大幅增加
  3. Prompt 快取:Claude 為 5 分鐘寫入 1.25x、1 小時寫入 2x、命中僅 0.1x,重複前綴(系統提示、知識庫片段)多的場景效益最大
  4. 批次處理:非即時任務走 Batch API,OpenAI 約 5 折、Anthropic input/output 均 5 折
  5. tokenizer 膨脹係數:跨代遷移 Claude 時,把約 30% 的 token 增量放進試算,否則會低估帳單
  6. 成本監控:建立用量監控與上限警報,避免意外超支

台灣企業選型建議

繁體中文能力怎麼評估

舊版這裡有一張星等評分表(★★★★★ 那種),因為沒有可查證的評測方法與來源,已經移除。改以做法取代結論:

  • 準備 30~50 筆你自己的真實語料(客服對話、產品文案、法規條文皆可)
  • 讓候選模型各跑一輪,同一批人盲測評分
  • 重點看三件事:台灣在地用語(而非中國用語)、專業術語準確度、長句與語氣的自然度
  • 把同一批樣本的實際 token 消耗記下來,才知道真實單位成本

合規與資料落地考量

對於金融、醫療、政府等受監管產業,選型時需額外考慮:

使用雲端 API 時

  • 確認資料處理地點(主流 API 資料處理多在美國)
  • 檢視服務條款關於資料使用的規定
  • 評估是否需要簽署企業版服務協議(BAA、DPA)

需要資料落地時

  • 考慮 Azure OpenAI(有亞洲區域選項)
  • 評估 Llama 系列本地部署方案
  • 關注 Taiwan LLM 如 TAIDE 的發展

2026 年推薦組合

程式碼輔助開發

  • 主力:Claude Sonnet 5
  • 複雜專案:Claude Opus 4.8;前沿難度任務再評估 Fable 5

客服對話機器人

  • 主力:Claude Sonnet 5
  • 成本敏感:Claude Haiku 4.5 或 Gemini 3.5 Flash-Lite

企業知識庫問答

多模態應用(圖文整合)

  • 主力:Gemini 3.1 Pro Preview
  • 成本取向:Gemini 3.6 Flash

文件摘要與分析

  • 長文件:Claude Opus 4.8 / Sonnet 5(100 萬 token 上下文不加價)
  • 成本敏感:Gemini 3.5 Flash-Lite

預算優先專案

  • 主力:Gemini 3.5 Flash-Lite / 2.5 Flash-Lite
  • 備援:GPT-5.4-nano、Claude Haiku 4.5

遷移待辦清單(現在就該排)

  • GPT-4o → GPT-5.6 系列
  • Claude Opus 4.1(已 deprecated)、Haiku 3.5(已退役)→ Opus 4.8 / Haiku 4.5
  • Gemini 2.0 Flash / 2.0 Flash-Lite(2026-06-01 已停用)→ Gemini 3.x Flash 系列
  • Imagen 4(2026-08-17 關閉)→ 依 Google 官方遷移指引處理

常見問題 FAQ

Q1:2026 年最該學哪個模型的 API?

建議從 Claude 和 OpenAI 兩家開始。Claude 的程式碼能力與長上下文條件(100 萬 token 不加價)對開發者友善;OpenAI 的生態系最完整,企業支援最成熟。Gemini 適合已經在使用 Google 雲端服務、或需要極低單價高吞吐的團隊。

Q2:為什麼這篇不給模型排名分數?

因為我們拿不出可查證的一手來源。模型換代速度極快,一個三個月前的榜單分數,對應的機種可能已經退役;而排名又高度依賴任務類型,「綜合第一名」在你的實際任務上未必第一。與其給一個看起來精確、實際上無法追溯的數字,不如老實說:用自己的資料實測,或去 LMArena、Artificial Analysis 這類公開榜單看即時結果。

Q3:多模型混用策略在 2026 年更重要嗎?

是的。由於沒有單一模型在所有任務上勝出,現代 AI 系統傾向採用「智能路由」策略——依任務類型與複雜度把請求分流到不同模型與價格帶。這需要更複雜的架構,但能達到最佳的性價比。

Q4:內部推理 tokens 是什麼?會影響成本嗎?

推理型模型在回答前會先進行內部「思考」,這些思考過程產生的 tokens 也會計費。在長分析任務中,這可能大幅增加成本。建議:

  • 監控實際 token 使用量
  • 簡單任務改用不帶思考功能、或較低階的機種
  • 設定成本上限警報

Q5:聽說 Claude 換了 tokenizer,這對我有什麼影響?

有,而且是直接影響帳單。Opus 4.7 以後、Fable 5、Mythos 5、Sonnet 5 使用新 tokenizer,同一段文字約多產生 30% token。所以:

  • 從舊代 Claude 遷移時,即使費率沒漲,帳單也可能上升
  • 跨模型比較單價會失真——$3/1M 的 A 模型和 $3/1M 的 B 模型,若 tokenizer 不同,跑同一份文件的實際花費就不同
  • 正確做法是拿同一批樣本實測「這份工作實際花多少錢」,而不是比每 100 萬 token 的牌價

Q6:開源模型什麼時候能追上閉源模型?

差距持續縮小,但頂尖效能仍由閉源模型把持,特別是需要大量算力訓練的推理任務。對於資料敏感或需要完全控制的場景,開源模型仍是很好的選擇。若考慮本地部署,可參考 LLM API 與本地部署指南


結語

2026 年的 LLM 市場已經進入專業化時代,也進入了「換代比你重寫文件還快」的時代。與其追排行榜名次,不如建立三個習慣:

  1. 根據核心需求圈出 2~3 個候選模型,用自己的資料實測後再定案
  2. 建立智能路由架構,針對不同任務使用不同價格帶的模型
  3. 定期(每季)重新檢查兩件事:有沒有更划算的新機種、現用機種有沒有被排入停用時程

第 3 點在今年格外重要——Gemini 2.0 Flash 已於 2026-06-01 關閉、Imagen 4 將於 2026-08-17 關閉、Claude Opus 4.1 已標記 deprecated,這些都是會直接讓服務中斷的變動。

還在猶豫選哪個模型?免費諮詢,告訴我們你的需求,我們幫你分析最適合的方案。


參考資料

公開榜單(本文不引用其具體分數,請直接查看即時結果):LMArena、Artificial Analysis。

延伸閱讀

需要專業的雲端建議?

無論您正在評估雲平台、優化現有架構,或尋找節費方案,我們都能提供協助

預約免費諮詢

相關文章