LLM 模型排名與比較:2026 年主流大型語言模型定價與選型指南

LLM 模型排名與比較:2026 年主流大型語言模型定價與選型指南
2026 年下半,大型語言模型市場的節奏比年初更快。OpenAI 的 GPT-5.6、Anthropic 的 Claude Fable 5 與 Opus 4.8、Google 的 Gemini 3.6 Flash,加上開源與中國廠商的選項,各家在不同領域各有擅場。
關鍵變化:模型專業化趨勢明顯——沒有單一模型在所有任務上勝出。而且改版速度已經快到「排行榜今天的名次,下個月就換人」的程度,把排名當成長期選型依據,風險比想像中高。
本文整理 2026 年 7 月為止可查證的事實(官方定價、上下文長度、發布與停用時程),幫助你根據實際需求選擇最適合的模型。想深入了解 LLM 的基礎概念,可以先閱讀我們的 LLM 完整指南。
關於排行榜分數:本次改版的說明
先講一件我們認為該對讀者交代的事。
本文舊版曾列出「Artificial Analysis 智能指數分數」「SWE-bench Verified 百分比」「ARC-AGI-2 分數」「MMMLU 分數」「Sonar pass rate 與程式碼行數」「繁中能力星等評分」等排名與評分數字。這次改版時我們回頭追查,無法追溯到可查證的一手來源,而且這些數字對應的機種多半已經換代或退役。
基於「不編造、不沿用無來源數據」的原則,這些評分與排名已全數移除,不以任何形式保留。
那要怎麼判斷模型好壞?兩個建議:
- 以自身任務實測為準(最準)。拿你真正要跑的資料,用 30~50 筆樣本讓候選模型各跑一輪,比對輸出品質與實際 token 花費。任何公開榜單都取代不了這一步。
- 參考公開榜單的即時結果。像 LMArena(真人盲測偏好投票)、Artificial Analysis(綜合指標與速度/成本量測)都會持續更新。本文刻意不引用它們的具體分數——因為我們沒有逐項查證,寫進來就等於要讀者相信一個我們自己沒驗過的數字。
模型排名變動極快,而且高度依賴任務類型:同一個模型在程式碼、長文件摘要、多語言客服上的相對強弱可以完全不同。看到「第一名」時,先問「哪個任務的第一名、什麼時候量的」。
主流模型深度比較
以下定價皆取自各家官方定價頁(查證日期 2026-07-22),單位為每 100 萬 token 的美元價格。
OpenAI GPT-5.6 系列
定位:現行主力世代,一次給三個價格帶
GPT-5.6 於 2026-07-09 GA,分三階:Sol(旗艦)、Terra(平衡)、Luna(高性價比)。
| 模型 | Input /1M | Output /1M | 定位 |
|---|---|---|---|
| gpt-5.6-sol | $5.00 | $30.00 | 旗艦 |
| gpt-5.6-terra | $2.50 | $15.00 | 平衡 |
| gpt-5.6-luna | $1.00 | $6.00 | 高性價比 |
仍在服役的前代:
| 模型 | Input /1M | Output /1M |
|---|---|---|
| gpt-5.5 | $5.00 | $30.00 |
| gpt-5.5-pro | $30.00 | $180.00 |
| gpt-5.4 | $2.50 | $15.00 |
| gpt-5.4-mini | $0.75 | $4.50 |
| gpt-5.4-nano | $0.20 | $1.25 |
| gpt-5.4-pro | $30.00 | $180.00 |
計價機制:Batch 約 5 折;Priority(優先處理)為標準價的 2~4 倍。
注意:本文舊版提到的 GPT-4o 已非現行機種,新專案選型不應再列入;既有專案若還掛在 GPT-4o 上,建議排入遷移評估。內部推理(thinking)tokens 仍會計費,長分析任務要另外估。
適用場景:需要完整生態系與企業支援、推理與數學為主的任務。
Anthropic Claude 系列
定位:程式碼與長文件的主力選項,並新增 Opus 之上的 Mythos 級
| 模型 | Input /1M | Output /1M | 備註 |
|---|---|---|---|
| Claude Fable 5 | $10 | $50 | 公開販售最高階(Mythos 級) |
| Claude Mythos 5 | $10 | $50 | 限量開放 |
| Claude Opus 4.8 | $5 | $25 | 旗艦 |
| Claude Opus 4.7 / 4.6 / 4.5 | $5 | $25 | |
| Claude Opus 4.1 | $15 | $75 | 已 deprecated |
| Claude Sonnet 5 | $2 | $10 | 導入優惠,至 2026-08-31 |
| Claude Sonnet 5(2026-09-01 起) | $3 | $15 | 標準價 |
| Claude Sonnet 4.6 / 4.5 | $3 | $15 | |
| Claude Haiku 4.5 | $1 | $5 | |
| Claude Haiku 3.5 | $0.80 | $4 | 已退役(僅 Bedrock/GCP 仍可用) |
三個實務上一定要知道的點:
- 新 tokenizer 會讓帳單膨脹。Opus 4.7 以後、Fable 5、Mythos 5、Sonnet 5 使用新 tokenizer,同一段文字約多產生 30% token。這代表你不能只比單價——從舊代遷移過來時,實際成本是「費率變化 × 約 1.3 的 token 膨脹」。做跨模型、跨廠商比較時,這是最容易被忽略的一項。
- 100 萬 token 上下文內含不加價。Fable 5、Mythos 5、Opus 4.8/4.7/4.6、Sonnet 5、Sonnet 4.6 皆內含 100 萬 token 上下文,且以標準價計費,沒有長上下文加價。
- 省錢機制:Prompt caching 為 5 分鐘寫入 1.25x、1 小時寫入 2x、快取命中 0.1x;Batch API input/output 均 5 折;Web search 為 $10/1,000 次搜尋。
已退役/淘汰:Opus 4、Sonnet 4、Haiku 3.5(部分雲平台仍可用),Opus 4.1 已標記 deprecated——還在用這幾個型號的專案應排入遷移。
適用場景:程式碼開發與審查、長文件分析、需要穩定輸出品質的內容任務。
Google Gemini 系列
定位:價格帶最廣,高吞吐與低成本選項最多
| 模型 | Input /1M | Output /1M |
|---|---|---|
| Gemini 3.6 Flash | $1.50 | $7.50 |
| Gemini 3.5 Flash | $1.50 | $9.00 |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 |
| Gemini 3.1 Flash-Lite | $0.25(音訊 $0.50) | $1.50 |
| Gemini 3.1 Pro Preview | $2.00(≤200k)/$4.00(>200k) | $12.00(≤200k)/$18.00(>200k) |
| Gemini 3 Flash Preview | $0.50 | $3.00 |
| Gemini 2.5 Pro | $1.25(≤200k)/$2.50(>200k) | $10.00(≤200k)/$15.00(>200k) |
| Gemini 2.5 Flash | $0.30 | $2.50 |
| Gemini 2.5 Flash-Lite | $0.10 | $0.40 |
| Gemini Embedding | $0.15 | — |
2026-07-21 最新發布(Gemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber):
- Gemini 3.6 Flash:官方說明輸出 token 較 3.5 Flash 少 17%——同樣任務的輸出計費量會下降
- Gemini 3.5 Flash-Lite:官方引用 Artificial Analysis 的量測為每秒 350 output token,適合高吞吐批次
- Gemini 3.5 Flash Cyber:資安專用,僅限政府與信任夥伴透過 CodeMender 試點,無公開定價
- Gemini 3.5 Pro 仍未發布(內部延遲),Google 已開始 pre-train Gemini 4
已停用時程(很重要):
- Gemini 2.0 Flash、2.0 Flash-Lite → 2026-06-01 已關閉
- Veo 2 / Veo 3 → 2026-06-30 已關閉
- Imagen 4 → 2026-08-17 將關閉(還在用的要盡快遷移)
免費額度:Google 已不再公佈固定數字。官方速率限制頁寫明依帳號使用層級而定,需登入 AI Studio 查詢自己帳號的實際額度。網路上流傳的「每分鐘 N 次、每日 N 萬 token」之類的固定數字都已不適用。影像/影片生成類與 Pro Preview 系列無免費層級。
適用場景:多模態應用、高吞吐低成本批次、已在使用 Google Cloud 的團隊。
其他選項:DeepSeek、xAI Grok、Meta Llama
這三家我們這次沒有查證官方定價頁,因此本文不列出任何價格數字與版本號,避免寫出過期資訊。以下僅為方向性說明,實際型號與費率請以各家官網為準:
- DeepSeek:以極具競爭力的價格提供接近主流閉源模型的效能,中文能力佳,有開源版本。需評估資料處理地點與企業合規要求。
- xAI Grok:主打低價位與 X(Twitter)即時資訊存取,生態系相對年輕。
- Meta Llama:開源路線,可本地部署、可自由微調,適合資料敏感或需要完全控制權的團隊;代價是要自行維運、缺乏官方技術支援。
依任務選模型(2026 年版)
以下是質性建議,不含量化評分——請把它當成「先試哪幾個」的縮小範圍工具,最終仍以你自己的實測結果為準。
程式碼生成與除錯
先試:Claude Sonnet 5(日常開發)→ Claude Opus 4.8(複雜專案)→ Claude Fable 5(大型重構、跨庫遷移等前沿難度任務)
Sonnet 5 在 2026-08-31 前是導入優惠價($2/$10),是目前性價比很突出的日常開發選項;優惠後回到 $3/$15 仍屬合理帶。GPT-5.6 Terra 值得一併納入比較。
複雜推理與邏輯分析
先試:GPT-5.6 Sol、Claude Opus 4.8、Gemini 3.1 Pro Preview
這類任務的內部推理 tokens 佔比高,估成本時務必把 thinking tokens 算進去,否則試算會嚴重低估。
多模態應用(圖文整合)
先試:Gemini 3.1 Pro Preview、Gemini 3.6 Flash、Claude Opus 4.8
Gemini 的原生多模態設計在圖文整合上通常最順;需要細緻圖像邏輯理解時再拉 Claude 進來比。
長文本處理
先試:Claude(Fable 5/Opus 4.8/Sonnet 5,皆內含 100 萬 token 上下文且不加價)、Gemini 3.1 Pro Preview
差異在計費結構:Claude 的 100 萬 token 上下文不加價;Gemini 3.1 Pro Preview 與 2.5 Pro 則以 200k 為界分級計價,超過 200k 後 input/output 單價都會跳一階。長文件量大時,這個結構差異比單價差異更影響總帳。
高吞吐批次與預算敏感專案
先試:Gemini 3.5 Flash-Lite、Gemini 2.5 Flash-Lite、GPT-5.4-nano、GPT-5.6 Luna、Claude Haiku 4.5
非即時任務一律走 Batch API(OpenAI 約 5 折、Anthropic input/output 均 5 折),這是最無痛的省錢動作。
繁體中文與跨語言任務
三家主力機種的繁中處理能力都已在可用水準以上,差異多半出在台灣在地用語與專業術語,而不是基本語言能力。這一項沒有公開榜單可以代勞,強烈建議用自家語料實測——這也是我們移除舊版繁中星等評分表的原因(那張表沒有可查證的評測方法與來源)。
價格與效能權衡
Token 價格總表(2026-07-22,取自官方定價頁)
| 廠商 | 模型 | Input /1M | Output /1M |
|---|---|---|---|
| OpenAI | gpt-5.6-sol | $5.00 | $30.00 |
| OpenAI | gpt-5.6-terra | $2.50 | $15.00 |
| OpenAI | gpt-5.6-luna | $1.00 | $6.00 |
| OpenAI | gpt-5.4-mini | $0.75 | $4.50 |
| OpenAI | gpt-5.4-nano | $0.20 | $1.25 |
| Anthropic | Claude Fable 5 | $10 | $50 |
| Anthropic | Claude Opus 4.8 | $5 | $25 |
| Anthropic | Claude Sonnet 5(優惠至 2026-08-31) | $2 | $10 |
| Anthropic | Claude Sonnet 5(2026-09-01 起) | $3 | $15 |
| Anthropic | Claude Haiku 4.5 | $1 | $5 |
| Gemini 3.6 Flash | $1.50 | $7.50 | |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | |
| Gemini 3.1 Pro Preview | $2.00(≤200k)/$4.00(>200k) | $12.00(≤200k)/$18.00(>200k) | |
| Gemini 2.5 Flash-Lite | $0.10 | $0.40 |
上下文長度只在官方定價頁有明載時才列出:Claude 的 Fable 5、Mythos 5、Opus 4.8/4.7/4.6、Sonnet 5、Sonnet 4.6 內含 100 萬 token 且不加價;其餘機種的上下文上限請查各家官方文件。
若要換算台幣,以 1 美元約 32 元估算,實際依匯率與手續費而異。
為什麼移除了「10M tokens 成本比較」表
舊版有一張「跑 10M tokens 各要多少錢」的總成本表。這次移除,原因有二:
- 那張表沒有交代 input/output 的比例假設,而不同比例算出來的總額可以差好幾倍——看起來精確,實際上不可比。
- 表中多個機種已退役或換代。
正確做法:拿你自己工作負載的 input/output 實際比例,套上面那張官方單價表自行試算,並記得把 Claude 新 tokenizer 的約 30% token 膨脹、以及推理型模型的 thinking tokens 一併算進去。
成本優化策略(2026 年版)
- 智能路由(Model Routing):依任務複雜度自動分流
- 簡單問答/分類:Gemini Flash-Lite 系列、GPT-5.4-nano、Claude Haiku 4.5
- 程式碼任務:Claude Sonnet 5
- 複雜推理:GPT-5.6 Sol / Claude Opus 4.8
- 內部 tokens(thinking tokens):推理型模型在回答前的「思考」也計費,長分析任務成本可能大幅增加
- Prompt 快取:Claude 為 5 分鐘寫入 1.25x、1 小時寫入 2x、命中僅 0.1x,重複前綴(系統提示、知識庫片段)多的場景效益最大
- 批次處理:非即時任務走 Batch API,OpenAI 約 5 折、Anthropic input/output 均 5 折
- tokenizer 膨脹係數:跨代遷移 Claude 時,把約 30% 的 token 增量放進試算,否則會低估帳單
- 成本監控:建立用量監控與上限警報,避免意外超支
台灣企業選型建議
繁體中文能力怎麼評估
舊版這裡有一張星等評分表(★★★★★ 那種),因為沒有可查證的評測方法與來源,已經移除。改以做法取代結論:
- 準備 30~50 筆你自己的真實語料(客服對話、產品文案、法規條文皆可)
- 讓候選模型各跑一輪,同一批人盲測評分
- 重點看三件事:台灣在地用語(而非中國用語)、專業術語準確度、長句與語氣的自然度
- 把同一批樣本的實際 token 消耗記下來,才知道真實單位成本
合規與資料落地考量
對於金融、醫療、政府等受監管產業,選型時需額外考慮:
使用雲端 API 時:
- 確認資料處理地點(主流 API 資料處理多在美國)
- 檢視服務條款關於資料使用的規定
- 評估是否需要簽署企業版服務協議(BAA、DPA)
需要資料落地時:
- 考慮 Azure OpenAI(有亞洲區域選項)
- 評估 Llama 系列本地部署方案
- 關注 Taiwan LLM 如 TAIDE 的發展
2026 年推薦組合
程式碼輔助開發:
- 主力:Claude Sonnet 5
- 複雜專案:Claude Opus 4.8;前沿難度任務再評估 Fable 5
客服對話機器人:
- 主力:Claude Sonnet 5
- 成本敏感:Claude Haiku 4.5 或 Gemini 3.5 Flash-Lite
企業知識庫問答:
- 主力:GPT-5.6 Terra/Sol + RAG 架構
- 可搭配參考:RAG 完整指南
多模態應用(圖文整合):
- 主力:Gemini 3.1 Pro Preview
- 成本取向:Gemini 3.6 Flash
文件摘要與分析:
- 長文件:Claude Opus 4.8 / Sonnet 5(100 萬 token 上下文不加價)
- 成本敏感:Gemini 3.5 Flash-Lite
預算優先專案:
- 主力:Gemini 3.5 Flash-Lite / 2.5 Flash-Lite
- 備援:GPT-5.4-nano、Claude Haiku 4.5
遷移待辦清單(現在就該排):
- GPT-4o → GPT-5.6 系列
- Claude Opus 4.1(已 deprecated)、Haiku 3.5(已退役)→ Opus 4.8 / Haiku 4.5
- Gemini 2.0 Flash / 2.0 Flash-Lite(2026-06-01 已停用)→ Gemini 3.x Flash 系列
- Imagen 4(2026-08-17 關閉)→ 依 Google 官方遷移指引處理
常見問題 FAQ
Q1:2026 年最該學哪個模型的 API?
建議從 Claude 和 OpenAI 兩家開始。Claude 的程式碼能力與長上下文條件(100 萬 token 不加價)對開發者友善;OpenAI 的生態系最完整,企業支援最成熟。Gemini 適合已經在使用 Google 雲端服務、或需要極低單價高吞吐的團隊。
Q2:為什麼這篇不給模型排名分數?
因為我們拿不出可查證的一手來源。模型換代速度極快,一個三個月前的榜單分數,對應的機種可能已經退役;而排名又高度依賴任務類型,「綜合第一名」在你的實際任務上未必第一。與其給一個看起來精確、實際上無法追溯的數字,不如老實說:用自己的資料實測,或去 LMArena、Artificial Analysis 這類公開榜單看即時結果。
Q3:多模型混用策略在 2026 年更重要嗎?
是的。由於沒有單一模型在所有任務上勝出,現代 AI 系統傾向採用「智能路由」策略——依任務類型與複雜度把請求分流到不同模型與價格帶。這需要更複雜的架構,但能達到最佳的性價比。
Q4:內部推理 tokens 是什麼?會影響成本嗎?
推理型模型在回答前會先進行內部「思考」,這些思考過程產生的 tokens 也會計費。在長分析任務中,這可能大幅增加成本。建議:
- 監控實際 token 使用量
- 簡單任務改用不帶思考功能、或較低階的機種
- 設定成本上限警報
Q5:聽說 Claude 換了 tokenizer,這對我有什麼影響?
有,而且是直接影響帳單。Opus 4.7 以後、Fable 5、Mythos 5、Sonnet 5 使用新 tokenizer,同一段文字約多產生 30% token。所以:
- 從舊代 Claude 遷移時,即使費率沒漲,帳單也可能上升
- 跨模型比較單價會失真——$3/1M 的 A 模型和 $3/1M 的 B 模型,若 tokenizer 不同,跑同一份文件的實際花費就不同
- 正確做法是拿同一批樣本實測「這份工作實際花多少錢」,而不是比每 100 萬 token 的牌價
Q6:開源模型什麼時候能追上閉源模型?
差距持續縮小,但頂尖效能仍由閉源模型把持,特別是需要大量算力訓練的推理任務。對於資料敏感或需要完全控制的場景,開源模型仍是很好的選擇。若考慮本地部署,可參考 LLM API 與本地部署指南。
結語
2026 年的 LLM 市場已經進入專業化時代,也進入了「換代比你重寫文件還快」的時代。與其追排行榜名次,不如建立三個習慣:
- 根據核心需求圈出 2~3 個候選模型,用自己的資料實測後再定案
- 建立智能路由架構,針對不同任務使用不同價格帶的模型
- 定期(每季)重新檢查兩件事:有沒有更划算的新機種、現用機種有沒有被排入停用時程
第 3 點在今年格外重要——Gemini 2.0 Flash 已於 2026-06-01 關閉、Imagen 4 將於 2026-08-17 關閉、Claude Opus 4.1 已標記 deprecated,這些都是會直接讓服務中斷的變動。
還在猶豫選哪個模型?免費諮詢,告訴我們你的需求,我們幫你分析最適合的方案。
參考資料
- OpenAI API Pricing(官方定價頁)
- Anthropic Claude Pricing(官方定價頁)
- Google Gemini API Pricing(官方定價頁)
- Google 官方發布:Gemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber(2026-07-21)
- Gemini API Rate Limits(免費額度依帳號層級而定)
公開榜單(本文不引用其具體分數,請直接查看即時結果):LMArena、Artificial Analysis。
延伸閱讀
相關文章
LLM 是什麼?大型語言模型完整指南:從原理到企業應用【2026】
LLM 是什麼意思?本文完整解析大型語言模型的核心原理、主流模型比較(GPT-5.6、Claude Opus 4.8、Gemini 3.1 Pro)、MCP 協議、企業應用場景與導入策略,幫你快速掌握 AI 技術趨勢。
LLM阿里巴巴 Qwen3.8 解析:2.4 兆參數開放權重模型,企業該不該等它?
阿里巴巴 2026 年 7 月 19 日預告 2.4 兆參數的 Qwen3.8 並計畫開放權重,宣稱整體效能僅次於 Claude Fable 5——但這是阿里巴巴自己的說法,尚無基準測試、模型卡或獨立評測可驗證。本文拆解目前已知與未知的事實,以及開放權重模型 vs 商用 API 在自架成本、資料落地與授權風險上的採購決策差異。
AI APIAI API 怎麼選?2026 年 OpenAI vs Claude vs Gemini 完整比較指南
2026 年 AI API 怎麼選?完整比較 OpenAI、Claude、Gemini API 的功能、價格、性能差異,從模型能力到企業決策框架,幫企業和開發者做出最佳選擇。