Bảng benchmark & xếp bậc LLM chi tiết — Onyx LLM Leaderboard

Bảng đầy đủ 6 tác vụ (Overall/Coding/Math/Chat/Reasoning/Agentic), bảng benchmark gốc 15 model hàng đầu, gợi ý chọn model theo nhu cầu, và giải nghĩa thuật ngữ — tách riêng khỏi trang Ranking AI vì khối lượng dữ liệu lớn.

Nguồn: Onyx LLM Leaderboard · Tác giả gốc: Roshan Desai · Dữ liệu tính đến

📌 Điểm nhấn

🎯 Xếp bậc theo từng tác vụ

Model được xếp lại theo TỪNG tác vụ riêng — ý nghĩa từng bậc xem ngay bên dưới mỗi bảng.

Overall (chung)

S Claude Fable 5 · GPT-5.6 Sol · Kimi K3
A Claude Opus 4.8 · GLM-5.2 · Claude Sonnet 5 · GPT-5.5 · DeepSeek-V4-Pro · Kimi K2.6 · MiniMax M3 · Hunyuan Hy3 · DeepSeek V3.2
B Muse Spark 1.1 · Gemini 3.5 Flash · Grok 4.5 · GPT-5.6 Terra · Qwen3.7-Max · ERNIE 5.1 · Nova 2 Pro · Step-3.7-Flash · Nemotron 3 Ultra · Gemini 3.1 Pro · Qwen 3.5 · DeepSeek R1 · Step-3.5-Flash · MiMo-V2-Flash
C MiMo-V2.5-Pro · GPT-5.6 Luna · GPT-oss 120B · Nemotron Ultra 253B
D Grok 3 · Llama 4 Maverick

Coding (lập trình)

S Claude Fable 5 · GPT-5.6 Sol · Kimi K3
A Claude Opus 4.8 · GPT-5.5 · DeepSeek-V4-Pro · Kimi K2.6 · GLM-5.2 · GPT-5.6 Terra · Claude Sonnet 5
B MiniMax M3 · Step-3.7-Flash · Hunyuan Hy3 · Gemini 3.1 Pro · GPT-5.6 Luna · Gemini 3.5 Flash · Muse Spark 1.1 · Nemotron 3 Ultra · Nova 2 Pro · DeepSeek V3.2 · DeepSeek R1 · GPT-oss 120B · MiMo-V2-Flash · Step-3.5-Flash · Qwen 3.5
C Grok 4.5 · Qwen3.7-Max · ERNIE 5.1 · MiMo-V2.5-Pro · Nemotron Ultra 253B
D Llama 4 Maverick · Grok 3

So với Overall: GPT-5.6 Terra và GPT-oss 120B tăng 1 bậc; MiniMax M3, Hunyuan Hy3, DeepSeek V3.2, Grok 4.5, Qwen3.7-Max, ERNIE 5.1 đều giảm 1 bậc — nhóm Anthropic/OpenAI/Moonshot vẫn giữ nguyên bậc S.

Math (toán)

S GPT-5.5 · DeepSeek R1 · Step-3.5-Flash · MiMo-V2-Flash
A Claude Fable 5 · Claude Opus 4.8 · Claude Sonnet 5 · GPT-5.6 Sol · Gemini 3.5 Flash · DeepSeek-V4-Pro · Kimi K3 · Kimi K2.6 · GLM-5.2 · Nova 2 Pro · Qwen 3.5 · DeepSeek V3.2
B Muse Spark 1.1 · MiniMax M3 · Step-3.7-Flash · Hunyuan Hy3 · Nemotron 3 Ultra · Qwen3.7-Max · GPT-oss 120B · GPT-5.6 Terra
C Grok 4.5 · ERNIE 5.1 · MiMo-V2.5-Pro · Nemotron Ultra 253B · GPT-5.6 Luna
D Llama 4 Maverick

Biến động mạnh nhất bảng: DeepSeek R1, Step-3.5-Flash, MiMo-V2-Flash cùng nhảy từ B lên thẳng S (+2 bậc); ngược lại cả 3 model bậc S ở Overall (Claude Fable 5, GPT-5.6 Sol, Kimi K3) đều tụt xuống A ở Math.

Chat (hội thoại)

S Claude Fable 5 · Muse Spark 1.1
A Claude Sonnet 5 · GPT-5.6 Sol · Gemini 3.5 Flash · Kimi K3 · GPT-5.5 · Claude Opus 4.8 · Grok 4.5 · Qwen3.7-Max · Qwen 3.5 · DeepSeek V3.2 · MiMo-V2-Flash
B GLM-5.2 · ERNIE 5.1 · Kimi K2.6 · DeepSeek-V4-Pro · MiniMax M3 · Nova 2 Pro · DeepSeek R1 · Nemotron Ultra 253B · GPT-5.6 Terra
C Hunyuan Hy3 · MiMo-V2.5-Pro · Step-3.7-Flash · Nemotron 3 Ultra · GPT-oss 120B · GPT-5.6 Luna
D Llama 4 Maverick · Step-3.5-Flash

Muse Spark 1.1 nhảy từ B lên S (+2); Step-3.5-Flash rớt từ B xuống D (-2) và Hunyuan Hy3 rớt từ A xuống C (-2) — đây là 2 cú tụt hạng mạnh nhất trong toàn bộ 5 bảng tác vụ.

Reasoning (suy luận)

S Claude Fable 5 · Claude Opus 4.8 · GPT-5.6 Sol · GPT-5.5 · Gemini 3.1 Pro
A Claude Sonnet 5 · Muse Spark 1.1 · Gemini 3.5 Flash · GLM-5.2 · DeepSeek-V4-Pro · Kimi K2.6 · Kimi K3 · Hunyuan Hy3 · MiniMax M3 · Qwen 3.5 · DeepSeek R1 · GPT-oss 120B · MiMo-V2-Flash · GPT-5.6 Terra
B Nemotron 3 Ultra · Nova 2 Pro · Qwen3.7-Max · Grok 4.5 · ERNIE 5.1 · Step-3.7-Flash · DeepSeek V3.2 · GPT-5.6 Luna
C MiMo-V2.5-Pro · Nemotron Ultra 253B · Llama 4 Maverick · Grok 3
D Step-3.5-Flash

GPT-oss 120B và Gemini 3.1 Pro đều tăng 2 bậc (lên A và S); Claude Opus 4.8 và GPT-5.5 tăng lên S; ngược lại Kimi K3 tụt từ S xuống A dù vẫn ở nhóm đầu.

Agentic (tự hành)

S Claude Fable 5 · Claude Opus 4.8 · Claude Sonnet 5 · Kimi K3 · GPT-5.6 Sol
A GPT-5.5 · Muse Spark 1.1 · Kimi K2.6 · MiniMax M3 · Hunyuan Hy3 · Gemini 3.5 Flash · Nova 2 Pro · Qwen 3.5
B Step-3.7-Flash · Nemotron 3 Ultra · GLM-5.2 · DeepSeek-V4-Pro · Gemini 3.1 Pro · DeepSeek R1 · MiMo-V2-Flash · Step-3.5-Flash · DeepSeek V3.2
C Grok 4.5 · Qwen3.7-Max · ERNIE 5.1 · MiMo-V2.5-Pro · GPT-5.6 Terra · GPT-5.6 Luna
D Grok 3

Claude Opus 4.8 và Claude Sonnet 5 tăng lên S; GLM-5.2, DeepSeek-V4-Pro, DeepSeek V3.2 đều giảm 1 bậc xuống B — nhóm Anthropic gần như thống trị bậc S ở tác vụ agentic.

Ý nghĩa từng bậc

S
Nhóm dẫn đầu tuyệt đối — điểm cao nhất hầu hết benchmark, không có điểm yếu rõ rệt. Phù hợp cho công việc quan trọng, cần độ chính xác/độ tin cậy cao nhất, chấp nhận chi phí cao hơn.
A
Cạnh tranh sát nút bậc S, thường chỉ thua ở 1-2 benchmark cụ thể. Phù hợp làm lựa chọn chính cho phần lớn công việc hàng ngày — tỉ lệ hiệu năng/chi phí thường tốt hơn bậc S.
B
Đủ dùng tốt cho tác vụ phổ thông (chat, soạn thảo, coding cơ bản) nhưng đuối hơn rõ ở các benchmark khó (agentic, reasoning chuyên sâu). Nhiều model mở/giá rẻ nằm ở bậc này.
C
Chỉ nên dùng khi ưu tiên chi phí thấp hoặc cần self-host, chấp nhận chất lượng thấp hơn hẳn top đầu — hợp việc nhẹ, khối lượng lớn, không đòi hỏi suy luận phức tạp.
D
Thấp nhất bảng — thường là model đời cũ hơn hoặc kiến trúc đã lỗi thời so với mặt bằng chung. Chỉ hợp việc rất đơn giản hoặc khi bị giới hạn ngân sách/hạ tầng nghiêm ngặt.

🧭 Nên chọn model nào?

Nhu cầuModelVì sao (số liệu)
Lập trình / coding hàng ngàyClaude Fable 5Bậc S cả Overall lẫn Coding; SWE-bench Pro 80.0 — cao nhất trong toàn bộ bảng benchmark thu thập được.
Agent / tự động hoá (agentic)Claude Opus 4.8 hoặc Claude Sonnet 5Cả 2 đều đạt bậc S riêng ở Agentic; Opus 4.8 có GPQA Diamond 93.6% hỗ trợ suy luận trong tác vụ nhiều bước.
Chat/tư vấn chi phí thấpDeepSeek-V4-Pro0.43 USD/0.87 USD mỗi triệu token — rẻ hơn nhóm S 10 lần trở lên, vẫn đạt bậc A Overall.
Ngữ cảnh dài / tài liệu lớnKimi K3 hoặc Claude Fable 5Cùng hỗ trợ 1M token ngữ cảnh, Kimi K3 còn đạt GPQA Diamond 93.5% dù giá thấp hơn Claude nhiều.
Suy luận (reasoning) chuyên sâuGemini 3.1 ProNhảy 2 bậc lên S riêng ở Reasoning, dẫn đầu benchmark đa ngôn ngữ MMMLU 91.8%.
Tự triển khai / self-host, ngân sách hẹpGPT-oss 120B (117B, mã nguồn mở)Duy nhất lọt bộ lọc 'Medium' (quy mô vừa) trên Onyx, vẫn đạt bậc A ở Reasoning dù chỉ 117B tham số.
Toán / thi cử học thuậtGPT-5.5 hoặc DeepSeek R1GPT-5.5 đạt AIME 2025 100%; DeepSeek R1 đạt MATH-500 97.3% — cả 2 cùng bậc S ở Math.

📊 Bảng benchmark chi tiết (15 model)

Cột trống ghi "N/A" vì nguồn không công bố — không suy đoán. Giá tính theo USD / 1 triệu token.

ModelHãngTham sốNgữ cảnh Giá vào ($/1M)Giá ra ($/1M)Chatbot Arena SWE-bench VerifiedSWE-bench ProTerminal-Bench 2.1GPQA DiamondHLE
Claude Fable 5AnthropicN/A1M $10.00 $50.00 1507N/A80 84.3N/AN/A
Claude Opus 4.8AnthropicN/A1M $5.00 $25.00 147688.669.2 74.693.6N/A
Claude Sonnet 5AnthropicN/A1M $2.00 $10.00 148685.263.2 80.4N/A43.2
GPT-5.5OpenAIN/A1M $5.00 $30.00 148188.759.4 85.693.6N/A
GPT-5.6 SolOpenAIN/A1M $5.00 $30.00 1486N/A64.6 88.894.647.2
Gemini 3.1 ProGoogleN/A1M $2.00 $12.00 149278N/A N/A91.945.8
DeepSeek R1DeepSeek671B128K $0.28 $0.42 139849.2N/A N/A71.5N/A
DeepSeek-V4-ProDeepSeek1.6T1M $0.43 $0.87 N/A80.6N/A N/A90.1N/A
Kimi K3Moonshot2.8T1M $3.00 $15.00 1486N/AN/A 88.393.5N/A
GLM-5.2Zhipu AI753B1M $1.40 $4.40 1468N/AN/A 8191.240.5
Hunyuan Hy3Tencent295B262K N/A N/A 141278N/A N/A90.437
Kimi K2.6Moonshot1T262K $0.95 $4.00 N/A80.2N/A N/A90.5N/A
MiniMax M3MiniMax428B1M $0.30 $1.20 144580.559 N/AN/AN/A
Qwen 3.5Qwen397B262K N/A N/A 145076.4N/A N/A88.428.7
Grok 4.5xAIN/A500K $2.00 $6.00 1485N/A64.7 83.3N/AN/A

📖 Giải nghĩa benchmark

MMLU / MMLU-Pro
Bộ câu hỏi trắc nghiệm kiến thức tổng quát 57 lĩnh vực — đo hiểu biết rộng, không chuyên sâu 1 kỹ năng.
GPQA Diamond
Câu hỏi khoa học cấp chuyên gia (sinh học/hoá/lý) — khó tới mức người không chuyên gần như không đoán đúng.
SWE-bench Verified / Pro
Đo khả năng tự sửa lỗi/thêm tính năng trong codebase thật (Verified = bộ đề đã thẩm định; Pro = bộ đề khó/mới hơn).
Terminal-Bench
Đo khả năng thao tác dòng lệnh (terminal) để hoàn thành tác vụ hệ thống thực tế.
HLE (Humanity's Last Exam)
Bộ đề đa lĩnh vực cực khó, thiết kế để ngay cả model tốt nhất hiện nay cũng đạt điểm thấp.
Chatbot Arena
Điểm ELO từ việc người dùng thật so sánh trực tiếp 2 câu trả lời và bình chọn — đo mức độ 'được ưa thích' hơn là độ chính xác thuần.
AIME 2025
Đề thi Toán học sinh giỏi Mỹ (American Invitational Mathematics Examination) — đo khả năng giải toán nâng cao.
MMMU-Pro
Bộ đề suy luận đa phương thức (hình ảnh + văn bản) trải nhiều môn học — đo khả năng 'nhìn và suy luận' cùng lúc.

Ghi chú phương pháp: Ghi chú phương pháp: bộ lọc quy mô 'Medium' trên Onyx chỉ hiện đúng 1 model (GPT-oss 120B, 117B tham số) — nghĩa là gần như toàn bộ bảng Overall thuộc nhóm 'Large'. Với 5 bảng phụ theo tác vụ (Best LLMs by Task) của các mục Coding/Chat/Reasoning/Agentic, một số biểu đồ không hiển thị đủ % khi trích xuất — phần này chỉ liệt kê model dẫn đầu, không suy đoán số liệu.

Nguồn dữ liệu: Onyx LLM Leaderboard → · Bảng xếp hạng LLM mã nguồn mở → · Bảng xếp hạng LLM tự triển khai (self-hosted) → · LLM tốt nhất cho lập trình →

← Quay lại Ranking AI