Bảng benchmark & xếp bậc LLM chi tiết — Onyx LLM Leaderboard
Bảng đầy đủ 6 tác vụ (Overall/Coding/Math/Chat/Reasoning/Agentic), bảng benchmark gốc 15 model hàng đầu, gợi ý chọn model theo nhu cầu, và giải nghĩa thuật ngữ — tách riêng khỏi trang Ranking AI vì khối lượng dữ liệu lớn.
Nguồn: Onyx LLM Leaderboard · Tác giả gốc: Roshan Desai · Dữ liệu tính đến
📌 Điểm nhấn
- Claude Fable 5 (Anthropic) là model duy nhất đạt bậc S ở 5/6 bảng (Overall, Coding, Chat, Reasoning, Agentic) — chỉ tụt xuống A ở Math, cho thấy độ ổn định cao nhất toàn bảng.
- GPT-oss 120B (117B tham số, mã nguồn mở) tăng mạnh nhất khi đổi tác vụ: từ bậc C (Overall) lên A ở Reasoning (+2 bậc) — model mở rẻ nhất bảng lại mạnh bất ngờ về suy luận.
- Gemini 3.1 Pro (Google) nhảy từ bậc B (Overall) lên thẳng S ở Reasoning (+2 bậc), đồng thời dẫn đầu benchmark MMLU đa ngôn ngữ (MMMLU) với 91.8%.
- Step-3.5-Flash (Stepfun, 196B) là model duy nhất tụt tới 2 bậc ở một tác vụ: từ B (Overall) xuống D ở Chat — cho thấy dù mạnh về Toán (đạt bậc S ở Math) nhưng rất yếu về hội thoại.
- DeepSeek-V4-Pro là lựa chọn đáng tiền nhất trong nhóm A: chỉ 0.43 USD/0.87 USD mỗi triệu token (input/output) — rẻ hơn Claude Opus 4.8 hơn 11 lần — mà vẫn đạt GPQA Diamond 90.1%.
- GPT-5.5 dẫn đầu benchmark tổng quát MMLU với 92.5%, nhưng lại chỉ ở bậc A (không phải S) trên bảng Overall — một ví dụ rõ cho việc "mạnh nhất 1 benchmark" khác với "tốt nhất toàn diện".
🎯 Xếp bậc theo từng tác vụ
Model được xếp lại theo TỪNG tác vụ riêng — ý nghĩa từng bậc xem ngay bên dưới mỗi bảng.
Overall (chung)
Coding (lập trình)
So với Overall: GPT-5.6 Terra và GPT-oss 120B tăng 1 bậc; MiniMax M3, Hunyuan Hy3, DeepSeek V3.2, Grok 4.5, Qwen3.7-Max, ERNIE 5.1 đều giảm 1 bậc — nhóm Anthropic/OpenAI/Moonshot vẫn giữ nguyên bậc S.
Math (toán)
Biến động mạnh nhất bảng: DeepSeek R1, Step-3.5-Flash, MiMo-V2-Flash cùng nhảy từ B lên thẳng S (+2 bậc); ngược lại cả 3 model bậc S ở Overall (Claude Fable 5, GPT-5.6 Sol, Kimi K3) đều tụt xuống A ở Math.
Chat (hội thoại)
Muse Spark 1.1 nhảy từ B lên S (+2); Step-3.5-Flash rớt từ B xuống D (-2) và Hunyuan Hy3 rớt từ A xuống C (-2) — đây là 2 cú tụt hạng mạnh nhất trong toàn bộ 5 bảng tác vụ.
Reasoning (suy luận)
GPT-oss 120B và Gemini 3.1 Pro đều tăng 2 bậc (lên A và S); Claude Opus 4.8 và GPT-5.5 tăng lên S; ngược lại Kimi K3 tụt từ S xuống A dù vẫn ở nhóm đầu.
Agentic (tự hành)
Claude Opus 4.8 và Claude Sonnet 5 tăng lên S; GLM-5.2, DeepSeek-V4-Pro, DeepSeek V3.2 đều giảm 1 bậc xuống B — nhóm Anthropic gần như thống trị bậc S ở tác vụ agentic.
Ý nghĩa từng bậc
- S
- Nhóm dẫn đầu tuyệt đối — điểm cao nhất hầu hết benchmark, không có điểm yếu rõ rệt. Phù hợp cho công việc quan trọng, cần độ chính xác/độ tin cậy cao nhất, chấp nhận chi phí cao hơn.
- A
- Cạnh tranh sát nút bậc S, thường chỉ thua ở 1-2 benchmark cụ thể. Phù hợp làm lựa chọn chính cho phần lớn công việc hàng ngày — tỉ lệ hiệu năng/chi phí thường tốt hơn bậc S.
- B
- Đủ dùng tốt cho tác vụ phổ thông (chat, soạn thảo, coding cơ bản) nhưng đuối hơn rõ ở các benchmark khó (agentic, reasoning chuyên sâu). Nhiều model mở/giá rẻ nằm ở bậc này.
- C
- Chỉ nên dùng khi ưu tiên chi phí thấp hoặc cần self-host, chấp nhận chất lượng thấp hơn hẳn top đầu — hợp việc nhẹ, khối lượng lớn, không đòi hỏi suy luận phức tạp.
- D
- Thấp nhất bảng — thường là model đời cũ hơn hoặc kiến trúc đã lỗi thời so với mặt bằng chung. Chỉ hợp việc rất đơn giản hoặc khi bị giới hạn ngân sách/hạ tầng nghiêm ngặt.
🧭 Nên chọn model nào?
| Nhu cầu | Model | Vì sao (số liệu) |
|---|---|---|
| Lập trình / coding hàng ngày | Claude Fable 5 | Bậc S cả Overall lẫn Coding; SWE-bench Pro 80.0 — cao nhất trong toàn bộ bảng benchmark thu thập được. |
| Agent / tự động hoá (agentic) | Claude Opus 4.8 hoặc Claude Sonnet 5 | Cả 2 đều đạt bậc S riêng ở Agentic; Opus 4.8 có GPQA Diamond 93.6% hỗ trợ suy luận trong tác vụ nhiều bước. |
| Chat/tư vấn chi phí thấp | DeepSeek-V4-Pro | 0.43 USD/0.87 USD mỗi triệu token — rẻ hơn nhóm S 10 lần trở lên, vẫn đạt bậc A Overall. |
| Ngữ cảnh dài / tài liệu lớn | Kimi K3 hoặc Claude Fable 5 | Cùng hỗ trợ 1M token ngữ cảnh, Kimi K3 còn đạt GPQA Diamond 93.5% dù giá thấp hơn Claude nhiều. |
| Suy luận (reasoning) chuyên sâu | Gemini 3.1 Pro | Nhảy 2 bậc lên S riêng ở Reasoning, dẫn đầu benchmark đa ngôn ngữ MMMLU 91.8%. |
| Tự triển khai / self-host, ngân sách hẹp | GPT-oss 120B (117B, mã nguồn mở) | Duy nhất lọt bộ lọc 'Medium' (quy mô vừa) trên Onyx, vẫn đạt bậc A ở Reasoning dù chỉ 117B tham số. |
| Toán / thi cử học thuật | GPT-5.5 hoặc DeepSeek R1 | GPT-5.5 đạt AIME 2025 100%; DeepSeek R1 đạt MATH-500 97.3% — cả 2 cùng bậc S ở Math. |
📊 Bảng benchmark chi tiết (15 model)
Cột trống ghi "N/A" vì nguồn không công bố — không suy đoán. Giá tính theo USD / 1 triệu token.
| Model | Hãng | Tham số | Ngữ cảnh | Giá vào ($/1M) | Giá ra ($/1M) | Chatbot Arena | SWE-bench Verified | SWE-bench Pro | Terminal-Bench 2.1 | GPQA Diamond | HLE |
|---|---|---|---|---|---|---|---|---|---|---|---|
| Claude Fable 5 | Anthropic | N/A | 1M | $10.00 | $50.00 | 1507 | N/A | 80 | 84.3 | N/A | N/A |
| Claude Opus 4.8 | Anthropic | N/A | 1M | $5.00 | $25.00 | 1476 | 88.6 | 69.2 | 74.6 | 93.6 | N/A |
| Claude Sonnet 5 | Anthropic | N/A | 1M | $2.00 | $10.00 | 1486 | 85.2 | 63.2 | 80.4 | N/A | 43.2 |
| GPT-5.5 | OpenAI | N/A | 1M | $5.00 | $30.00 | 1481 | 88.7 | 59.4 | 85.6 | 93.6 | N/A |
| GPT-5.6 Sol | OpenAI | N/A | 1M | $5.00 | $30.00 | 1486 | N/A | 64.6 | 88.8 | 94.6 | 47.2 |
| Gemini 3.1 Pro | N/A | 1M | $2.00 | $12.00 | 1492 | 78 | N/A | N/A | 91.9 | 45.8 | |
| DeepSeek R1 | DeepSeek | 671B | 128K | $0.28 | $0.42 | 1398 | 49.2 | N/A | N/A | 71.5 | N/A |
| DeepSeek-V4-Pro | DeepSeek | 1.6T | 1M | $0.43 | $0.87 | N/A | 80.6 | N/A | N/A | 90.1 | N/A |
| Kimi K3 | Moonshot | 2.8T | 1M | $3.00 | $15.00 | 1486 | N/A | N/A | 88.3 | 93.5 | N/A |
| GLM-5.2 | Zhipu AI | 753B | 1M | $1.40 | $4.40 | 1468 | N/A | N/A | 81 | 91.2 | 40.5 |
| Hunyuan Hy3 | Tencent | 295B | 262K | N/A | N/A | 1412 | 78 | N/A | N/A | 90.4 | 37 |
| Kimi K2.6 | Moonshot | 1T | 262K | $0.95 | $4.00 | N/A | 80.2 | N/A | N/A | 90.5 | N/A |
| MiniMax M3 | MiniMax | 428B | 1M | $0.30 | $1.20 | 1445 | 80.5 | 59 | N/A | N/A | N/A |
| Qwen 3.5 | Qwen | 397B | 262K | N/A | N/A | 1450 | 76.4 | N/A | N/A | 88.4 | 28.7 |
| Grok 4.5 | xAI | N/A | 500K | $2.00 | $6.00 | 1485 | N/A | 64.7 | 83.3 | N/A | N/A |
📖 Giải nghĩa benchmark
- MMLU / MMLU-Pro
- Bộ câu hỏi trắc nghiệm kiến thức tổng quát 57 lĩnh vực — đo hiểu biết rộng, không chuyên sâu 1 kỹ năng.
- GPQA Diamond
- Câu hỏi khoa học cấp chuyên gia (sinh học/hoá/lý) — khó tới mức người không chuyên gần như không đoán đúng.
- SWE-bench Verified / Pro
- Đo khả năng tự sửa lỗi/thêm tính năng trong codebase thật (Verified = bộ đề đã thẩm định; Pro = bộ đề khó/mới hơn).
- Terminal-Bench
- Đo khả năng thao tác dòng lệnh (terminal) để hoàn thành tác vụ hệ thống thực tế.
- HLE (Humanity's Last Exam)
- Bộ đề đa lĩnh vực cực khó, thiết kế để ngay cả model tốt nhất hiện nay cũng đạt điểm thấp.
- Chatbot Arena
- Điểm ELO từ việc người dùng thật so sánh trực tiếp 2 câu trả lời và bình chọn — đo mức độ 'được ưa thích' hơn là độ chính xác thuần.
- AIME 2025
- Đề thi Toán học sinh giỏi Mỹ (American Invitational Mathematics Examination) — đo khả năng giải toán nâng cao.
- MMMU-Pro
- Bộ đề suy luận đa phương thức (hình ảnh + văn bản) trải nhiều môn học — đo khả năng 'nhìn và suy luận' cùng lúc.
Ghi chú phương pháp: Ghi chú phương pháp: bộ lọc quy mô 'Medium' trên Onyx chỉ hiện đúng 1 model (GPT-oss 120B, 117B tham số) — nghĩa là gần như toàn bộ bảng Overall thuộc nhóm 'Large'. Với 5 bảng phụ theo tác vụ (Best LLMs by Task) của các mục Coding/Chat/Reasoning/Agentic, một số biểu đồ không hiển thị đủ % khi trích xuất — phần này chỉ liệt kê model dẫn đầu, không suy đoán số liệu.
Nguồn dữ liệu: Onyx LLM Leaderboard → · Bảng xếp hạng LLM mã nguồn mở → · Bảng xếp hạng LLM tự triển khai (self-hosted) → · LLM tốt nhất cho lập trình →