Bảng xếp hạng AI hàng tuần
12 sản phẩm/model AI đáng chú ý nhất tuần này, xếp theo mức độ ảnh hưởng thực tế.
Điểm nhấn tuần này
- Mới vào bảng tuần này: DeepSeek V4, Kimi K3.
- Tăng hạng tuần này: Claude, Cursor, NotebookLM.
- Không có mục nào tụt hạng tuần này.
- 7 sản phẩm giữ nguyên vị trí.
Phương pháp xếp hạng
Đội ngũ npmrundeploy.com biên tập bảng này thủ công mỗi tuần, dựa trên mức độ thảo luận trên mạng xã hội/cộng đồng dev, tin tức ra mắt sản phẩm và trải nghiệm dùng thử trực tiếp — không phải kết quả của một thuật toán hay benchmark tự động. Thứ hạng phản ánh đánh giá chủ quan của đội ngũ biên tập tại thời điểm xuất bản, có thể khác với các bảng xếp hạng benchmark khách quan như Intelligence Index hay OpenRouter bên dưới.
🧠 Chỉ số trí tuệ mô hình
Intelligence Index — Artificial Analysis
Xếp hạng độc lập mức độ "thông minh" của các model AI, tổng hợp từ hàng loạt bài test benchmark do Artificial Analysis thực hiện.
Nguồn dữ liệu: Artificial Analysis — Xem nguồn →
📊 Xếp hạng theo mức sử dụng thực tế
OpenRouter Rankings — theo lưu lượng sử dụng tuần này
Xếp hạng dựa trên dữ liệu sử dụng thực tế (không phải benchmark) từ hàng triệu request đi qua OpenRouter mỗi tuần, chia theo 7 loại tác vụ.
Tuần của 2026-07-25
🏆 Top model dùng nhiều nhất (mọi loại)
- 1 DeepSeek V4 Flash deepseek 7.22T tokens +13%
- 2 MiMo-V2.5 xiaomi 6.3T tokens +40%
- 3 Hy3 tencent 4.82T tokens +22%
- 4 DeepSeek V4 Pro deepseek 3.28T tokens +3%
- 5 GLM 5.2 z-ai 2.89T tokens +12%
- 6 Nemotron 3 Ultra (free) nvidia 2.43T tokens +4%
- 7 MiniMax M3 minimax 1.96T tokens +4%
- 8 GPT-5.6 Luna openai 1.95T tokens +465%
- 9 Step 3.7 Flash stepfun 1.66T tokens +14%
- 10 Kimi K3 moonshotai 1.42T tokens +16%
⚡ Cách dùng nhanh qua OpenRouter
OpenRouter cho phép gọi hầu hết model AI trên thị trường qua 1 API endpoint duy nhất (tương thích chuẩn OpenAI), không cần đăng ký riêng với từng hãng.
curl https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model": "<model-id>", "messages": [{"role":"user","content":"Xin chào"}]}' Văn bản (LLM)
- 1 MiMo-V2.5 9.95T tokens +9%
- 2 DeepSeek V4 Flash 5.81T tokens +9%
- 3 Hy3 (free) 4.93T tokens +53%
- 4 GLM 5.2 3.58T tokens +1%
- 5 DeepSeek V4 Pro 3.01T tokens +16%
Phân tích nhanh: MiMo-V2.5 (Xiaomi) dẫn đầu tuần này về lượng token xử lý — một model mở đang tăng tốc; bản Hy3 (free) của Tencent tăng 53%, cho thấy nhu cầu dùng thử model miễn phí rất lớn.
Tạo ảnh
- 1 Nano Banana (Gemini 2.5 Flash Image) 1.3M requests +5%
- 2 Nano Banana 2 (Gemini 3.1 Flash Image) 791K requests +16%
- 3 Nano Banana 2 (Gemini 3.1 Flash Image Preview) 727K requests +11%
- 4 Nano Banana Pro (Gemini 3 Pro Image Preview) 520K requests +0%
- 5 GPT Image 2 515K requests +13%
Phân tích nhanh: Họ "Nano Banana" của Google (Gemini 2.5/3.1 Flash Image) chiếm 4/5 vị trí đầu bảng tạo ảnh — lợi thế phân phối qua Gemini rất rõ rệt so với GPT Image 2 của OpenAI đứng thứ 5.
Embeddings
- 1 Text Embedding 3 Small 87.5M requests +10%
- 2 Qwen3 Embedding 8B 68.7M requests +3%
- 3 bge-m3 16.2M requests +55%
- 4 Text Embedding 3 Large 14.1M requests +21%
- 5 Embed V1 0.6B 12.3M requests +20%
Phân tích nhanh: OpenAI Text Embedding 3 Small vẫn giữ vị trí số 1 với khoảng cách lớn (87.5M request/tuần); Qwen3 Embedding 8B bám sát thứ 2, còn Gemini Embedding tăng trưởng nhanh ở các vị trí 6-8.
Rerank
- 1 Llama Nemotron Rerank VL 1B V2 (free) 1.49M requests +26%
- 2 Rerank v3.5 689K requests +6%
- 3 Rerank 4 Fast 582K requests +141%
- 4 Rerank 4 Pro 310K requests +10%
Phân tích nhanh: Model miễn phí Llama Nemotron Rerank của NVIDIA dẫn đầu về khối lượng, còn lại top 4 do Cohere thống trị hoàn toàn ở phân khúc trả phí — không có đối thủ khác chen chân.
Video
- 1 Veo 3.1 Fast 37K requests +17%
- 2 Seedance 2.0 25K requests +13%
- 3 Veo 3.1 Lite 15K requests +35%
- 4 Veo 3.1 13K requests +30%
- 5 Seedance 2.0 Fast 11K requests +28%
Phân tích nhanh: Google Veo 3.1 Fast dẫn đầu tạo video, ByteDance Seedance 2.0 bám sát thứ 2 — hai hãng này chiếm phần lớn thị phần, các bản "Fast/Lite" tốc độ cao được ưa chuộng hơn bản đầy đủ.
Giọng nói (TTS)
- 1 Kokoro 82M 604K requests +78%
- 2 Gemini 3.1 Flash TTS Preview 415K requests +9%
- 3 Grok Voice TTS 1.0 326K requests +95%
- 4 MAI-Voice-2 31K requests +35%
- 5 Aura-2 8K requests +175%
Phân tích nhanh: Kokoro 82M — model TTS mã nguồn mở nhỏ gọn của hexgrad — dẫn đầu về khối lượng sử dụng; Grok Voice TTS của x-AI tăng trưởng rất nhanh (+95%), còn Aura-2 của Deepgram tăng vọt +175% dù thứ hạng còn thấp.
Chuyển giọng nói thành văn bản
- 1 Whisper Large V3 3.6M requests +238%
- 2 Whisper Large V3 Turbo 1.57M requests +57%
- 3 GPT-4o Mini Transcribe 675K requests +33%
- 4 Qwen3 ASR Flash 247K requests +7%
- 5 Whisper 1 174K requests +54%
Phân tích nhanh: Nhóm Whisper của OpenAI càn quét 2 vị trí đầu bảng; Whisper Large V3 tăng đột biến +238% trong tuần, cho thấy nhu cầu transcribe qua API tăng mạnh dù các đối thủ như Qwen3 ASR Flash cũng đang bám sát.
Nguồn dữ liệu: OpenRouter — Xem nguồn →
🎯 Xếp bậc theo benchmark tổng hợp
Onyx LLM Leaderboard — tóm tắt theo tuần
Onyx là một bảng xếp hạng LLM tổng hợp nhiều benchmark (reasoning = suy luận, agentic = tự hành/tự động ra quyết định nhiều bước) rồi quy về 5 bậc S/A/B/C/D. Khác với OpenRouter (đo lượng người dùng thật) hay Artificial Analysis (1 chỉ số tổng hợp duy nhất), Onyx công khai từng benchmark gốc (MMLU, GPQA, SWE-bench...) nên có thể truy ngược vì sao 1 model được xếp bậc nào.
Dữ liệu tính đến ngày · Tác giả: Roshan Desai
📌 Điểm nhấn tuần này
- Claude Fable 5 (Anthropic) là model duy nhất đạt bậc S ở 5/6 bảng (Overall, Coding, Chat, Reasoning, Agentic) — chỉ tụt xuống A ở Math, cho thấy độ ổn định cao nhất toàn bảng.
- GPT-oss 120B (117B tham số, mã nguồn mở) tăng mạnh nhất khi đổi tác vụ: từ bậc C (Overall) lên A ở Reasoning (+2 bậc) — model mở rẻ nhất bảng lại mạnh bất ngờ về suy luận.
- Gemini 3.1 Pro (Google) nhảy từ bậc B (Overall) lên thẳng S ở Reasoning (+2 bậc), đồng thời dẫn đầu benchmark MMLU đa ngôn ngữ (MMMLU) với 91.8%.
- Step-3.5-Flash (Stepfun, 196B) là model duy nhất tụt tới 2 bậc ở một tác vụ: từ B (Overall) xuống D ở Chat — cho thấy dù mạnh về Toán (đạt bậc S ở Math) nhưng rất yếu về hội thoại.
- DeepSeek-V4-Pro là lựa chọn đáng tiền nhất trong nhóm A: chỉ 0.43 USD/0.87 USD mỗi triệu token (input/output) — rẻ hơn Claude Opus 4.8 hơn 11 lần — mà vẫn đạt GPQA Diamond 90.1%.
- GPT-5.5 dẫn đầu benchmark tổng quát MMLU với 92.5%, nhưng lại chỉ ở bậc A (không phải S) trên bảng Overall — một ví dụ rõ cho việc "mạnh nhất 1 benchmark" khác với "tốt nhất toàn diện".
Ý nghĩa từng bậc (Overall)
Nguồn dữ liệu: Onyx LLM Leaderboard — Xem nguồn → · Dữ liệu tính đến ngày