AI 模型速查
共 12 个主流模型:参数量、上下文、硬件与量化建议速查。
GPT-5.3
| 参数量 | 未公开(社区估算 2T+,MoE) |
|---|---|
| 上下文 | 500K tokens |
| 发布时间 | 2026-05 |
| 硬件要求 | 云端 API(FP8/BF16 集群);本地近似可跑开源蒸馏版,需 8×H200 或 1TB+ 显存 |
| 量化建议 | 官方云端不开放权重;本地近似常用 GPTQ/AWQ 4-bit,FP8 为甜点位 |
| 适用场景 | 复杂推理、代码、通用 Agent |
Claude 4.6 Opus
| 参数量 | 未公开(社区估算 1T+) |
|---|---|
| 上下文 | 1M tokens |
| 发布时间 | 2026-03 |
| 硬件要求 | 云端 API;本地无可下载权重,仅能跑开源近似模型(需 8×H200) |
| 量化建议 | 官方云端 FP8/BF16;本地近似用 4-bit GPTQ 开源模型 |
| 适用场景 | 长文、审计、企业高可靠任务 |
Gemini 3.5 Pro
| 参数量 | 未公开(MoE,估算数百 B) |
|---|---|
| 上下文 | 2M tokens |
| 发布时间 | 2026-05 |
| 硬件要求 | 云端 TPU;本地近似可跑 Gemma 3 系(单卡 24GB 可跑 27B) |
| 量化建议 | 官方 TPU FP8;本地 Gemma 用 Q4_K_M / AWQ 4-bit |
| 适用场景 | 多模态、超长上下文、搜索增强 |
DeepSeek-V4
| 参数量 | 未公开(MoE,估算 1T+ / 激活约 40B) |
|---|---|
| 上下文 | 256K tokens |
| 发布时间 | 2026-06 |
| 硬件要求 | 官方 API;满血本地需 8×H200;4-bit 量化可在 4×80GB 上跑 |
| 量化建议 | 官方 FP8 开源;社区 GPTQ/AWQ 4-bit 最常用 |
| 适用场景 | 高性价比通用模型、中文与代码 |
Qwen3-Max
| 参数量 | 未公开(MoE,估算 1T+) |
|---|---|
| 上下文 | 256K tokens |
| 发布时间 | 2026-04 |
| 硬件要求 | 云端 API;开源近似 Qwen3-235B 可用 2×48GB Q4 跑 |
| 量化建议 | 官方 FP8;开源版 GPTQ/AWQ/GGUF 全套 |
| 适用场景 | 中文、代码、可私有化部署 |
GLM-5
| 参数量 | 未公开(MoE,估算 500B/激活 36B) |
|---|---|
| 上下文 | 256K tokens |
| 发布时间 | 2026-06 |
| 硬件要求 | 云端 API / MaaS;本地近似可跑 GLM-4-9B(单卡 16GB) |
| 量化建议 | 官方 API FP8;开源 9B/32B 用 GGUF Q4/Q5 |
| 适用场景 | 国内合规、工具调用、Agent 生态 |
Kimi K3
| 参数量 | 未公开(MoE,估算 1T+ / 激活 32B) |
|---|---|
| 上下文 | 256K tokens |
| 发布时间 | 2026-05 |
| 硬件要求 | 云端 API;开源权重 4-bit 需 4×80GB 或 Mac 集群 |
| 量化建议 | 官方开源;社区 AWQ 4-bit 常用 |
| 适用场景 | 超长文、深度推理 |
Llama 5
| 参数量 | 未公开(MoE,估算 700B / 激活 20B) |
|---|---|
| 上下文 | 1M tokens |
| 发布时间 | 2026-07 |
| 硬件要求 | 单卡 H200 可跑 4-bit;BF16 需 8×80GB |
| 量化建议 | 官方 BF16 + 社区 GGUF Q4_K_M / GPTQ |
| 适用场景 | 开源多模态、研究/私有化 |
Mistral Large 4
| 参数量 | 未公开(MoE,估算 300B) |
|---|---|
| 上下文 | 256K tokens |
| 发布时间 | 2026-05 |
| 硬件要求 | BF16 需 8×80GB;Q4 量化 2×80GB 可跑 |
| 量化建议 | 官方 BF16 开源;GGUF/AWQ 4-bit 常用 |
| 适用场景 | 欧洲合规、企业私有化 |
Grok 5
| 参数量 | 未公开(社区估算 1T+) |
|---|---|
| 上下文 | 256K tokens |
| 发布时间 | 2026-08 |
| 硬件要求 | 仅云端 API;本地近似跑开源 Grok-1(8×A100) |
| 量化建议 | 云端 FP8;开源 Grok-1 可用 4-bit GPTQ |
| 适用场景 | 实时信息、图像理解、X 平台联动 |
o5
| 参数量 | 未公开(小参数推理模型) |
|---|---|
| 上下文 | 300K tokens |
| 发布时间 | 2026-08 |
| 硬件要求 | 云端 API,成本低;本地无权重 |
| 量化建议 | 云端服务端量化;开源近似用 Qwen3 推理版替代 |
| 适用场景 | 低成本复杂推理、数学/编程 |
MiniMax-Text-03
| 参数量 | 未公开(MoE,估算 600B / 激活 50B) |
|---|---|
| 上下文 | 300K tokens |
| 发布时间 | 2026-04 |
| 硬件要求 | 云端 API;4-bit 本地需 4×80GB |
| 量化建议 | 官方未全开源,社区用 AWQ 4-bit |
| 适用场景 | 中文创作、长文、性价比 |
参数来自公开资料整理,社区估算值已标注;官方权重以各厂商为准。