优搜 / 数据速查 / AI 模型速查

AI 模型速查

共 12 个主流模型:参数量、上下文、硬件与量化建议速查。

GPT-5.3
OpenAI
参数量未公开(社区估算 2T+,MoE)
上下文500K tokens
发布时间2026-05
硬件要求云端 API(FP8/BF16 集群);本地近似可跑开源蒸馏版,需 8×H200 或 1TB+ 显存
量化建议官方云端不开放权重;本地近似常用 GPTQ/AWQ 4-bit,FP8 为甜点位
适用场景复杂推理、代码、通用 Agent
Claude 4.6 Opus
Anthropic
参数量未公开(社区估算 1T+)
上下文1M tokens
发布时间2026-03
硬件要求云端 API;本地无可下载权重,仅能跑开源近似模型(需 8×H200)
量化建议官方云端 FP8/BF16;本地近似用 4-bit GPTQ 开源模型
适用场景长文、审计、企业高可靠任务
Gemini 3.5 Pro
Google
参数量未公开(MoE,估算数百 B)
上下文2M tokens
发布时间2026-05
硬件要求云端 TPU;本地近似可跑 Gemma 3 系(单卡 24GB 可跑 27B)
量化建议官方 TPU FP8;本地 Gemma 用 Q4_K_M / AWQ 4-bit
适用场景多模态、超长上下文、搜索增强
DeepSeek-V4
DeepSeek
参数量未公开(MoE,估算 1T+ / 激活约 40B)
上下文256K tokens
发布时间2026-06
硬件要求官方 API;满血本地需 8×H200;4-bit 量化可在 4×80GB 上跑
量化建议官方 FP8 开源;社区 GPTQ/AWQ 4-bit 最常用
适用场景高性价比通用模型、中文与代码
Qwen3-Max
阿里通义
参数量未公开(MoE,估算 1T+)
上下文256K tokens
发布时间2026-04
硬件要求云端 API;开源近似 Qwen3-235B 可用 2×48GB Q4 跑
量化建议官方 FP8;开源版 GPTQ/AWQ/GGUF 全套
适用场景中文、代码、可私有化部署
GLM-5
智谱
参数量未公开(MoE,估算 500B/激活 36B)
上下文256K tokens
发布时间2026-06
硬件要求云端 API / MaaS;本地近似可跑 GLM-4-9B(单卡 16GB)
量化建议官方 API FP8;开源 9B/32B 用 GGUF Q4/Q5
适用场景国内合规、工具调用、Agent 生态
Kimi K3
月之暗面
参数量未公开(MoE,估算 1T+ / 激活 32B)
上下文256K tokens
发布时间2026-05
硬件要求云端 API;开源权重 4-bit 需 4×80GB 或 Mac 集群
量化建议官方开源;社区 AWQ 4-bit 常用
适用场景超长文、深度推理
Llama 5
Meta
参数量未公开(MoE,估算 700B / 激活 20B)
上下文1M tokens
发布时间2026-07
硬件要求单卡 H200 可跑 4-bit;BF16 需 8×80GB
量化建议官方 BF16 + 社区 GGUF Q4_K_M / GPTQ
适用场景开源多模态、研究/私有化
Mistral Large 4
Mistral AI
参数量未公开(MoE,估算 300B)
上下文256K tokens
发布时间2026-05
硬件要求BF16 需 8×80GB;Q4 量化 2×80GB 可跑
量化建议官方 BF16 开源;GGUF/AWQ 4-bit 常用
适用场景欧洲合规、企业私有化
Grok 5
xAI
参数量未公开(社区估算 1T+)
上下文256K tokens
发布时间2026-08
硬件要求仅云端 API;本地近似跑开源 Grok-1(8×A100)
量化建议云端 FP8;开源 Grok-1 可用 4-bit GPTQ
适用场景实时信息、图像理解、X 平台联动
o5
OpenAI
参数量未公开(小参数推理模型)
上下文300K tokens
发布时间2026-08
硬件要求云端 API,成本低;本地无权重
量化建议云端服务端量化;开源近似用 Qwen3 推理版替代
适用场景低成本复杂推理、数学/编程
MiniMax-Text-03
MiniMax
参数量未公开(MoE,估算 600B / 激活 50B)
上下文300K tokens
发布时间2026-04
硬件要求云端 API;4-bit 本地需 4×80GB
量化建议官方未全开源,社区用 AWQ 4-bit
适用场景中文创作、长文、性价比

参数来自公开资料整理,社区估算值已标注;官方权重以各厂商为准。