| DeepSeek |
DeepSeek-V3.2 |
2025-12-01 |
128K |
V3 线收官一代,思考/非思考都能用工具,长上下文更省,成为 V4 之前的默认模型。 |
| Anthropic |
Claude Opus 4.5 |
2025-11-24 |
200K |
4.x 中期旗舰,强调最强推理,并与上下文压缩、Claude for Excel 等产品能力一起推出。 |
| xAI |
Grok-4.1 Fast |
2025-11-19 |
2M |
4.1 的高速长上下文版本,适合检索、浏览和低延迟对话。 |
| Gemini |
Gemini 3 |
2025-11-18 |
1048576 |
Gemini 3 代起步,多模态和 Agent 能力再上台阶,上下文约 100 万。 |
| xAI |
Grok-4.1 |
2025-11-17 |
256K |
幻觉显著少于 Grok-4,推理和创意写作更好,一度登上 LMSYS Arena 前列。 |
| OpenAI |
GPT-5.1 |
2025-11-12 |
400K |
GPT-5 第一次大版本升级,Instant 更温暖、更好跟指令,Thinking 在简单题上更快、复杂题上更持久。 |
| Kimi |
Kimi K2 Thinking |
2025-11-06 |
256K |
K2 推理专用档,默认深度思考,适合数学、复杂规划和长程 Agent。 |
| Anthropic |
Claude Haiku 4.5 |
2025-10-15 |
200K |
4.5 代最快模型,编码和电脑使用接近 Sonnet 4,价格更低,适合浏览器代理和高并发。 |
| 智谱 GLM |
GLM-4.6 |
2025-09-30 |
200K |
上下文从 128K 提到 200K,继续加码编码、推理、工具和 Agent。 |
| Anthropic |
Claude Sonnet 4.5 |
2025-09-29 |
200K |
当时最强的真实世界 Agent / 编码 / 电脑使用 Sonnet,成为 Claude in Chrome 等产品的默认模型。 |
| 通义千问 |
Qwen3-Max |
2025-09-24 |
256K |
Qwen3 托管旗舰,编码和知识工作强,上下文 256K。 |
| DeepSeek |
DeepSeek-V3.1-Terminus |
2025-09-22 |
128K |
修复中英混杂和异常字符,稳定 V3.1 的语言一致性和 Agent 行为。 |
| xAI |
Grok-4 Fast |
2025-09-19 |
2M |
大幅降低思考 token 的高速版本,上下文可扩到 200 万,单位智能成本远低于早期前沿模型。 |
| OpenAI |
GPT-5-Codex |
2025-09-15 |
400K |
面向智能体编程优化的 GPT-5 变体,成为 Codex 默认模型,擅长仓库级改动和长程编码任务。 |
| Kimi |
Kimi K2-0905 |
2025-09-05 |
256K |
K2 指令微调更新,上下文提升到 256K,编码和工具调用更稳。 |
| DeepSeek |
DeepSeek-V3.1 |
2025-08-21 |
128K |
同一模型同时支持思考/非思考模式,工具使用和 Agent 任务明显强于 V3/R1。 |
| OpenAI |
GPT-5 |
2025-08-07 |
400K |
统一快模型和深度思考模型的一代旗舰,由实时路由器决定思考强度,成为 ChatGPT 默认模型,API 提供 40 万上下文。 |
| OpenAI |
GPT-5 mini |
2025-08-07 |
400K |
GPT-5 中档尺寸,保留统一路由与推理能力,价格和延迟更适合大规模应用。 |
| OpenAI |
GPT-5 nano |
2025-08-07 |
400K |
GPT-5 最小尺寸,面向高吞吐、低成本场景,仍具备基础推理能力。 |
| Anthropic |
Claude Opus 4.1 |
2025-08-05 |
200K |
Opus 4 的增量升级,复杂推理、分析和创作任务更稳,是 4.5 之前的过渡旗舰。 |