| 智谱 GLM |
GLM-4.5 |
2025-07-28 |
128K |
原生 Agent 混合推理旗舰,355B/32B 激活,MIT 开源,编码和工具使用是核心卖点。 |
| 通义千问 |
Qwen3-Coder |
2025-07-22 |
256K |
仓库级 Agent 编码专用模型,长上下文和工具调用针对软件工程优化。 |
| Kimi |
Kimi K2 |
2025-07-11 |
128K |
约 1T MoE 开源旗舰,激活参数约 32B,主打 Agent、工具和编码,被视为开源侧的重要节点。 |
| xAI |
Grok-4 |
2025-07-09 |
256K |
原生工具使用和实时搜索的多模态旗舰,API 提供 256K 上下文,同期推出 Grok-4 Heavy。 |
| xAI |
Grok-4 Heavy |
2025-07-09 |
256K |
Grok-4 最强计算档,面向 SuperGrok Heavy,用更多计算换更高推理质量。 |
| Gemini |
Gemini 2.5 Flash |
2025-06-17 |
1M |
2.5 高速正式档,可调思考预算,在成本和智能之间灵活折中。 |
| DeepSeek |
DeepSeek-R1-0528 |
2025-05-28 |
128K |
R1 中期更新,推理更强、幻觉更少,补齐 JSON 输出和函数调用。 |
| Anthropic |
Claude Opus 4 |
2025-05-22 |
200K |
Claude 4 旗舰,强调长程智能体和编码,支持延长思考,当时被定位为最强编程模型。 |
| Anthropic |
Claude Sonnet 4 |
2025-05-22 |
200K |
Claude 4 均衡档,相对 3.7 在编码、指令遵循和思考稳定性上全面升级,免费用户也可使用。 |
| 通义千问 |
Qwen3 |
2025-04-29 |
131072 |
混合思考/非思考一代,含 235B-A22B 等 MoE,全面 Apache-2.0 开源。 |
| OpenAI |
o3 |
2025-04-16 |
200K |
o 系列完整推理旗舰,可在 ChatGPT 中代理式调用全部工具,在数学、科学和复杂任务上达到当时最高水平。 |
| OpenAI |
o4-mini |
2025-04-16 |
200K |
与 o3 同期发布的高性价比推理模型,工具调用能力完整,适合需要推理但不想承担 o3 成本的场景。 |
| OpenAI |
GPT-4.1 |
2025-04-14 |
1M |
API 旗舰非推理模型,编码能力强,正式把上下文做到 100 万 token,同期发布 mini / nano。 |
| OpenAI |
GPT-4.1 mini |
2025-04-14 |
1M |
GPT-4.1 的中小尺寸版本,保留百万级上下文和较强编码能力,适合高性价比生产调用。 |
| OpenAI |
GPT-4.1 nano |
2025-04-14 |
1M |
GPT-4.1 最小尺寸,延迟和价格最低,适合分类、抽取和简单补全等大流量场景。 |
| Gemini |
Gemini 2.5 Pro |
2025-03-25 |
1M |
带思考过程的 2.5 旗舰预览,数学、代码和长上下文检索全面领先当时 Gemini。 |
| DeepSeek |
DeepSeek-V3-0324 |
2025-03-24 |
128K |
V3 的重要托管更新,推理、编码、写作、搜索和函数调用全面加强,MIT 开源。 |
| 通义千问 |
QwQ-32B |
2025-03-06 |
131072 |
通义推理开源模型,用 32B dense 做到接近更大模型的数学和代码推理。 |
| OpenAI |
GPT-4.5 |
2025-02-27 |
128K |
研究预览期的超大非推理聊天模型,强调世界知识和写作质量,生命周期较短,随后被 GPT-4.1 / GPT-5 线吸收。 |
| Anthropic |
Claude 3.7 Sonnet |
2025-02-24 |
200K |
首个混合推理 Sonnet,可在即时回答和延长思考之间切换,并同期推出 Claude Code。 |