一句话结论
模型能力、价格和可用范围会变化;先从当前 Key 分组挑 2—3 个候选,再用自己的 5—10 条真实任务评测。
适用场景
- 刚开始接 API,想知道默认选哪个
- 已经上线但发现某类任务效果差
- 想为客户做一份模型推荐
常见现象
- 中文长文输出乱、断句奇怪
- 代码任务连续几次跑偏
- 成本控不住,想换更便宜的模型
原因解释
- 不同模型在不同任务上的表现不一样,而且会随版本更新
- 标称上下文不等于实际任务质量,还要考虑有效输入、输出上限和工具支持
- 访问稳定性、数据政策、价格和合规要求需要结合所在地区与业务判断
仍然不行怎么办
- 选不出来就主用 + 备用两个模型,别只押一家
- 评测样本太小不准就再加 5 条真实任务
2026 年 8 月:Codex 旧模型退役提醒
- OpenAI 已公告:使用 ChatGPT 登录 Codex 时,GPT-5.4 与 GPT-5.4 mini 将于 2026-08-31 从 Codex 退役;固定使用它们的默认配置、自定义 Agent 和计划任务应提前迁移,并用原评测样本回归测试。
- 这次公告不影响使用自有 OpenAI API Key 登录的 Codex,也不表示 OpenAI API 会在同一天移除这两个模型。
- 不要把这项 Codex 登录方式公告机械套用到 1A1API Key 分组;1A1API 的可用模型、权限和计费继续以当前控制台及帮助中心为准。
小白先准备什么
- 先准备 10 条真实任务,不要只看模型排行榜。
- 每条任务写清楚好答案标准,例如准确、便宜、快、少废话、会引用资料。
- 至少选一个强模型、一个便宜模型、一个备用模型做对比。
- 记录每次测试的回答质量、速度、失败率和预估成本。
验收标准
- 每个业务场景都有主模型和备用模型。
- 简单任务不会默认走最贵模型。
- 重要任务有质量检查或人工复核。
- 模型切换后,关键 Prompt 和输出格式仍然稳定。
可复制评测表
| 任务 | 模型 | 准确度 1-5 | 速度 1-5 | 成本 1-5 | 是否可上线 | 备注 |
| --- | --- | --- | --- | --- | --- | --- |
| 客服分类 | ___ | ___ | ___ | ___ | ___ | ___ |
| 长文总结 | ___ | ___ | ___ | ___ | ___ | ___ |
| 代码修改 | ___ | ___ | ___ | ___ | ___ | ___ |
| 知识库问答 | ___ | ___ | ___ | ___ | ___ | ___ |
常见误区和不适合场景
- 误区一:只看别人推荐,不测自己的真实任务。
- 误区二:只看一次回答好不好,不看长期稳定性和失败率。
- 误区三:没有备用模型,主模型限流时整个工作流停掉。
- 不适合:答案必须 100% 正确但没有人工复核的高风险场景。
还卡着?
仅把删除凭证、客户数据和环境变量值后的必要截图、日志片段、需求说明或当前页面链接发到 zhemuy@gmail.com。