模型选择:速度、价格与效果
模型榜单只能告诉你平均表现,不能替你做业务决策。先把任务拆成四个维度:回答质量、延迟、上下文长度和单次成本。
一个简单的评估表
| 任务 | 优先指标 | 建议策略 |
|---|---|---|
| 客服分类 | 延迟、成本 | 小模型优先,置信度不足再升级 |
| 长文总结 | 上下文、稳定性 | 先测截断策略,再比较模型 |
| 代码生成 | 正确率、工具调用 | 用自己的代码集做回归测试 |
最稳妥的做法是保留一个“主模型”和一个“兜底模型”,通过兼容接口在服务端切换。这样价格变化或单一供应商故障时,不需要改客户端。
不要忽略隐性成本
重试会放大 token 成本;过长的系统提示词会让每次请求变贵;流式输出虽然改善体感,但连接保持时间更长。把这些变量放进同一个测试脚本,结论会更接近生产。