Auto 模型
model=auto 让系统在请求时刻自动选模,无需硬编码具体模型 ID。选模实践见 Cookbook · Auto 选模。
| 我想… | 去这里 |
|---|---|
| 快速入门 | 快速入门 |
| 模型权限(auto 也受权限约束) | 控制台 · 模型权限 |
| 打开控制台 | 控制台 ↗ |
概述
当你设置为 auto 时,系统会自动选择较合适的模型处理本次推理:
POST /v1/chat/completions
Content-Type: application/json
Authorization: Bearer <token>
{
"model": "auto",
"messages": [
{ "role": "user", "content": "介绍一下量子计算" }
]
}适用场景
| 场景 | 推荐 |
|---|---|
| 快速原型、demo | 直接用 auto,无需纠结选哪个模型 |
| 通用对话、知识问答 | auto 会根据多维度评分选出性价比最高的模型 |
| 日常开发与测试 | 减少因模型下线或改名带来的接入问题 |
| 生产环境但对模型无强偏好 | auto 在候选路由不可用时自动切换,容错更好 |
不适合的场景
| 场景 | 原因 |
|---|---|
| 需要使用特定模型的最新版本或特定能力 | auto 选出的模型不可控,无法指定某个具体模型 |
| 需要记录每次请求实际使用哪个模型 | 响应中 model 字段固定返回 "auto",不暴露解析出的模型代码 |
| 图像生成 / 视频生成 | auto 仅适用于 /v1/chat/completions 端点 |
选路策略
auto 使用内置评分算法从可用路由中选择最佳模型。当前默认策略为 balanced(均衡),综合评估以下维度:
| 维度 | 权重 | 说明 |
|---|---|---|
| 成本 (cost) | 35% | 参考输入/输出单价,优先选择更经济的模型 |
| 延迟 (latency) | 30% | 参考上下文长度,优先选择轻量模型 |
| 稳定性 (stability) | 20% | 基础分,保证各路由之间的稳定竞争 |
| 流式偏好 (stream) | 15% | 流式请求 (stream: true) 获得额外加分 |
说明:评分算法在服务端持续迭代,具体系数可能随版本调整,以上数值仅供参考。
容错行为
- 如果当前没有可用路由(所有上游都不可达),返回 503 Service Unavailable,错误码
no_routable_route - 如果服务端未启用
auto能力,返回 503 Service Unavailable,错误码auto_disabled - 自动选出的模型如果执行失败,可能会触发降级回退到次优路由
响应说明
使用 model=auto 时,响应的 model 字段固定为 "auto":
json
{
"id": "chatcmpl-xxx",
"object": "chat.completion",
"created": 1234567890,
"model": "auto",
"choices": [...],
"usage": {...}
}注意:实际执行模型的代码不会出现在响应中。如需精确记录每次调用使用的模型,请直接指定模型代码而非使用
auto。
排查建议
| 现象 | 排查方向 |
|---|---|
返回 503 auto_disabled | 该工作区或 API Key 未启用 auto 功能,联系管理员 |
返回 503 no_routable_route | 所有候选模型当前均不可用,稍后重试 |
| 响应内容不如预期 | auto 根据评分选出的模型可能不是你期望的那一个,考虑切换到具体模型 |