Skip to content

Auto 模型

model=auto 让系统在请求时刻自动选模,无需硬编码具体模型 ID。选模实践见 Cookbook · Auto 选模

我想…去这里
快速入门快速入门
模型权限(auto 也受权限约束)控制台 · 模型权限
打开控制台控制台 ↗

概述

当你设置为 auto 时,系统会自动选择较合适的模型处理本次推理:

POST /v1/chat/completions
Content-Type: application/json
Authorization: Bearer <token>

{
  "model": "auto",
  "messages": [
    { "role": "user", "content": "介绍一下量子计算" }
  ]
}

适用场景

场景推荐
快速原型、demo直接用 auto,无需纠结选哪个模型
通用对话、知识问答auto 会根据多维度评分选出性价比最高的模型
日常开发与测试减少因模型下线或改名带来的接入问题
生产环境但对模型无强偏好auto 在候选路由不可用时自动切换,容错更好

不适合的场景

场景原因
需要使用特定模型的最新版本或特定能力auto 选出的模型不可控,无法指定某个具体模型
需要记录每次请求实际使用哪个模型响应中 model 字段固定返回 "auto",不暴露解析出的模型代码
图像生成 / 视频生成auto 仅适用于 /v1/chat/completions 端点

选路策略

auto 使用内置评分算法从可用路由中选择最佳模型。当前默认策略为 balanced(均衡),综合评估以下维度:

维度权重说明
成本 (cost)35%参考输入/输出单价,优先选择更经济的模型
延迟 (latency)30%参考上下文长度,优先选择轻量模型
稳定性 (stability)20%基础分,保证各路由之间的稳定竞争
流式偏好 (stream)15%流式请求 (stream: true) 获得额外加分

说明:评分算法在服务端持续迭代,具体系数可能随版本调整,以上数值仅供参考。

容错行为

  • 如果当前没有可用路由(所有上游都不可达),返回 503 Service Unavailable,错误码 no_routable_route
  • 如果服务端未启用 auto 能力,返回 503 Service Unavailable,错误码 auto_disabled
  • 自动选出的模型如果执行失败,可能会触发降级回退到次优路由

响应说明

使用 model=auto 时,响应的 model 字段固定为 "auto"

json
{
  "id": "chatcmpl-xxx",
  "object": "chat.completion",
  "created": 1234567890,
  "model": "auto",
  "choices": [...],
  "usage": {...}
}

注意:实际执行模型的代码不会出现在响应中。如需精确记录每次调用使用的模型,请直接指定模型代码而非使用 auto

排查建议

现象排查方向
返回 503 auto_disabled该工作区或 API Key 未启用 auto 功能,联系管理员
返回 503 no_routable_route所有候选模型当前均不可用,稍后重试
响应内容不如预期auto 根据评分选出的模型可能不是你期望的那一个,考虑切换到具体模型

© Trinity AI