AIHelms Docs
发布与路由
发布已测试的模型,并配置多部署路由和故障切换。
发布模型
- 进入“模型纳管 > 模型管理”。
- 选中已经测试成功的模型。
- 点击右上角“发布设置”。
- 开启“发布到用户端”。
- 选择可见范围。
- 按需勾选“领用前需要审批”。
- 点击“保存”。

| 设置 | 结果 |
|---|---|
| 全部用户 | 所有用户都能在模型广场看到该模型 |
| 指定部门 | 只有所选部门的用户可见 |
| 领用前需要审批 | 用户提交申请,管理员批准后才能调用 |
| 不需要审批 | 符合可见范围的活跃用户可直接获得资源 |
完成后,使用普通测试账号打开“模型广场”,确认模型卡片和接入信息正常。
如果用户看得到模型但返回 model not allowed,进入“AI 身份 > AI 身份管理”,确认该用户的主 Key 已包含模型。
临时停用一条线路
上游线路故障时:
- 打开模型详情。
- 找到故障部署。
- 点击部署卡片的“禁用”。
- 测试同一模型的其他启用部署。
只关闭“发布到用户端”不会立即处理已经持有 Key 的调用。需要止损时禁用部署或用户 Key。
配置全局路由
只有同一模型配置了多条部署时才需要修改路由。
- 在模型管理页面点击“路由配置”。
- 选择路由策略。
- 填写失败摘除、冷却、重试和超时参数。
- 点击“保存”。

| 策略 | 使用场景 |
|---|---|
轮询 simple-shuffle | 多条同能力线路分摊请求 |
最低延迟 latency-based-routing | 优先使用近期响应较快的线路 |
最低成本 cost-based-routing | 各部署价格已经准确填写 |
最少使用 least-busy | 优先使用当前较空闲的线路 |
按用量均衡 usage-based-routing | 按累计用量分配请求 |
| 参数 | 填写方法 |
|---|---|
| 连续失败摘除 | 一条部署连续失败多少次后临时移出路由 |
| 冷却时间 | 被移出的部署等待多少秒后重新参与路由 |
| 全局重试次数 | 路由层最多重试次数 |
| 全局超时 | 路由层总等待时间 |
部署本身也有重试和超时。修改全局值后,用实际客户端检查总等待时间是否可接受。
添加 Fallback
- 在“路由配置”的 Fallback 链中选择源模型。
- 选择源模型失败时使用的备用模型。
- 点击“添加”。
- 点击“保存”。
备用模型必须与源模型属于同一类别。对话模型不能回退到向量或重排模型。
验证路由
- 分别测试每条部署。
- 连续调用同一平台模型 ID,确认日志中的供应商或部署符合所选策略。
- 临时禁用一条测试部署,再次调用。
- 确认剩余部署或 Fallback 能返回结果。
- 恢复被禁用的部署。
下一步:给用户分配模型。