AIHelms

AIHelms Docs

发布与路由

发布已测试的模型,并配置多部署路由和故障切换。

发布模型

  1. 进入“模型纳管 > 模型管理”。
  2. 选中已经测试成功的模型。
  3. 点击右上角“发布设置”。
  4. 开启“发布到用户端”。
  5. 选择可见范围。
  6. 按需勾选“领用前需要审批”。
  7. 点击“保存”。

模型发布设置

设置结果
全部用户所有用户都能在模型广场看到该模型
指定部门只有所选部门的用户可见
领用前需要审批用户提交申请,管理员批准后才能调用
不需要审批符合可见范围的活跃用户可直接获得资源

完成后,使用普通测试账号打开“模型广场”,确认模型卡片和接入信息正常。

如果用户看得到模型但返回 model not allowed,进入“AI 身份 > AI 身份管理”,确认该用户的主 Key 已包含模型。

临时停用一条线路

上游线路故障时:

  1. 打开模型详情。
  2. 找到故障部署。
  3. 点击部署卡片的“禁用”。
  4. 测试同一模型的其他启用部署。

只关闭“发布到用户端”不会立即处理已经持有 Key 的调用。需要止损时禁用部署或用户 Key。

配置全局路由

只有同一模型配置了多条部署时才需要修改路由。

  1. 在模型管理页面点击“路由配置”。
  2. 选择路由策略。
  3. 填写失败摘除、冷却、重试和超时参数。
  4. 点击“保存”。

全局路由配置

策略使用场景
轮询 simple-shuffle多条同能力线路分摊请求
最低延迟 latency-based-routing优先使用近期响应较快的线路
最低成本 cost-based-routing各部署价格已经准确填写
最少使用 least-busy优先使用当前较空闲的线路
按用量均衡 usage-based-routing按累计用量分配请求
参数填写方法
连续失败摘除一条部署连续失败多少次后临时移出路由
冷却时间被移出的部署等待多少秒后重新参与路由
全局重试次数路由层最多重试次数
全局超时路由层总等待时间

部署本身也有重试和超时。修改全局值后,用实际客户端检查总等待时间是否可接受。

添加 Fallback

  1. 在“路由配置”的 Fallback 链中选择源模型。
  2. 选择源模型失败时使用的备用模型。
  3. 点击“添加”。
  4. 点击“保存”。

备用模型必须与源模型属于同一类别。对话模型不能回退到向量或重排模型。

验证路由

  1. 分别测试每条部署。
  2. 连续调用同一平台模型 ID,确认日志中的供应商或部署符合所选策略。
  3. 临时禁用一条测试部署,再次调用。
  4. 确认剩余部署或 Fallback 能返回结果。
  5. 恢复被禁用的部署。

下一步:给用户分配模型