宠物医生答不过来的问题,我按症状轻重分了四层模型来接
业务痛点:一个被低估的高频场景
我朋友开了一家连锁宠物诊所,三个门店加一个线上咨询小程序。每天线上涌入约 300 条咨询,问题高度分层:
- 60% 左右是常识性问题:“幼猫多久驱一次虫”“狗子吃了葡萄要不要紧”的初级版、“疫苗后嗜睡正常吗”;
- 30% 是需要结合症状判断的问题:“猫咪三天没大便,精神还行,要不要去医院”;
- 8% 是紧急情况:“误食巧克力”“车祸后腿不敢着地”;
- 2% 是纯闲聊或与宠物无关。
最初我用单一旗舰模型接所有问题,效果没问题,但月底一算账:单条对话平均成本约 0.11 元,月均 9000 多条对话,仅模型调用就超过 1000 元,其中超过一半花在“幼猫驱虫”这类问题上——这些用小模型甚至本地规则库就能答好。更麻烦的是响应速度:旗舰模型平均首 token 3.8 秒,小程序端流失率肉眼可见。
架构设计:分层模型 + 三级兜底
改造后的架构核心是「先分类,再路由,全程有兜底」:
第一层:意图与严重度分类器。 用一个轻量模型(或蒸馏出来的小分类器)对每条消息做三件事:识别意图(常识咨询 / 症状判断 / 紧急 / 闲聊)、评估严重度(1-4 级)、提取关键实体(物种、年龄、症状关键词)。延迟控制在 400ms 以内,成本约为旗舰模型的 1/30。
第二层:分级路由。
| 层级 | 场景 | 模型策略 | 单条成本 | 首token |
|---|---|---|---|---|
| L1 | 常识问答 | 小模型 + RAG(自建养宠知识库) | ≈0.004元 | <1s |
| L2 | 症状判断 | 中档模型 + 结构化追问模板 | ≈0.02元 | ~1.5s |
| L3 | 紧急情况 | 旗舰模型 + 强制安全话术 + 直接推人工 | ≈0.12元 | ~3s |
| L4 | 闲聊/无关 | 本地规则拒答,零模型调用 | ≈0 | 即时 |
第三层:三级兜底。
- 超时兜底:任何模型调用超过 5 秒,网关自动降级到低档模型重试;
- 异常兜底:上游服务商报错或限流,网关切换备用渠道,用户无感知;
- 安全兜底:L3 场景无论 AI 答得多好,结尾强制追加“请立即联系附近宠物医院”,并同步推送给值班医生工单。
这个兜底设计在医疗场景不是锦上添花,是底线。AI 误判“观察一下就好”而耽误救治,任何团队都承担不起。
关键实现步骤
落地时我建议按这五步走,每一步都能独立验证:
# 伪代码:分层路由核心逻辑
def route_message(msg):
# 第一步:轻量分类(延迟 < 400ms)
intent = classifier.classify(msg) # 意图 + 严重度 + 实体
# 第二步:严重度优先于意图
if intent.severity >= 3: # 紧急:旗舰 + 人工介入
reply = call_model("flagship", msg, timeout=5,
fallback="mid-tier")
reply += SAFETY_NOTICE # 强制安全话术
notify_vet_oncall(msg, reply) # 推送值班医生
elif intent.severity == 2: # 症状判断:中档模型
reply = call_model("mid-tier", msg,
prompt=STRUCTURED_ASK_TEMPLATE)
elif intent.type == "faq": # 常识:小模型 + 知识库
reply = rag_answer(msg, kb="pet_care_kb",
model="small")
else: # 闲聊:规则拒答,零成本
reply = RULE_BASED_REJECT
return reply流程清单(对应代码之外的工程动作):
- 建知识库:整理 500+ 条经兽医审核的 FAQ 和护理知识,向量化入库,这一步是 L1 准确率的地基;
- 打分类标:从历史对话抽 2000 条人工标注严重度,训练或微调分类器,准确率目标 90% 以上;
- 写安全话术:与合作的执业兽医一起定义 L3 触发词表和免责话术,务必留档;
- 灰度上线:先只对 10% 流量开放 AI 回复,其余走人工,对比抽检;
- 监控迭代:每周复盘被降级、被人工接管的比例,持续调整分类阈值。
为什么统一走 AI API 网关
这个架构要同时管 4 档模型、2 个以上服务商,如果每档模型各配各的密钥和 SDK,会发生什么?密钥散落在代码里,某家服务商调价或限流,你就得连夜改代码、重新发版。
统一 AI API 网关把所有模型调用收拢到一个入口后,收益是具体的:
- 模型切换零代码改动:路由表里"mid-tier"指向哪个具体模型,在网关后台改一下即可,从“改代码—测试—发版”约 2 小时压缩到 5 分钟;
- 密钥统一管理:一套密钥管全部模型,轮换和成本归集不再翻多个控制台,每月对账从约半天缩到 10 分钟;
- 降级和重试逻辑只写一遍:超时兜底、备用渠道切换在网关层统一配置,不用在每个业务模块里重复实现;
- 成本可观测:每档模型的调用量和费用一目了然,分层优化的效果直接可量化。
效果对比
改造三个月后的数据(自家项目实测,仅供参考口径):
- 单条对话平均成本从 0.11 元降到 0.021 元,降幅约 80%,月模型费用从 1000 元级降到 200 元级;
- L1 场景首 token 从 3.8 秒降到 0.9 秒以内,小程序咨询完成率提升约 15%;
- 人工客服工作量减少约六成,主要集中在 L3 紧急转接——这本来就是他们该干的活。
对小团队来说,分层模型的本质不是技术炫技,而是把有限预算砸在真正需要旗舰模型判断力的那 8% 问题上。
如果你也在做类似的 AI 应用,想让多模型路由、自动降级和成本统计这些脏活一次搞定,可以试试这个统一 AI API 网关:https://api.thistoken.ai/register
---
想直接跑通示例?访问 https://api.thistoken.ai/register 注册 ThisToken.AI,获取 API Key 后即可开始。