真实项目中,30-50 条这样的语料配合大模型上下文理解即可覆盖 70%+ 高频咨询, 长尾问题通过每周「未命中清单」持续补充。
整个沙盒可以完整跑在 Cloudflare 的免费额度内。下面这套组件划分,也是我们在真实项目里的标准做法。
业务路由与推理编排:接收消息 → 检索 → 组装 System Prompt → 流式返回。全球 300+ 节点就近响应。
会话状态与轮次计数。SESSION_KV 存 sessionId → chatCount,TTL 3600s 自动过期,天然支持熔断计费。
线索落库。leads 表记录机构、姓名、手机、来源场景与时间戳,可直连企微 / 飞书 Webhook。
向量检索。语料经 Embedding 入库,命中不到阈值时走兜底话术转人工,杜绝模型自由发挥。
SESSION_KV[sessionId] 得到当前轮次lead_generation_required,不消耗任何推理成本