SmartCall:AI语音RAG+IVR融合落地技术解析

📅 2026/7/30 20:09:29 👁️ 阅读次数 📝 编程学习
SmartCall:AI语音RAG+IVR融合落地技术解析

一、行业痛点:语音场景下 RAG 与传统 IVR 的天然冲突

传统按键 IVR 流程固化、交互生硬,接入大模型 RAG 知识库后又暴露出三大核心技术瓶颈,也是绝大多数呼叫中心项目落地卡壳的难点:

1. 对话时序割裂,通话空白卡顿

文本 RAG 可完整检索知识库后再输出回答,但实时语音通话存在强时序约束。用户通话中等待超过 1.5 秒就会感知 “AI 卡住”;传统架构先检索、再生成、再 TTS 播报,链路串行耗时普遍 3~6 秒,客户体验极差。

2. IVR 静态流程与大模型动态意图无法联动

传统 IVR 是固定分支判断(按键 1 查订单、按键 2 售后),而大模型能识别自由话术意图,但两者数据不互通:AI 识别出用户要查订单,无法自动驱动 IVR 调用订单 API、提取手机号、生成工单;想打通就要重复开发大量胶水代码,改一次业务流程就要重启服务。

3. 模型幻觉 + 业务合规双重风险

纯大模型对话容易编造业务规则(幻觉问题),政务、金融、民生热线有严格合规审计要求;只靠 RAG 检索又无法联动通话录音、工单归档、坐席转接等 IVR 基础能力,知识准确性与业务流程无法兼顾。

市面上多数 SaaS 呼叫中心采用 “AI 机器人、IVR 流程两套独立引擎” 的分离架构,只能简单拼接,无法从底层解决时序、联动、合规三大痛点。而开源项目SmartCall(底层核心模块 SmartAster)基于 Java17+SpringBoot3+Asterisk 通信引擎,通过流式 RAG 调度 + LogicFlow 可视化 IVR 双引擎融合架构,从底层通信层打通语音、知识库、流程编排,完整解决上述问题。

项目开源地址:https://gitee.com/gdzWork/SmartCall

官方站点:https://qidiangk.com/

二、SmartCall 核心技术方案:三层融合架构拆解

2.1 整体分层架构

整体分为通信底座层、IVR 流程编排层、AI 智能体 RAG 层三层解耦设计,通过 AGI/AMI 协议打通 Asterisk 话务与上层业务,实现双向数据互通:

1.通信底座层:Asterisk PBX 负责 SIP 通话、ASR/TTS 语音流传输,通过 AGI 接口将每一通通话送入 SmartAster 流程引擎;

2.IVR 编排层:基于 LogicFlow 自研 13 + 呼叫专用节点,流程执行时实时向 AI 层透传对话上下文、通话变量;

3.AI 智能体 RAG 层:正则 + 大模型双引擎意图识别,内置 MaxKB 知识库,流式检索生成,结果回写 IVR 全局变量,驱动流程分支跳转。

2.2 难点 1:流式 RAG 解决语音通话空白卡顿

通用方案缺陷

常规 RAG 执行链路:ASR 转文本→全量知识库检索→大模型完整生成回答→TTS 播报,串行阻塞,通话出现长时间静默。

SmartCall 流式调度优化方案

1. 并行预检索机制

用户语音识别到前半段关键词时,流程节点异步发起知识库预检索,对话完整文本输出前已完成向量召回,消除检索等待耗时;

2. 分片流式生成 + 边生成边播报

大模型输出文本分片后直接推送 TTS 流式合成,无需等待完整回答;用户中途插话(barge-in 打断)时,立刻终止当前生成流,重置检索上下文;

3. 高频问答本地缓存

水电燃气、社保查询等高频咨询结果存入内存向量缓存,命中缓存时检索耗时压缩至 200ms 内,极致缩短等待时间。

实测民生服务场景,AI 应答平均等待时长控制在 0.8~1.2 秒,无明显通话空白。

2.3 难点 2:可视化 IVR 与大模型意图双向联动

传统方案中,IVR 流程和 AI 对话完全隔离,业务变更必须后端开发改代码。SmartCall 通过自定义 LogicFlow 节点实现双向互通:

1. AI 意图驱动 IVR 流程

内置Intention意图识别节点,调用通义千问 / DeepSeek 大模型解析用户话术,输出订单查询、投诉、账单提醒等标准化意图;流程画布直接配置条件分支,识别到对应意图自动跳转查单、工单、外呼回访子流程,无需开发。

示例:用户说 “我要查上个月燃气账单”,大模型识别「账单查询」意图,IVR 自动触发变量提取节点读取手机号,调用燃气业务 API 拉取账单数据,播报完成后自动生成回访工单。

2. IVR 流程变量反哺大模型 RAG

通话中通过变量赋值、信息提取节点抓取手机号、身份证、订单号存入全局会话变量,RAG 检索时自动携带结构化参数过滤知识库,精准匹配用户专属业务资料,避免泛化回答。

3. 在线脚本无缝扩展

IVR 节点支持 Groovy/JS 在线调试,流程中可自定义脚本修改 RAG 检索权重、调整大模型 Prompt,运营人员无需部署后端即可快速适配新业务规则。

2.4 难点 3:RAG 知识库 + 全链路通话合规审计

政务、金融行业要求通话录音、问答溯源、关键词质检全留痕,SmartCall 打通 RAG 与通话管理模块,实现合规闭环:

1. 知识库溯源绑定通话记录

AI 每一条回答附带知识库原文索引,通话录音、转写文本、检索文档片段、大模型 Prompt 全部关联唯一通话 TraceID,支持一键导出审计日志;

2. 双引擎兜底规避模型幻觉

采用「正则快速匹配 + 大模型深度识别」双策略:标准化 FAQ 先走正则引擎,直接返回精准话术;复杂政策、多轮咨询再调用 RAG 大模型,同时设置置信度阈值,检索相关性低于阈值自动跳转人工坐席;

3. 全量通话质检内置

系统自带录音转写、关键词检测、坐席评分模块,批量外呼、政务热线、售后投诉场景可自动筛查违规话术,满足行业监管要求。

三、多行业场景落地实践(技术落地效果)

场景 1:政务热线智能分流

传统痛点:人工坐席全天承接海量市民来电,分类工单耗时久、分流错误率高。

SmartCall 实现逻辑

市民进线→ASR 转文字→大模型意图识别(社保、公积金、户籍、投诉)→IVR 自动分支流转对应部门工单→RAG 匹配政策文档自助解答,复杂诉求自动转接对应坐席队列,全流程审计留痕。

落地收益:人工分流工作量降低 65%,7×24 小时自助承接 80% 高频咨询。

场景 2:民生水电燃气咨询

传统痛点:重复咨询占用大量人力,夜间无客服无法响应。

SmartCall 实现逻辑

可视化 IVR 搭建查费、报修、过户全流程,RAG 导入本地政策文档,流式 AI 实时应答;提取用户户号自动联动业务系统查询账单,支持定时外呼账单提醒,通话结果自动归档。

场景 3:企业售后 + 营销外呼

传统痛点:批量外呼人工成本高,意向客户筛选效率低。

SmartCall 实现逻辑:批量导入外呼任务,AI 主动对话完成产品介绍、需求收集,IVR 提取意向标签存入变量;高意向客户一键转接人工,低意向客户自动生成回访工单,大模型实时推送坐席辅助话术。

四、开源源码方案对比:SaaS 年费 vs SmartCall 源码买断

对比维度传统 SaaS 呼叫中心SmartCall 开源源码方案
成本模式按坐席 / 并发年费,长期成本叠加一次买断,永久商业授权,终身免费更新
数据安全数据存储第三方平台,无法私有化100% 无加密 Java/Vue 源码,私有部署,数据自主可控
定制能力功能固化,深度定制受限全链路二次开发,IVR 节点、大模型、通信层均可改造
使用限制续费中断即停止服务永久有效,不限坐席、不限并发
AI 适配仅支持平台内置模型自由对接通义千问、DeepSeek、MaxKB、Dify 等任意大模型 / 知识库

五、快速上手部署流程

1. 拉取开源源码:git clone https://gitee.com/gdzWork/SmartCall

2. 环境准备:JDK17 + MySQL8 + Asterisk 通信服务

3. 初始化数据库,配置 ASR/TTS、大模型 API 密钥

4. 后台进入可视化 IVR 画布,拖拽节点搭建业务通话流程

5. 导入企业业务文档至 MaxKB 知识库,开启 RAG 智能问答

6. 配置 SIP 线路,发起呼入 / 外呼测试,流程在线调试即时生效

六、结语

当前多数 AI 呼叫中心仅做到 “大模型简单对接语音”,并未解决实时语音场景下 RAG 与 IVR 流程深度融合的底层技术问题。SmartCall 依托开源完整源码、三层融合架构、流式 RAG + 可视化编排的核心设计,一站式解决卡顿、流程割裂、合规幻觉三大行业难题。

项目完全开源商用无限制,支持私有化部署与深度二次开发,政务、民生、企业客服、营销外呼全场景开箱即用。欢迎前往 Gitee 下载源码体验,官网https://qidiangk.com/ 可预约产品演示与技术方案讲解。