← 返回全部产品与方案
客服 · 销售智能体产品方案 · 软硬结合原型
📞

客服销售自动电话智能体系统

Auto Call Sales & Service Agent System

软硬件结合 · ESP32 HFP 转 SIP 用 20 元把普通手机升级为 SIP 终端

把"销售/客服电话"做成一个可自主对话的语音 Agent:前端用 ESP32 外挂蓝牙以 HFP 协议零门槛接管任意手机通话音频,再经 SIP/WebRTC 推送到基于 Rust 的 active-call 语音引擎,由 LLM 实时驱动对话、销售转化与自动接听。硬件 BOM 不到 20 元,云端支持离线 ASR/TTS 与云端双引擎,隐私合规与即插即用兼得。

产品演示

核心模块

🖥️

客服销售通话智能体 · 实时对话 UI

产品模块
客服销售通话智能体 · 实时对话 UI

硬件 · 软件 · 业务编排 三层协同

ESP32 HFP 蓝牙网关 + active-call Rust 语音引擎 + Playbook Markdown 业务编排,把任意手机升级为 AI 智能通话终端。

📡

ESP32 HFP → SIP 蓝牙网关

20 元 · 零门槛硬件方案

ESP32 模组伪装成蓝牙耳机,通过 HFP(Hands-Free Profile)协议获取通话双向音频,再经 Wi-Fi 推到 SIP 服务器。无需 Root/越狱、无需装 App,华为 / 小米 / OPPO / vivo / iPhone 全覆盖。硬件 BOM 成本约 15-25 元,体积类似蓝牙适配器,可夹在手机壳或放口袋。

⚙️

active-call 语音引擎(Rust)

高性能 · 双引擎对话

基于 Rust 的语音 Agent 引擎(miuda-ai/active-call,MIT)。三路音频入口(SIP UDP/TCP/TLS/SIPS、WebRTC SRTP、WebSocket),双对话引擎:传统 VAD→ASR→LLM→TTS 管线 + OpenAI/Azure Realtime 全双工流式。内置 nnnoiseless 降噪、WebRTC AGC2、打断策略、环境音混音。

📋

Playbook 业务编排(Markdown)

零代码配置业务逻辑

用 Markdown 文件定义 persona / scene / flow,支持 Jinja2 模板、SIP 头提取、DTMF 收号、HTTP 工具调用、变量、转人工。例如"售后场景"调用 CRM API、"订单场景"用 <collect> 收号、"繁忙场景" <refer to="sip:agent@..."> 转人工坐席。执行引擎与对话大脑解耦,对话策略可整体替换。

🔒

离线 AI · 隐私优先

ASR/TTS 全本地运行

可选启用 SenseVoice(zh/en/ja/ko/yue ASR)+ Supertonic(en/ko/es/pt/fr TTS)离线模型,全程不调用云端 API。Docker 一键下载模型(大陆可走 hf-mirror.com 镜像)。适合金融 / 医疗 / 政企等强合规场景,也可作为云端故障兜底。

行业现状与痛点

线束行业不缺 CAD 工具,缺的是能真正看懂图纸、提取 BOM、校验连接关系并生成挂板图的系统。

🚫

手机厂商限制通话录音

大部分国产安卓品牌(华为、小米、OPPO、vivo)出于隐私合规考虑系统层限制第三方应用录音通话,用户需要 Root 或刷机才能绕过。

🍎

iOS 完全封闭

苹果 iOS 不向第三方应用开放通话录音 API,用户几乎无法在 iPhone 上实现通话录音,导致大量商务用户流失关键信息。

🔐

权限配置复杂

即使部分手机支持通话录音应用,也需要授予通话记录、麦克风、通知等多个敏感权限,普通用户操作门槛高,落地率低。

📉

关键信息遗漏严重

销售人员每天遗忘约 30% 的通话关键信息(客户预算、承诺交付时间等),靠记忆或手写笔记极易出错,事后补录成本高。

⏱️

手动整理效率低下

通话结束后手动整理记录平均需要 5-10 分钟,每天 10+ 通电话的销售人员累计浪费大量工作时间,且整理质量参差不齐。

核心能力

硬件蓝牙网关 · Rust 语音引擎 · Markdown 业务编排 · 双引擎对话

多协议音频网关

SIP(UDP/TCP/TLS/SIPS/WebSocket)+ WebRTC(SRTP)+ 原始 PCM 音频 WebSocket,三路入口统一抽象;可注册到 FreeSWITCH / Asterisk / RustPBX,也可直连 Twilio / Telnyx 弹性中继走出 PSTN。

双引擎对话

传统管线(VAD→ASR→LLM→TTS)支持 OpenAI/阿里/Azure/腾讯/Deepgram 等多家厂商;OpenAI/Azure Realtime API 提供全双工流式,对延迟敏感的客服场景可降至 1s 以内首响。

Playbook 业务编排

Markdown 文件即定义一个有状态的语音机器人:场景切换、<http> 工具调用、<collect> 收号、<set_var> 暂存、<refer> 转人工、<hangup_headers> 回写 SIP BYE。零代码集成业务系统。

高性能媒体核心

TinySilero VAD:60 秒音频 ~60ms(RTF 0.0010),比 ONNX Silero 快 2.5×;Codec 支持 PCM16 / G.711 PCMU/PCMA / G.722 / Opus;内置 AGC2 + 降噪 + 环境音混音 + 智能打断。

全链路可观测

基于 tracing 的结构化日志 + /list、/events/{id}(SSE)、/api/records 通话事件流;TIMELINE 多层甘特图(USER/ASR/LLM/BOT)实时呈现每通电话的事件时序与延迟分布,便于质检与优化。

离线/云端双部署

默认 offline 特性(SenseVoice + Supertonic)即可脱离云端 API 跑通完整链路;保留云端供应商切换能力,按合规、成本、延迟灵活选择。Docker 一键部署 + graceful shutdown。

一次通话的全链路

从手机拨号到云端 AI 对话 · 10 步闭环

工程流程
1
用户拨打 / 来电接入
客户拨打 13800138000 或坐席发起外呼,手机自动通过蓝牙与 ESP32 网关配对,无需额外操作。
2
ESP32 HFP 蓝牙接管音频
ESP32 以蓝牙耳机身份建立 HFP 连接,截获双向音频流(SCO/eSCO),本地缓冲并通过 Wi-Fi 推送。
3
SIP / WebRTC 网关入会话
音频流经 SIP INVITE 或 WebRTC SRTP 进入 active-call 引擎,调用 create_invitation_handler 创建 ActiveCall 会话对象。
4
VAD 端点检测
TinySilero VAD(~60ms/60s,RTF 0.0010)实时判断说话起止,触发静音超时则进入 followup / timeout 策略。
5
ASR 语音识别
SenseVoice(离线)/ sonosonic·阿里·腾讯·Deepgram(云端)将语音转为文本,支持 zh/en/ja/ko 多语种与方言。
6
LLM 对话推理
阿里 Qwen-Plus / OpenAI / Azure 等 LLM 结合 Playbook 模板与上下文生成回复,支持 RAG 检索与业务工具调用。
7
TTS 语音合成
CosyVoice / 阿里·xiaoxiaoNeural / OpenAI / Supertonic 等合成语音;支持流式输出,进一步压缩首响延迟。
8
双向音频回传
合成后的语音回灌到 ESP32 → 手机蓝牙 → 客户耳朵;同时把客户的下一句语音接入下一轮 ASR 循环。
9
业务编排与工具调用
Playbook 中的 <http> 查 CRM/<collect> 收 DTMF/<set_var> 暂存/<refer> 转人工等在运行时扩展 LLM 能力。
10
通话记录与录音落库
CDR + 录音以 local/S3/Http 三种方式落盘,TIMELINE 多层事件流可视化,便于质检、训练与合规审计。

关键成效

把技术能力沉淀为可量化、可复用的结果。

15-25
硬件 BOM 成本
0.0010
VAD 推理实时率
<1s
Realtime API 流式延迟
30%
通话信息遗漏下降

核心突破点

难点不在于单点突破,而在于把突破稳定、可复用地工程化。

📡

硬件零门槛接入

20 元 ESP32 模组把任意手机(包括 iPhone)变成 SIP 终端,彻底绕开手机厂商与系统的权限壁垒,业内尚无同价位同类方案。

🧠

执行引擎与对话大脑解耦

PlaybookRunner 只负责事件分发与命令执行;DialogueHandler 是策略实现,可整体替换为规则引擎 / NLP / 自研 LLM 编排而不动核心通话逻辑。

📋

Playbook Markdown 编排

<http> 工具调用 / <collect> DTMF 收号 / <set_var> 变量 / <refer> 转人工 / <hangup_headers> 业务结果回写,零代码集成 CRM、工单、知识库等业务系统。

🔒

离线 ASR/TTS 全本地

SenseVoice + Supertonic 全本地推理,无云端 API 调用,配合 Docker 一键部署,满足金融 / 医疗 / 政企的强合规需求。

业务价值

把技术能力转化为可量化、可复用的业务价值。

带来的提升
通话全程录音转写,销售人员不再遗忘 30% 的关键信息(客户预算、承诺交付时间等)。
通话结束立即生成结构化摘要 + 行动项,无需手动整理,每通电话节省 5-10 分钟。
忙碌 / 驾驶 / 会议时由 AI Agent 按预设话术自动接听,会后再统一推送对话内容。
通话转写记录可复盘销售话术,定位金牌话术与薄弱环节,赋能新人培训与话术迭代。
适用场景
销售外呼:客户开发、价格谈判、订单确认。
客服接待:售后答疑、订单查询、退换货处理。
订单处理:DTMF 收号 / 验证码 / 订单号 + CRM 自动建单。
自动接听:电话转接前的 AI 接待,智能路由或转人工坐席。
📌

内容持续更新中

该产品的介绍内容已基于内部资料整理上线,以下为后续可继续深化的方向:

通话演示视频(call-agent 真实通话录音与转写回放)
与 CRM / 工单系统的对接案例与字段映射
压测数据:并发呼叫数 / 媒体性能 / 长稳运行
转人工桥接(<refer to="sip:agent@...">)的实战配置
联系我们

开启 AI 合作

无论您身处政务、金融、制造、消费还是内容领域,我们都能为您定制垂直 AI 智能体方案

📍

公司地址

福建省厦门市 · 拟落地武汉 OPC

📧
🌐

官方网站

www.xianma.top

贤码智能

厦门贤码智能科技有限公司

© 2024-2026 厦门贤码智能科技有限公司 · AI 智能体解决方案提供商 · www.xianma.top

产品与方案:15个在研 / 落地项目