Auto Call Sales & Service Agent System
软硬件结合 · ESP32 HFP 转 SIP 用 20 元把普通手机升级为 SIP 终端
把"销售/客服电话"做成一个可自主对话的语音 Agent:前端用 ESP32 外挂蓝牙以 HFP 协议零门槛接管任意手机通话音频,再经 SIP/WebRTC 推送到基于 Rust 的 active-call 语音引擎,由 LLM 实时驱动对话、销售转化与自动接听。硬件 BOM 不到 20 元,云端支持离线 ASR/TTS 与云端双引擎,隐私合规与即插即用兼得。

ESP32 HFP 蓝牙网关 + active-call Rust 语音引擎 + Playbook Markdown 业务编排,把任意手机升级为 AI 智能通话终端。
ESP32 模组伪装成蓝牙耳机,通过 HFP(Hands-Free Profile)协议获取通话双向音频,再经 Wi-Fi 推到 SIP 服务器。无需 Root/越狱、无需装 App,华为 / 小米 / OPPO / vivo / iPhone 全覆盖。硬件 BOM 成本约 15-25 元,体积类似蓝牙适配器,可夹在手机壳或放口袋。
基于 Rust 的语音 Agent 引擎(miuda-ai/active-call,MIT)。三路音频入口(SIP UDP/TCP/TLS/SIPS、WebRTC SRTP、WebSocket),双对话引擎:传统 VAD→ASR→LLM→TTS 管线 + OpenAI/Azure Realtime 全双工流式。内置 nnnoiseless 降噪、WebRTC AGC2、打断策略、环境音混音。
用 Markdown 文件定义 persona / scene / flow,支持 Jinja2 模板、SIP 头提取、DTMF 收号、HTTP 工具调用、变量、转人工。例如"售后场景"调用 CRM API、"订单场景"用 <collect> 收号、"繁忙场景" <refer to="sip:agent@..."> 转人工坐席。执行引擎与对话大脑解耦,对话策略可整体替换。
可选启用 SenseVoice(zh/en/ja/ko/yue ASR)+ Supertonic(en/ko/es/pt/fr TTS)离线模型,全程不调用云端 API。Docker 一键下载模型(大陆可走 hf-mirror.com 镜像)。适合金融 / 医疗 / 政企等强合规场景,也可作为云端故障兜底。
线束行业不缺 CAD 工具,缺的是能真正看懂图纸、提取 BOM、校验连接关系并生成挂板图的系统。
大部分国产安卓品牌(华为、小米、OPPO、vivo)出于隐私合规考虑系统层限制第三方应用录音通话,用户需要 Root 或刷机才能绕过。
苹果 iOS 不向第三方应用开放通话录音 API,用户几乎无法在 iPhone 上实现通话录音,导致大量商务用户流失关键信息。
即使部分手机支持通话录音应用,也需要授予通话记录、麦克风、通知等多个敏感权限,普通用户操作门槛高,落地率低。
销售人员每天遗忘约 30% 的通话关键信息(客户预算、承诺交付时间等),靠记忆或手写笔记极易出错,事后补录成本高。
通话结束后手动整理记录平均需要 5-10 分钟,每天 10+ 通电话的销售人员累计浪费大量工作时间,且整理质量参差不齐。
硬件蓝牙网关 · Rust 语音引擎 · Markdown 业务编排 · 双引擎对话
SIP(UDP/TCP/TLS/SIPS/WebSocket)+ WebRTC(SRTP)+ 原始 PCM 音频 WebSocket,三路入口统一抽象;可注册到 FreeSWITCH / Asterisk / RustPBX,也可直连 Twilio / Telnyx 弹性中继走出 PSTN。
传统管线(VAD→ASR→LLM→TTS)支持 OpenAI/阿里/Azure/腾讯/Deepgram 等多家厂商;OpenAI/Azure Realtime API 提供全双工流式,对延迟敏感的客服场景可降至 1s 以内首响。
Markdown 文件即定义一个有状态的语音机器人:场景切换、<http> 工具调用、<collect> 收号、<set_var> 暂存、<refer> 转人工、<hangup_headers> 回写 SIP BYE。零代码集成业务系统。
TinySilero VAD:60 秒音频 ~60ms(RTF 0.0010),比 ONNX Silero 快 2.5×;Codec 支持 PCM16 / G.711 PCMU/PCMA / G.722 / Opus;内置 AGC2 + 降噪 + 环境音混音 + 智能打断。
基于 tracing 的结构化日志 + /list、/events/{id}(SSE)、/api/records 通话事件流;TIMELINE 多层甘特图(USER/ASR/LLM/BOT)实时呈现每通电话的事件时序与延迟分布,便于质检与优化。
默认 offline 特性(SenseVoice + Supertonic)即可脱离云端 API 跑通完整链路;保留云端供应商切换能力,按合规、成本、延迟灵活选择。Docker 一键部署 + graceful shutdown。
从手机拨号到云端 AI 对话 · 10 步闭环
把技术能力沉淀为可量化、可复用的结果。
难点不在于单点突破,而在于把突破稳定、可复用地工程化。
20 元 ESP32 模组把任意手机(包括 iPhone)变成 SIP 终端,彻底绕开手机厂商与系统的权限壁垒,业内尚无同价位同类方案。
PlaybookRunner 只负责事件分发与命令执行;DialogueHandler 是策略实现,可整体替换为规则引擎 / NLP / 自研 LLM 编排而不动核心通话逻辑。
<http> 工具调用 / <collect> DTMF 收号 / <set_var> 变量 / <refer> 转人工 / <hangup_headers> 业务结果回写,零代码集成 CRM、工单、知识库等业务系统。
SenseVoice + Supertonic 全本地推理,无云端 API 调用,配合 Docker 一键部署,满足金融 / 医疗 / 政企的强合规需求。
把技术能力转化为可量化、可复用的业务价值。
该产品的介绍内容已基于内部资料整理上线,以下为后续可继续深化的方向:
浏览贤码智能在其他领域的 AI 产品与解决方案