小樱桃语音交互 · 概念¶
是什么¶
小樱桃是苏子桐的 AI 语音小伙伴——不是助手、不是老师,是永远比苏子桐大 2 岁的姐姐型玩伴。
技术选型¶
| 组件 | 选型 | 原因 |
|---|---|---|
| 硬件 | OH2P 小爱音箱 Pro(刷 xiaozhi-esp32 固件) | 开源、低成本、可自控 |
| 桥接器 | open-xiaoai-xiaozhi | 开源中间层,连接音箱与服务器 |
| 服务器 | xiaozhi-esp32-server(Docker) | 全栈语音服务 |
| LLM | glm-4.5-air(智谱,备用 deepseek-chat) | 免费额度大、中文好、支持PowerMem |
| TTS | CosyVoice2-0.5B:anna(硅基流动) | 音质好、延迟低 |
| ASR | FunASR SenseVoiceSmall(本地) | 离线稳定、延迟低 |
| 记忆 | PowerMem(SQLite + embedding-3 1536维) | 本地向量记忆 |
| 稳定层 | stable_profile.txt(你维护的权威画像) | 每次对话按话题匹配注入 |
关键参数(当前实际值)¶
| 参数 | server | bridge |
|---|---|---|
| VAD threshold | 0.30 | 0.10 |
| VAD threshold_low | 0.20 | 0.01 |
| min_silence | 1200ms | 1200ms(两端统一) |
| 音量增益 | +6dB | +6dB(codec.py)+3dB(TTS gain) |
| 记忆 | PowerMem 动态层 | stable_profile.txt 稳定层 |
用户画像 — 双层注入¶
<memory>
<stable_profile> ← 你维护的文件,按话题匹配
[聊RAZ → 只注入学习块]
[聊叶罗丽 → 只注入兴趣块]
[不命中 → 只注入概要]
</stable_profile>
<dynamic_profile> ← PowerMem 自动学习
[AI 对话中提取的印象]
</dynamic_profile>
优先级:stable > dynamic
</memory>
反哺机制(新版)¶
旧机制(已废弃):融合画像 → inject_portrait_to_powermem.py → 向量切片 → PowerMem
新机制:融合画像 → stable_profile_generator.py → stable_profile.txt → 每句话直接注入
详细运维参数见 SOP-001