Open-LLM-VTuber — 开源本地 AI 虚拟伴侣,支持实时语音交互、语音打断、视觉感知和 Live2D 动态表情,全功能可完全离线运行。8.97k stars,Python 实现,灵感来自 Neuro-sama,支持 Windows / macOS / Linux。
当前处于活跃开发状态(v1.x),v2.0 完整重写版本正在规划中。
定位
“Talk to any LLM with hands-free voice interaction, voice interruption, and Live2D talking face running locally across platforms”
目标是以开源方案复现 Neuro-sama 的能力,打造可本地运行的 AI 虚拟伴侣(虚拟女友/宠物/角色均可),而非依赖云端服务。
核心特性
交互能力:
- 语音打断:AI 说话时用户可直接打断,且 AI 不会听到自己的声音(无需耳机)
- 视觉感知:支持摄像头输入、屏幕截图/录屏,AI 可以”看到”用户和屏幕
- 触摸反馈:通过点击/拖动与 Live2D 角色互动
- 主动发言:AI 可主动开启对话
- 内心独白:显示 AI 的情绪/思考/动作,不朗读出来
- 聊天记录持久化:断点续聊,不丢失历史
Live2D:
- 表情映射(后端情绪控制 Live2D 表情)
- 桌面宠物模式:透明背景 + 全局置顶 + 鼠标穿透,可拖至屏幕任意位置
两种使用模式:Web 版 + 桌面客户端
模型支持矩阵
| 类型 | 支持方案 |
|---|---|
| LLM | Ollama、OpenAI 兼容 API、Gemini、Claude、DeepSeek、Mistral、Zhipu、GGUF、LM Studio、vLLM 等 |
| ASR(语音识别) | sherpa-onnx、FunASR、Faster-Whisper、Whisper.cpp、Groq Whisper、Azure ASR 等 |
| TTS(语音合成) | sherpa-onnx、MeloTTS、GPTSoVITS、CosyVoice、Edge TTS、Fish Audio、Azure TTS、Bark 等 |
架构与可扩展性
src/
├── 模块化设计:LLM / ASR / TTS 均可通过配置文件切换,无需改代码
├── Agent 接口:可集成任意 Agent 架构(HumeAI EVI、OpenAI Her、Mem0 等)
├── Live2D 前端:Web + 桌面客户端(Electron)
frontend/ # Web 前端
live2d-models/ # Live2D 模型
characters/ # 角色配置
prompts/ # 角色 Prompt
- 配置通过
conf.yaml管理,支持热切换各功能模块 - TTS 翻译支持:中文聊天但 AI 用日语发声
与 moeru-ai/airi 的对比
| 维度 | Open-LLM-VTuber | moeru-ai/airi |
|---|---|---|
| stars | 8.97k | 40.6k |
| 技术栈 | Python + Web 前端 | 全 TypeScript / WebGPU |
| 核心侧重 | 离线本地运行、模型生态广泛 | Web 原生、Tauri 桌面、AIRI Cloud |
| 游戏能力 | 无 | Minecraft/Factorio 等 |
| 伴侣模式 | 桌面宠物透明窗口 | Live2D/VRM 多平台 |
| 活跃度 | v1 维护中,v2 重写规划 | 活跃迭代(v0.10.x) |
快速开始
# 推荐用 uv
uv run run_server.py
# 更新
uv run update.py
# Docker
docker pull Open-LLM-VTuber/open-llm-vtuber文档:https://open-llm-vtuber.github.io/docs/quick-start
注意事项
- 远程访问(非 localhost)需配置 HTTPS,否则浏览器麦克风权限被拒
- v1.0.0 有 breaking change,需重新部署并重建
conf.yaml - Live2D 示例模型使用 Live2D 免费材料许可证,商用需额外确认
关联页面
- airi — 同为 AI VTuber 方向,全 TypeScript 实现,功能更激进