py-xiaozhi是一款使用Python实现的AI小智语音客户端,基于原生小智ESP32代码移植,打造了一款纯Python实现的AI语音客户端。用户无需额外硬件,就能在台式机或笔记本上体验实时对话和语音交互。
项目原生支持MQTT与WSS双协议,能够打断并持续对话,后续协议扩展仅需仿照官方实现即可。核心模块涵盖音乐、灯光、音量、定时器、Home Assistant控制及摄像头IoT操控,视觉识别则依赖外部大模型API Key方可启用。
核心功能解析
语音交互与自动对话
支持语音输入、识别和合成,能模拟自然语言对话流,打断式交互保证响应及时。启用自动对话后,用户与小智的多轮对话无须重复唤醒,提升交互连贯性。
视觉多模态处理
集成图像识别与处理能力,将静态图像转化为可理解信息,结合语音输出实现更丰富的交互场景。配置智普大模型API后,可完成物体识别、人脸检测等任务。
智能家居与IoT集成
直接对接Home Assistant平台,通过HTTP API控制灯具、开关、传感器等设备;支持虚拟设备如倒计时器,也可接入物理温度传感器、摄像头等硬件。模块化设计令设备扩展与注册流程简易清晰。
网络音乐播放
借助pygame打造高性能播放器,涵盖播放、暂停、停止、进度调节、歌词显示和本地缓存功能,保证长播放稳定性并减少网络波动带来的中断。
唤醒与安全传输
内置唤醒词激活功能(默认关闭),无需手动点击即可启动交互。全程音频通过WSS协议加密传输,防止数据窃听与篡改。
使用体验与扩展
界面与命令行双模式
提供直观的图形化界面,展示小智的表情与对话文本,增强用户沉浸感;亦支持命令行运行,适配资源受限或无GUI的环境。
跨平台兼容性
兼容Windows 10及以上、macOS 10.15及以上和各主流Linux发行版,部署前仅需保证Python 3.9–3.12环境、麦克风与扬声器可用即可。
稳定性与自动化
自动获取并管理MAC地址,避免网络冲突;首次运行自动复制验证码并唤起浏览器,简化认证流程;模块化代码与类封装方便二次开发,同时修复断线重连、跨平台兼容等多项细节问题。
结语
py-xiaozhi为缺乏硬件条件的开发者与爱好者提供了一条低门槛体验AI小智语音功能的途径。通过开源、模块化设计和多协议支持,它既适合作为学习案例,也可直接用于智能家居场景的语音控制与多模态交互。
相关导航
Screenshot to Code 是一款使用 AI 将屏幕截图、模型和 Figma 设计转换为干净、实用的代码的简单工具,将任何屏幕截图或设计转换为干净的代码,现在支持 Claude Sonnet 3.5 和 GPT-4O!支持 HTML + Tailwind、HTML + CSS、React + Tailwind、Vue + Tailwind、Bootstrap、Ionic + Tailwind 和 SVG 等多种前端堆栈。其支持的 AI 模型包括 Claude Sonnet 3.5 和 GPT-4O,同时可使用 DALL-E 3 或 Flux Schnell 进行图像生成,能够以 10 倍速度构建用户界面。作为一款完全开源工具,它在 GitHub 上已获得超过 53,000 颗星,深受领先公司的开发人员和设计师欢迎。
EmojiMyFace是一款基于Google Gemini AI技术的在线工具,可将照片中的人脸转换为匹配的表情符号,将上传的自拍或人像照片智能转化为生动的表情包艺术。用户仅需拖拽或选择JPEG、PNG、WebP格式的图片,系统即可在几秒内精准识别人脸特征与情绪,并匹配最贴合的表情符号,同时完整保留原始背景结构。支持单人及多人脸识别处理,适用于社交媒体头像、品牌营销视觉素材或趣味分享场景。所有图像均在本地浏览器安全处理,无需注册即可免费体验,兼容Chrome、Firefox、Safari等主流浏览器。EmojiMyFace还提供高清下载和一键分享功能,让你的内容在各平台脱颖而出。