第一个语音 Agent
下面使用阿里云的 STT + LLM + TTS 组合展示 LiveKit Agents 的标准接入方式。
准备环境变量
不要把真实密钥提交到 Git。开发环境可使用 python-dotenv 从 .env 加载。
创建 Agent
这里使用的 cosyvoice-v3-flash 和 longanyang 同时支持新加坡和中国(北京)。模型与音色必须匹配;
其他 CosyVoice 模型的地域和音色限制见阿里云插件文档。
运行
控制台模式适合先验证麦克风、凭证和模型:
接入 LiveKit 房间:
改为 Realtime
Realtime 模型自身完成听、理解和说,只把一个 RealtimeModel 传给 llm:
Realtime 模式不需要再配置独立的 STT 与 TTS。详细的音色、轮次检测、开场语和工具 调用行为见阿里云插件与Realtime 会话。