AI 交互是 Luwu-OS 最具亮点的核心功能——它让机器狗不再只是一台设备,而更像一个能听会说、能看能动、还带点脾气的智能伙伴。进入该模式后,你可以直接和机器狗语音对话:它能听懂你的问题并用语音回答、用摄像头观察周围并描述看到的内容、根据语音指令执行动作(如握手、跳舞),还能记住你的偏好,形成自己的"性格"。
最难得的是,这一切都可以自己动手调:换大脑(语言模型)、换嗓音(音色)、换性格(人格),几分钟就能把它调成你喜欢的样子。
本章将介绍:
- 4.1 语音对话:如何进入 AI 交互模式、如何唤醒和对话、各按键功能
- 4.2 功能说明:视觉问答、语音动作控制、记忆、联网搜索、情感表达
- 4.3 AI 配置网页:如何获取 API Key,以及每一项配置的作用和设置方法
4.1 语音对话
可以直接跟机器狗说话,它会理解你的问题并用语音回答你,同时在屏幕上做出对应的表情。
使用步骤:
- 确保机器狗已连接 WiFi(AI 功能需要联网,参见"第二章:网络连接")
- 在主界面翻卡片找到「AI交互」,按 D 键进入

- 等待程序加载(约 5-10 秒),进入待机页面,屏幕显示默认表情
- 对着机器狗说出唤醒词:
- 中文模式:「小陆同学」
- 英文模式:「Hi Luka」

- 听到"叮"的提示音后,表示机器狗已被唤醒,正在听你说话
- 说出你想问的问题,例如:
- "今天天气怎么样?"(联网实时查询)
- "给我讲个故事"
- "3 加 5 等于多少?"
- "你看到了什么?"(触发视觉问答)
- "握个手" / "跳个舞"(触发动作控制)
- 说完后稍作停顿,机器狗自动检测语音结束
- 发出"咻"的提示音,表示正在思考中,屏幕显示对应的思考动画
- 机器狗用语音播报回答内容,同时屏幕显示与回答内容匹配的情感表情
对话过程中的按键功能(与待机页面四角提示对应):
| 按键 | 功能 | 说明 |
|---|---|---|
| A 键 | 配置 | 屏幕显示配置网页地址,用浏览器打开进行 AI 配置(见 4.3) |
| B 键 | 打断 | 如果不想听当前回答,可中断并开始新对话 |
| C 键 | 退出 | 返回主界面 |
| D 键 | 开始 | 不需要说唤醒词,直接开始新一轮对话 |
💡 唤醒时建议在安静环境中,距离机器狗 1-2 米,用正常音量说话即可。背景噪音过大会影响唤醒和识别效果。
4.2 功能说明
视觉问答
机器狗不仅"听得懂",还"看得见"——借助摄像头和视觉大模型,它能看懂眼前的画面并说给你听。
- 对机器狗说「拍照」或「你看到了什么」
- 机器狗拍摄当前摄像头画面,交给视觉大模型(VLM)分析
- AI 用语音描述看到的内容,例如:"我看到一个人站在桌子旁边,桌上有一本书"
- 可以继续追问画面细节,例如:"书是什么颜色的?"
语音动作控制
对话不止于"说",还能"做"——一句话就能让它动起来。开启函数调用后(默认开启),AI 可以根据对话内容控制机器狗执行动作:
- "握个手" → 伸出爪子
- "趴下" / "站起来" / "跳个舞" → 执行对应动作
- AI 会自行判断何时需要执行动作,对话与动作自然衔接
上下文记忆与长期记忆
聊得越多,它越懂你。
上下文记忆:
- 机器狗会记住当前对话轮次中的内容,可以自然追问
- 例如:"刚才你说的地方在哪里?"
长期记忆:
- 开启后(默认开启,见 4.3 配置网页「角色」页),每次对话结束后自动总结你的偏好和习惯
- 下次对话时机器狗仍会记得这些信息,例如你的称呼、喜好、聊过的话题
联网搜索
- 默认开启,可以询问天气、新闻等实时信息,不受模型知识截止时间限制
情感表达
它也有喜怒哀乐,会把心情写在"脸"上。
- 根据对话内容,屏幕自动切换对应的表情动画
- 包括:开心、惊讶、害羞、疑惑、困倦、生气、伤心、喜爱、尴尬等多种表情
自动退出
- 如果连续 10 分钟没有对话,机器狗自动退出 AI 模式
- 下次使用时重新进入即可
4.3 AI 配置网页
AI 功能使用云端大模型服务,语言模型、语音识别、音色、机器人人格等都可以在配置网页中修改。配置网页是一个在电脑或手机浏览器里打开的设置页面,不需要安装任何软件。
💡 正常使用其实只有一件事必须做——申请一个 API Key 并填进去(下面有逐步图文教程)。其余所有配置都有默认值,可以先不用管。
第一步:让电脑/手机和机器狗处于同一个网络
配置网页装在机器狗里,只有和机器狗连同一个 WiFi 的设备才能打开它。
- 确保机器狗已经连上 WiFi(参见"第二章:网络连接")
- 把你用来配置的电脑或手机,连到和机器狗同一个 WiFi(同一个路由器发出的网络)
- 如果两者不在同一网络,浏览器会打不开配置页(提示无法访问 / 超时)
第二步:查看配置网页地址
- 让机器狗进入 AI 交互模式(主界面翻到「AI交互」卡片按 D 键),进入待机页面
- 按机器狗上的 A 键
- 机器狗屏幕上会显示一行配置网页地址,格式类似
192.168.x.x:5000(x是具体数字,每台机器、每个网络可能不同,以你屏幕上显示的为准)

第三步:在浏览器里打开这个地址
- 在电脑或手机上打开任意浏览器(Chrome、Edge、Safari、手机自带浏览器都可以)
- 在浏览器最上方的地址栏(不是百度/搜索框)里,一字一字输入屏幕上显示的地址,例如
192.168.31.81:5000 - 注意中间的冒号
:要用英文半角冒号,不能打成中文冒号「:」;数字之间的点也是英文句点. - 输入完按回车(手机点"前往/转到"),就能打开配置网页了
💡 建议把这个地址加入浏览器收藏夹,下次直接点开即可。注意:机器狗重启或换了 WiFi 后地址可能变化,届时重新按 A 键查看即可。
💡 配置网页的界面语言跟随机器狗的系统语言设置:机器狗是中文界面,网页就是中文;是英文界面,网页就是英文。
获取 API Key(阿里云百炼)
API Key 是什么? 你可以把它理解为一把"钥匙":机器狗的 AI 大脑其实运行在云端(阿里云的服务器上),这把钥匙用来证明你有权使用这个服务。没有钥匙,AI 就无法对话。这把钥匙需要你去阿里云百炼平台免费申请一个,整个过程大约 5 分钟。
默认使用阿里云百炼平台的模型服务,获取步骤如下:
- 打开申请页面:在配置网页的欢迎页点击「前往阿里云百炼获取 API Key」,会自动跳转到阿里云百炼平台;也可以自己在浏览器地址栏输入
https://bailian.console.aliyun.com打开 - 登录 / 注册阿里云账号:
- 已有阿里云账号的直接登录
- 没有账号的先注册;页面上通常有"支付宝登录""淘宝登录"的选项,用手机上的支付宝/淘宝扫一下码就能快速登录,不必单独注册
- 完成实名认证(这一步比较容易被忽略):
- 新账号第一次使用需要先做实名认证,否则调用模型时会报错
- 按页面提示操作即可;个人用户选"个人认证",用支付宝扫码授权,通常几分钟就能通过
- 开通百炼服务:如果页面提示"开通"或"免费开通"大模型服务,点击同意开通即可(新用户一般有免费额度,见下方说明)
- 创建 API Key:
- 在百炼控制台找到 API-KEY 管理入口,通常在页面右上角的头像 / 用户菜单里,名字可能是「API-KEY」「我的 API-KEY」之类
- 点击「创建我的 API-KEY」按钮
- 复制 API Key:
- 创建成功后,点击这一条记录后面的「查看」
- 会显示一串以
sk-开头的字符(例如sk-xxxxxxxxxxxxxxxx),这就是你的 API Key - 点击「复制」按钮把它复制下来(先别关页面,等下要粘贴到配置网页)
💡 关于费用:新用户开通百炼后通常会附带各主流模型的免费额度,正常对话使用可以用较长时间,基本感觉不到花钱;免费额度用完后按实际用量计费,具体价格可在百炼控制台查看。
💡 海外用户:请在配置网页欢迎页把「区域」切换为「国际版 (International)」,然后前往阿里云国际版 Model Studio 平台申请 API Key,流程与上面类似。
欢迎页:填写 API Key
第一次打开配置网页会看到「欢迎使用 Luwu AI」引导页,照下面做:
- 确认区域:「区域」保持默认的「国内版 (China)」即可(海外用户才需要选「国际版 (International)」)
- 粘贴 API Key:把上一步复制的、以
sk-开头的 API Key,粘贴到输入框里(在框内长按"粘贴",或电脑上按 Ctrl+V) - 保存并激活:点击「保存 Key」按钮。系统会自动测试这把钥匙是否有效——
- 提示成功:说明 AI 功能已经激活,可以关掉网页,回到机器狗开始对话了
- 提示失败:多半是 Key 复制得不完整、开头结尾多了空格,或实名认证/开通还没完成,可回上一步检查
- 激活后如果想进一步调整,可点击「配置角色」设置机器人性格,或点击「使用其他模型 / 更多设置」进入完整设置页

💡 到这里就够了:填完 API Key、提示成功,就可以正常和机器狗对话了。下面几页(AI 大脑、语音识别、语音合成、角色)都有合理的默认值,不想折腾可以完全不用改。想个性化定制的用户再往下看。
AI 大脑:语言模型配置
「AI 大脑」页配置对话使用的大语言模型。各配置项说明:
| 配置项 | 作用与设置方法 |
|---|---|
| 服务商预设 | 选择模型服务商:Alibaba Qwen(默认)/ OpenAI / Google Gemini / ByteDance Doubao / Custom(自定义)。切换后会自动填充对应的接口地址和模型列表,一般保持默认即可 |
| API 密钥 | 当前服务商的 API Key。各服务商的 Key 独立保存,互不影响;切换服务商后需填写对应服务商的 Key |
| Base URL(兼容 OpenAI) | 模型接口地址。选择预设服务商时会自动填好,无需修改;选 Custom 时填写你自己的 OpenAI 兼容接口地址(本地部署的私有模型也可以) |
| 模型 | 对话使用的主模型。可以从下拉列表选择,也可以手动输入模型 ID |
| VLM Model | 视觉模型,用于"拍照"和"你看到了什么"等视觉问答,保持默认即可 |
| 启用函数调用(机器人控制) | 开启后 AI 可以控制机器人做动作(默认开启);关闭后 AI 只进行语音回答,不执行动作 |
| 启用联网搜索 | 开启后 AI 可以联网查询实时信息(默认开启) |
修改后可点击「测试 AI 大脑连接」验证配置是否可用。

语音识别(ASR)
「语音识别」页配置听懂你说话的语音识别服务。各配置项说明:
| 配置项 | 作用与设置方法 |
|---|---|
| 服务商 | Aliyun Qwen(默认)/ Deepgram(海外用户可选,实时流式识别) |
| 模型 | 识别模型,默认 qwen3-asr-flash-realtime,保持默认即可 |
| 语言 | 识别语言:中文 / 英文,与你说话的语言保持一致 |
| VAD 阈值 | 语音活动检测灵敏度,范围 0~1,默认 0.5。安静环境下经常检测不到说话可调低;嘈杂环境经常误触发可调高 |
| 静音时长 (ms) | 停顿多久判定你说完了,默认 800 毫秒。说话习惯停顿较长的用户可适当调大,避免话没说完就被截断 |
修改后可点击「测试语音识别连接」验证。

语音合成(TTS)
「语音合成」页配置机器狗回答时的声音。各配置项说明:
| 配置项 | 作用与设置方法 |
|---|---|
| 服务商 | Aliyun Qwen(默认)/ Deepgram(海外用户可选) |
| 音色 | 回答使用的声音:Cherry(女声,默认)/ Serena(女声)/ Ethan(男声)/ Chelsie(女声) |
点击「测试语音合成」可以试听当前音色,选到满意为止。

角色:命名与人格
这是最好玩的一页——给机器狗起个名字、定个称呼、挑一种性格,把它调成你喜欢的样子。各配置项说明:
- 智能体名字:机器人的名字(默认 XGO),对话中它会以这个名字自称
- 叫我什么:机器人对你的称呼(如 Master),设置后它会用这个称呼叫你
- 输出语言:回答使用的语言,可选跟随系统 / 中文 / English
- 选择您的性格类型:从 16 种 MBTI 人格卡片中任选其一(建筑师、逻辑学家、指挥官、辩论家、提倡者、调停者、主人公、竞选者、物流师、守护者、总经理、执政官、鉴赏家、探险家、企业家、表演者),不同性格会带来不同的说话风格
- 快速测试:如果不确定选哪种性格,可以点击展开 10 道二选一的小测试,系统会自动判定并推荐一个 MBTI 类型
- 对机器人的具体要求:用一段话描述你希望的机器人性格和说话风格(如"活泼开朗、爱讲笑话、说话简洁")
- 自动生成提示词:点击后会根据上面的性格选择和你填写的要求,自动生成「当前提示词」(作为大模型的 System Prompt 使用);你也可以在文本框中直接手动编辑这段提示词
- 长期记忆:
- 「启用长期记忆」开关(默认开启):开启后每次对话结束会自动总结你的偏好,并在以后的对话中记住
- 「清除记忆」:清空已经记住的内容,让机器狗重新认识你
「角色」整页如下(从上到下:称呼设置、性格类型、具体要求与提示词、长期记忆):

点击「快速测试」后,10 道测试题会在下方展开:

所有配置修改完成后,点击页面底部的「保存配置」按钮保存生效。
⚠️ API Key 属于个人凭证,请勿泄露给他人。默认配置开箱即用,如果只是正常使用,通常只需在欢迎页填写 API Key 即可,其余配置保持默认。
