使用指南
语音
说话代替打字,让它念给你听,或者干脆手离开键盘。
语音在 Mosael 里是三件独立的事,可以只用其中一件:
| 做什么 | 在哪儿 | |
|---|---|---|
| 说话输入 | 把你说的话填进输入框,你过目后再发 | 智能体输入框旁边 |
| 念给我听 | 把某条回复念出来 | 每条回复下面 |
| 免提对话 | 一直听着,说完一句自动发,答完念给你听 | 右下角的浮标 |
说话输入#
按住说,松开就把识别出来的文字追加进输入框 —— 不覆盖,因为你可能先打了半句再改用说的。
它只负责填字,不负责发送。识别错了当场改掉就行,这一步是有意留的:语音识别一定会错, 而"说完直接发出去"意味着错字要靠模型去猜你原本想说什么。
念给我听#
每条回复底下有个播放按钮。同一时刻只念一条 —— 点了另一条,前一条立刻停。
用哪个声音在设置里选,见下面「配音和对话是两份配置」。
免提对话#
右下角那颗浮标,点一下开始。它有四种状态,靠同一组声波条的颜色和动效区分:
- 在听 —— 等你开口,慢呼吸。
- 听你说 —— 条形跟着你的音量走。它们越过一半高度变成主色的那一刻,正是它判定你 在说话的那一刻;所以"要多大声"不用猜。
- 在想 —— 转圈。
- 在说 —— 涟漪往外走。
浮标可以拖到任何位置,位置会记住。悬停会显示当前状态,以及上一句听到的原话 —— 听错时 你当场就看得见错在哪个字,而不是等它答非所问。
说到一半可以打断它。 它在念的时候你开口,播放立刻停,开始录你这一句。不这样的话, 你得等它念完才能纠正它,而"念错了还要听完"正是语音助手最让人恼火的地方。
只读的工具可以用语音触发,改动仍然要在屏幕上确认。 建项目、改工作流这类都会弹确认卡 —— 语音里说一声"好"就批准的话,识别错一个字的代价是它真的动了你的东西,而你多半没在看屏幕。
失败会出声。 语音模式下一次静默的失败会被理解成"它没听见",于是你再说一遍、再失败一次。
浮标默认不开,在设置里打开(「语音对话」一节)。
配音和对话是两份配置#
对话用的声音和配音的默认音色是分开的,这是有意的:
- 配音要质量:本地零样本引擎、克隆出来的音色,首次加载十几分钟也认,因为那段音频要进成片。
- 对话要延迟:说完等一分钟就不叫对话了。
同一个默认同时服务这两件事,必然在某一边是错的。设置里的「语音对话」只管对话那一份; 配音的默认音色在配音那边设。
引擎和音色的清单两边问的是同一组接口 —— 这里只是另一处选择,不是另一份目录。
