微软逆天突破全双工语音交互！机器人真变成了“人”

文明世界拼图 2018-03-23

展开全文

微软(亚洲)互联网工程院宣布，率先推出新一代的语音交互技术“全双工语音交互感官”(Full-duplex Voice Sense)，并已完成产品化落地。

全双工本是通讯传输领域的一个术语，允许数据在两个方向上同时传输，与之对应的就是半双工。

传统的语音识别和机器对话都类似半双工，无论单轮还是多轮连续识别，都需要人说完一句话，机器才能理解并给出回应，有点像传统武侠游戏的回合式战斗。

而微软的这项新技术可以实时预测人类即将说出的内容，实时生成回应，并控制对话节奏，从而使长程语音交互成为可能。

采用该技术的智能硬件设备，也不需要用户在每轮交互时都说出唤醒词，仅需一次唤醒，就可以轻松实现连续对话，使人与机器的对话更像人与人的自然交流。

目前，这项技术已首先在微软小冰全球产品线中落地，其中在中国市场，不但有中国科技馆的小冰电话亭，微软还与小米紧密合作，将其融入到米家生态链Yeelight语音助手的市售硬件产品。

这是全球首个搭载全双工语音交互感官的智能设备，也是内置微软小冰的首个“双AI”智能设备。

在日本市场，小冰凛菜(りんな)已通过该技术实现在直播平台中的落地，首个车载智能项目也已开始路试。

微软计划在未来六个月内，完成该技术在更多产品线中的覆盖。

微软全球资深副总裁、微软(亚洲)互联网工程院院长王永东博士表示：“我们预测，未来一年中，人工智能应用将越来越多地从某些单一技术领域，进入到发挥综合能力的阶段。微软已在这方面深入布局。此次全双工语音交互技术的推出，不仅涉及到计算机语音技术，还包括自然语言处理、人工智能内容创造等多个领域。这正是微软在这些领域长期储备、综合运用的成果之一。”

微软小冰全球研发负责人周力博士表示：“从已落地的产品数据和用户反馈中，我们观察到一个普遍现象：用户一旦使用过微软小冰的全双工语音交互感官之后，再与其他语音助手交互时，他们普遍会开始感到不习惯，甚至会频繁忘记要对其他语音助手说唤醒词——新技术促进拟人自然度的显著提升，使人们对过去单轮或多轮连续语音交互体验的满意度迅速下降。这种新老交替的现象，符合我们的研发预期。”