跳转到内容

Interaction Model第 2 篇,共 2 篇

实时语音对话:交互能力、模型架构与对话控制

实时语音对话中的交互能力、模型架构、信息编排与对话控制思路

更新于 阅读约 5 分钟

一、核心思路:从交互能力理解系统设计

Section titled “一、核心思路:从交互能力理解系统设计”

本页围绕一个核心问题展开:如何让语音系统参与自然、连续的对话?

这需要同时考虑三个层面:

  • 交互能力: 用户与助手如何接话、等待、打断,以及在同时说话时继续理解对方。
  • 模型架构: 两方语音如何表示、如何组织,以及模型如何预测接下来的输出。
  • 对话控制: 系统由谁决定开始说、继续说或停止说,以及这些决定在什么粒度上发生。

不同系统可以放在这套共同的框架下比较:先明确希望实现的交互,再分析支撑这些交互的表示方式、预测机制和控制方法。

二、自然对话中的关键交互能力

Section titled “二、自然对话中的关键交互能力”

一方说完,另一方接着说,是最基本的对话形式。系统需要判断用户是否已经完成当前表达,并在合适的时机回应。

用户停下来,可能只是在思考,后面仍有话要说。系统需要理解这种状态,避免在用户尚未完成表达时抢话。

这意味着,对话控制需要考虑停顿在上下文中的含义。

自然对话中,一方尚未说完,另一方就可能开始说话。系统需要处理这种重叠,并据此调整自己的输出。

这里涉及助手说话时用户能够插话的交互,以及输出过程中继续接收对方信息的重要性。

系统在生成和播放语音时,仍需要接收用户输入。新输入可能影响当前对话,因此系统要能在持续输出的过程中利用这些信息。

输入音频可能包含电视声、环境中的人声或其他参与者。系统需要判断这些声音与当前交互的关系。

一个带电视背景声的演示可以说明这一点:系统没有对背景内容作出回应。这个例子体现了区分交互对象与背景声音的需求。

可以把语音对话看作用户与模型两路语音在物理时间中的交互。模型设计需要解决四个问题。

设计环节核心问题
语音表示如何把输入音频转换成模型可以处理的特征?
信息编排用户与模型已经说过的内容,以什么顺序和粒度进入模型?
下一步预测模型根据已观察的信息,预测什么样的后续输出?
语音生成如何把预测结果转换成最终可播放的声音?

比较不同架构时,需要同时关注这几个环节。尤其是用户与模型的信息如何编排,会直接影响系统建模对话的方式。

1. 级联系统:ASR、语言模型与 TTS

Section titled “1. 级联系统:ASR、语言模型与 TTS”

级联系统先通过语音识别(ASR)把用户语音转换成文本,再由语言模型生成回复,最后通过语音合成(TTS)输出声音。

这种方案有几个工程优势:

  • 压缩输入信息。 较长的语音可以转换为较短的文本表示。
  • 利用已有模型能力。 文本可以直接交给语言模型处理,利用其已有的语言理解和生成能力。
  • 模块便于组合。 语音识别、语言模型和语音合成可以分别接入。
  • 便于业务控制。 各环节可以加入控制逻辑,并与电话业务流程、图形化编排及 Agent 平台结合。

在电话相关的产品中,这类方案较为常见。

级联系统主要按对话轮次组织输入输出:用户表达一段内容,系统处理后生成回应。

另一类设计以更细的时间帧组织语音,并在模型内部保留用户输入与模型输出之间的时间关系。

其核心变化是:把处理和预测的单位,从较长的对话轮次细化到连续的时间帧。

这种组织方式把双方语音随时间变化的关系纳入建模,是比较流式系统时值得关注的重要维度。

还有一种思路,将处理用户输入、理解语义或生成内容的部分,与最终生成语音的部分分开。

前一部分形成内容和相关条件信息,后一部分利用这些信息生成声音。

比较这种设计时,仍需要回到信息组织方式:用户输入怎样进入模型,生成内容怎样传递给语音输出部分,以及两方信息在序列中如何安排。

五、表示、预测目标与信息编排

Section titled “五、表示、预测目标与信息编排”

架构差异还体现在更细的设计选择上。

输入特征可以作为条件信息,帮助模型预测后续内容;也可以进入模型需要预测的表示空间。

因此,需要区分“模型用什么信息作判断”与“模型被要求预测什么”。

用户与模型的信息可以交错组织、并行组织,也可以按对话轮次展开。按轮次组织的方式可以用时分复用来类比。

表示方式、预测目标和序列编排,共同构成语音模型的设计空间。 同样是语音输入与语音输出,其内部组织方式可能存在明显差异。

在模型外部设置控制器,结合语音活动检测(VAD)、轮次结束检测和对话管理,判断用户何时开始说、何时结束,并调整当前对话状态。

这种方案把对话状态的检测与调度交给专门模块处理。

利用模型已有的语音理解能力或中间表示判断交互状态,减少对独立检测模块的依赖。

这一思路关注如何让已有的模型信息同时服务于内容理解与交互控制。

在 token 或 micro-turn 这样的较小单位中表达静音、说话等状态,再由这些单位组成完整的对话行为。

这把部分交互状态纳入持续生成过程,使对话行为能够在更细粒度上被描述。

这几类控制方式关注的共同问题是:谁来判断对话状态,以及多频繁地作出判断。

后续研究应根据前面定义的交互能力,寻找对应的数据和评估方式,把能力描述落实到可以研究和验证的问题上。

产品层面则需要结合具体场景,观察电话相关基础设施、通用语音系统和偏陪伴的产品,了解它们的交互需求和实现选择。