OmniAudio:让声音触手可及,360°视频空间音频生成技术解析

0

OmniAudio:空间音频生成技术的革新

在虚拟现实(VR)和沉浸式娱乐领域,音频体验的真实性至关重要。阿里巴巴通义实验室语音团队推出的OmniAudio,正是一项旨在提升音频沉浸感的创新技术。它能够从360°视频中生成空间音频(FOA),为用户带来更为逼真的听觉体验。本文将深入探讨OmniAudio的功能、技术原理及其应用场景,以期全面了解这项技术的价值与潜力。

OmniAudio

OmniAudio的核心功能

OmniAudio最核心的功能在于生成空间音频。不同于传统的音频技术,OmniAudio能够直接从360°视频生成FOA音频,这是一种标准的3D空间音频格式,可以捕捉声音的方向性,从而实现真实的3D音频再现。FOA音频采用四个通道(W、X、Y、Z)来表示声音,其中W通道负责捕捉整体声压,X、Y、Z通道则分别捕捉前后、左右以及垂直方向的声音信息。这种设计确保了在头部旋转时,声音定位的准确性得以保持,为用户提供更为自然的听觉体验。

空间音频的生成,对于提升沉浸式体验具有重要意义。传统的视频到音频生成技术主要生成非空间音频,无法满足沉浸式体验对3D声音定位的需求。而OmniAudio的出现,为虚拟现实和沉浸式娱乐带来了全新的可能性,让用户在VR环境中能够感受到更加逼真的声音效果,从而增强整体的沉浸感。

OmniAudio的技术原理

OmniAudio的技术原理主要包括两个阶段:自监督的coarse-to-fine流匹配预训练,以及基于双分支视频表示的有监督微调。这两个阶段相互配合,共同实现了从360°视频生成高质量空间音频的目标。

自监督的coarse-to-fine流匹配预训练

由于真实的FOA数据稀缺,研究团队首先利用大规模非空间音频资源(如FreeSound、AudioSet、VGGSound等),将立体声转换为“伪FOA”格式。具体来说,W通道为左右声道之和,X通道为左右声道之差,Y、Z通道置零。这种处理方式虽然简单,但为后续的模型训练奠定了基础。

在模型训练阶段,转换后的“伪FOA”音频被送入四通道VAE编码器,以获得潜在表示。然后,以一定概率进行随机时间窗掩码,并将掩码后的潜在序列与完整序列一同作为条件输入至流匹配模型。模型通过最小化掩码前后潜在状态的速度场差异,实现对音频时序和结构的自监督学习。这一阶段使模型掌握了通用音频特征和宏观时域规律,为后续空间音频的精细化提供了基础。

基于双分支视频表示的有监督微调

在自监督预训练的基础上,研究团队仅使用真实的FOA音频数据,继续沿用掩码流匹配的训练框架。但此时,模型的全部注意力集中在四通道的空间特性上,通过对真实FOA潜在序列进行更高概率的掩码,强化了对声源方向(W/X/Y/Z四通道之间的互补关系)的表征能力,在解码端提升了对高保真空间音频细节的重建效果。

为了更好地结合视觉信息,研究团队将模型与双分支视频编码器结合。针对输入的360°全景视频,使用冻结的MetaCLIP-Huge图像编码器提取全局特征;同时,从同一视频中裁取FOV局部视角,同样通过该编码器获取局部细节表征。全局特征经最大池化后作为Transformer的全局条件,局部特征经时间上采样后与音频潜在序列逐元素相加,作为逐步生成过程中的局部条件。

最后,在保持预训练初始化参数大致走向的前提下,高效微调条件流场,从噪声中精准地“雕刻”出符合视觉指示的FOA潜在轨迹。微调完成后,在推理阶段只需采样学得的速度场,再经VAE解码器恢复波形,就能输出与360°视频高度对齐、具备精确方向感的四通道空间音频。

OmniAudio的应用场景

OmniAudio的应用场景十分广泛,涵盖了虚拟现实、沉浸式体验、智能语音助手以及机器人和自动驾驶等多个领域。

  • 虚拟现实(VR)和沉浸式体验:OmniAudio能够为VR内容生成与视觉场景高度匹配的空间音频,从而增强用户的沉浸感。例如,在VR游戏中,玩家可以清晰地听到敌人的脚步声从哪个方向传来,从而更好地判断敌人的位置。

  • 360°视频配乐:OmniAudio可以为360°全景视频自动生成沉浸式音效,使观众在观看视频时能够获得更真实的听觉体验。例如,在观看一段海滩的360°视频时,观众可以清晰地听到海浪的声音从四面八方传来,仿佛身临其境。

  • 智能语音助手:OmniAudio可以集成到智能家居设备中,如智能音箱、智能家电等,实现语音控制和交互。通过OmniAudio,智能语音助手可以更准确地识别用户的语音指令,并根据用户的语音指令控制家电的开关、调节温度、查询信息等。

  • 机器人和自动驾驶领域:OmniAudio可以应用于机器人和自动驾驶领域,为这些系统提供更准确的声音定位和环境感知。例如,在自动驾驶汽车中,OmniAudio可以帮助汽车识别周围车辆的声音,从而更好地判断交通状况。

OmniAudio的未来展望

OmniAudio作为一项新兴的空间音频生成技术,具有广阔的应用前景。随着虚拟现实、沉浸式体验等领域的不断发展,OmniAudio有望在这些领域发挥更大的作用。未来,我们可以期待OmniAudio在以下几个方面取得更大的突破:

  • 更高的音频质量:进一步提升生成的空间音频的质量,使其更加逼真、自然。

  • 更强的实时性:实现实时生成空间音频,从而更好地满足VR、游戏等领域的需求。

  • 更广泛的应用场景:将OmniAudio应用于更多的领域,如教育、医疗等,从而为人们的生活带来更多的便利。

结论

OmniAudio是阿里巴巴通义实验室语音团队推出的一项创新技术,它能够从360°视频中生成空间音频,为用户带来更为逼真的听觉体验。OmniAudio的技术原理主要包括自监督的coarse-to-fine流匹配预训练,以及基于双分支视频表示的有监督微调。OmniAudio的应用场景十分广泛,涵盖了虚拟现实、沉浸式体验、智能语音助手以及机器人和自动驾驶等多个领域。随着技术的不断发展,OmniAudio有望在未来发挥更大的作用,为人们的生活带来更多的便利。