想象一下这个场景:一场多人线上会议,有人说话时画面自动聚焦到发言者;一段综艺素材,后期系统能自动识别谁在讲话并生成字幕;一段监控录像,系统能在人群中持续追踪正在说话的那个人。 这些功能背后依赖的是同一项技术——音视频说话人追踪(Audio-Visual Speaker Tracking)。它让机器同时利用听到的声音和看到的画面,定位并持续追踪正在发声的人。 过去几年,音视频分割(Audio-Visual Segmentation, AVS)音视频实例分割(Audio-Visual Instance Segmentation, AVIS)任务受到广泛关注,
查看更多