← 返回 2026-09-25 简报

半监督联邦语音识别的实用方案:在线伪标签与服务器更新稳定化

A Practical Recipe for Semi-Supervised Federated ASR: Online Pseudo-Labels with Server Update Stabilization

语音播报
摘要
事件:Apple ML提出半监督联邦语音识别方案,通过优化在线伪标签生成与服务器更新稳定化机制,解决模型发散问题。 要点:采用过渡教师策略匹配全局基准;服务器需持续训练锚点数据以稳定梯度。在域内平均提升20.8%,跨域提升10.0%。 影响:大幅缩小半监督与全监督联邦学习差距,为开发者提供高效低标签依赖的语音模型训练指南,降低部署成本。

半监督联邦学习(SSFL)利用教师模型在客户端的无标签数据上训练模型,并在服务器端使用少量带标签的种子数据集。自动语音识别(ASR)在此场景下尤为脆弱:伪标签错误会在输出序列中累积,并在多个训练轮次中叠加导致发散,从而使得其与全监督联邦学习之间存在巨大差距。我们表明,缩小这一差距取决于两个耦合的设计维度——教师模型(生成伪标签的模型)和锚点(服务器端在带标签数据上的更新,用于稳定训练)。在教师模型维度上,每个客户端的在线教师模型(即各客户端自身不断演化的模型)会自行发散,但一旦稳定下来,其表现就能匹配甚至超越广播式全局教师模型(在一轮内固定的单个服务器模型),在域内场景中具有决定性优势,在域偏移场景下也具有竞争力。随着种子数据集质量的提升以及在线教师模型优势的缩小,一种过渡型教师模型(在第 r 轮从全局切换为在线)的表现能匹配或优于两者。在锚点维度上,服务器必须在各轮次之间继续在带标签数据上进行训练——否则在线教师模型会发生漂移——这种交错机制对收敛性的影响比种子模型更大。这两个维度密不可分:激进的教师模型选择只有在锚点稳定了训练后才能奏效,而锚点的稳定性高度依赖于数据增强和批量大小——这些设置决定了服务器注入的输入噪声和梯度噪声的量。所需的稳定程度取决于具体领域,由种子数据的分布及其与客户端数据的重叠程度决定。这些发现为 ASR 训练中的 SSFL 提供了指导原则,在 11 组对比中有 9 组优于最强的先前方法,域内平均提升 20.8%,跨域平均提升 10.0%,从而缩小了与全监督联邦学习的差距。

本条评分 8.9 score-v1
  • 来源权威 7
    注册表 priority=7(Apple Machine Learning)
  • 时效 1.945
    发布 22.5 小时前,衰减到 1.94/3.0
  • 多源印证 0
    只有 1 家在报(无旁证)
  • 社区信号 0
    无社区数据(本管线走 RSS,HN 的 hn_fetcher 未接入)

首次收录 · 2026-09-25 · 8.95 分

原文链接:https://machinelearning.apple.com/research/practical-recipe-federated-asr
来源:Apple Machine Learning
以上内容由 AI 自动翻译,仅供参考。
← 返回简报