最后更新:
Yu Zhang 是一位专门从事语音深度学习的研究科学家,其研究领域包括自动语音识别、语音合成以及自监督和多模态语音模型。[4] 他是 Meta 超级智能 (Superintelligence) 团队的研究科学家,此前曾在 Google DeepMind、OpenAI 和微软担任研究职务。[3]
Yu Zhang 在麻省理工学院 (MIT) 获得了计算机科学博士学位,于 2012 年至 2017 年在此深造;此前,他于 2005 年至 2009 年在上海交通大学学习并获得计算机科学学士学位。[3] 在 MIT 期间,他是计算机科学与人工智能实验室 (CSAIL) 的成员,在 James Glass 博士的指导下,作为口语系统组 (Spoken Language Systems Group) 的成员开展研究。他的学术工作集中在将机器学习模型应用于语音和语言处理的挑战。在 2009 年秋季攻读博士学位之前,他还曾担任统计学习课程的助教。[1][3]
Zhang 的职业生涯始于 MIT CSAIL 的学术研究,其工作主要集中在语音识别、说话人确认和语言识别的机器学习应用。他是 IARPA Babel 计划的积极参与者,该研究计划旨在提升多语言语音识别能力,特别是针对低资源语言。[1] 在此期间,他的研究探索了使用先进的深度学习架构(如深度神经网络和循环神经网络 RNN)来解决语音处理中的复杂问题。具体而言,他的工作研究了用于远场语音识别的长短期记忆网络 (LSTM) 技术、用于改进声学建模的深度神经网络瓶颈特征提取,以及使用基于 i-vector 的方法来归一化音频信号中的说话人和环境变异性。[1]
在学术界任职后,Zhang 转向科技行业的研究岗位。他于 2010 年至 2012 年在微软亚洲研究院担任实习生,随后于 2014 年在微软担任研究实习生,为语音和语言技术项目做出贡献。[3] 从 2017 年到 2023 年,他担任 Google DeepMind 的主任研究科学家 (Staff Research Scientist),其工作包括大规模自动语音识别、文本转语音合成、自监督和半监督语音学习,以及多语言和多模态语音-文本系统。这些工作体现在 SpecAugment、Conformer、LibriTTS、WaveGrad、w2v-BERT、ContextNet、Google USM 和 FLEURS 等出版物中。[4] 随后,他于 2023 年 10 月至 2025 年 7 月在 OpenAI 担任技术人员 (Member of Technical Staff),之后于 2025 年 7 月加入 Meta,担任 超级智能 (Superintelligence) 团队的研究科学家,专注于推进语音和多模态理解的基础模型。[3][4][2]
在整个职业生涯中,Yu Zhang 共同撰写了大量研究论文,并在主要的机器学习和信号处理会议上发表,包括国际声学、语音与信号处理会议 (ICASSP) 和 Interspeech。他的出版物反映了他在语音识别深度学习、特征提取和声学模型训练方面的工作。
其发表的部分作品包括:
他后期的研究包括对语音识别和合成的方法及数据集的贡献,例如用于数据增强的 SpecAugment、卷积增强和上下文感知架构(如 Conformer 和 ContextNet),以及 LibriTTS 文本转语音语料库。它还涵盖了从说话人确认到多说话人 TTS 的迁移学习、基于 WaveNet 和扩散模型的语音生成(如 WaveGrad)、自监督和半监督语音模型(包括 w2v-BERT 和大规模半监督 ASR),以及多语言语音系统和基准(如 Google USM 和 FLEURS)。[4] 他的完整出版物列表涵盖了自动语音识别、语音合成、自监督学习以及多语言和多模态语音处理等主题。[1][2][3][4][5][6]
2024 年 11 月 15 日,Yu Zhang 在由卡内基梅隆大学语言技术研究所 (LTI at CMU) 组织的 LTI 研讨会上担任特邀演讲者。他的演讲题目为 “Hearing the AGI: from GMM-HMM to GPT-4o”,探讨了语音识别研究的历史发展和当前方向。
在演讲中,Zhang 概述了从早期的混合高斯模型-隐马尔可夫模型 (GMM-HMM) 系统到基于自监督 Transformer 模型的大规模多模态架构的演进过程。他指出,该领域的进步不仅受到数据集和模型规模扩大的推动,还受到计算资源扩展以及克服系统级工程挑战的推动。
根据 Zhang 的说法,自监督学习在使模型能够利用大量未标记音频方面发挥了核心作用,这扩展了语音系统的容量和性能。他还观察到,语音处理比文本需要更多的计算能力,因为它必须解决背景噪声、静音和多样化的声学条件等额外因素。
Zhang 进一步讨论了从自动语音识别向结合语音、文本和视觉的多模态系统的转变。他强调,类似于 GPT 风格语言模型中使用的下一标记预测 (next-token prediction) 方法是这一转变的核心。他还指出,传统的词错误率 (WER) 等指标并不总是能反映人类对质量的判断,强调了开发更具代表性的评估方法的重要性。
在谈到安全性和可靠性时,Zhang 评论说语音模型可能会带来独特的风险,因为当其输出不正确时,可能会显得更具说服力。他将对齐、基准测试和长上下文输入的高效处理确定为持续的研究需求。他在结束时指出,语音与文本和视觉的集成可能会在多模态系统的进步及其对通用人工智能的潜在贡献中发挥重要作用,但强调进展取决于科学研究和实际工程解决方案。[7]
2026年8月28日。21:27 UTC
编辑摘要:
Expand Yu Zhang summary and timeline (+110w)
