마지막 업데이트:
Yu Zhang은 자동 음성 인식, 음성 합성, 자기 지도 학습 및 멀티모달 음성 모델을 포함한 음성용 딥러닝을 전문으로 하는 연구 과학자입니다.[4] 그는 Meta의 Superintelligence 팀의 연구 과학자이며, 이전에는 Google DeepMind, OpenAI, Microsoft에서 연구직을 역임했습니다.[3]
Yu Zhang은 매사추세츠 공과대학교(MIT)에서 컴퓨터 과학 박사 학위를 취득했으며(20122017년), 상하이 교통대학교에서 컴퓨터 과학 학사 학위를 취득했습니다(20052009년).[3] MIT 재학 시절 그는 컴퓨터 과학 및 인공지능 연구소(CSAIL)의 일원이었으며, James Glass 박사의 지도하에 구어 시스템 그룹(Spoken Language Systems Group)의 일원으로 연구를 수행했습니다. 그의 학술적 연구는 음성 및 언어 처리의 난제에 머신러닝 모델을 적용하는 데 중점을 두었습니다. 박사 과정 이전인 2009년 가을에는 통계 학습(Statistical Learning) 과정의 조교로 활동하기도 했습니다.[1][3]
Zhang은 MIT CSAIL에서 학술 연구 경력을 시작했으며, 주로 음성 인식, 화자 확인 및 언어 식별을 위한 머신러닝 응용에 집중했습니다. 그는 특히 저자원 언어에 대한 다국어 음성 인식 능력을 향상시키기 위한 연구 이니셔티브인 IARPA Babel 프로그램에 활발히 참여했습니다.[1] 이 기간 동안 그의 연구는 음성 처리의 복잡한 문제를 해결하기 위해 심층 신경망(DNN) 및 순환 신경망(RNN)과 같은 고급 딥러닝 아키텍처의 사용을 탐구했습니다. 구체적으로, 원거리 음성 인식을 위한 장단기 메모리(LSTM) 기법, 향상된 음향 모델링을 위한 심층 신경망 병목 특징 추출, 오디오 신호의 화자 및 환경 변동성을 정규화하기 위한 i-벡터 기반 접근 방식 등을 연구했습니다.[1]
학계를 떠난 후 Zhang은 기술 산업계의 연구직으로 전환했습니다. 그는 2010년부터 2012년까지 Microsoft Research Asia에서 인턴으로 근무했고, 이후 2014년 Microsoft에서 연구 인턴으로 근무하며 음성 및 언어 기술 프로젝트에 기여했습니다.[3] 2017년부터 2023년까지 Google DeepMind의 수석 연구 과학자(Staff Research Scientist)로 재직하며 대규모 자동 음성 인식, 텍스트 음성 변환 합성, 자기 지도 및 준지도 음성 학습, 다국어 및 멀티모달 음성-텍스트 시스템 등의 업무를 수행했습니다. 이러한 성과는 SpecAugment, Conformer, LibriTTS, WaveGrad, w2v-BERT, ContextNet, Google USM, FLEURS와 같은 간행물에 반영되어 있습니다.[4] 이후 그는 2023년 10월부터 2025년 7월까지 OpenAI의 기술 스태프(Member of Technical Staff)로 근무한 뒤, 2025년 7월 Meta의 Superintelligence 팀에 연구 과학자로 합류하여 음성 및 멀티모달 이해를 위한 파운데이션 모델 고도화에 집중하고 있습니다.[3][4][2]
Yu Zhang은 경력 전반에 걸쳐 ICASSP(International Conference on Acoustics, Speech, and Signal Processing) 및 Interspeech를 포함한 주요 머신러닝 및 신호 처리 컨퍼런스에서 발표된 수많은 연구 논문의 공동 저자로 참여했습니다. 그의 논문들은 음성 인식, 특징 추출 및 음향 모델 학습을 위한 딥러닝 연구를 반영합니다.
주요 발표 논문은 다음과 같습니다:
그의 후기 연구에는 데이터 증강을 위한 SpecAugment, Conformer 및 ContextNet과 같은 합성곱 증강 및 문맥 인식 아키텍처, LibriTTS 텍스트 음성 변환 코퍼스와 같은 음성 인식 및 합성을 위한 방법 및 데이터셋에 대한 기여가 포함됩니다. 또한 화자 확인에서 다중 화자 TTS로의 전이 학습, WaveGrad와 같은 WaveNet 및 확산 기반 음성 생성 연구, w2v-BERT 및 대규모 준지도 ASR을 포함한 자기 지도 및 준지도 음성 모델, Google USM 및 FLEURS와 같은 다국어 음성 시스템 및 벤치마크도 다룹니다.[4] 그의 전체 논문 목록은 자동 음성 인식, 음성 합성, 자기 지도 학습, 다국어 및 멀티모달 음성 처리 분야의 주제를 망라합니다.[1][2][3][4][5][6]
2024년 11월 15일, Yu Zhang은 *카네기 멜론 대학교 언어 기술 연구소(LTI at CMU)*가 주최한 LTI 콜로퀴움의 초청 연사로 참여했습니다. *“Hearing the AGI: from GMM-HMM to GPT-4o”*라는 제목의 발표에서 그는 음성 인식 연구의 역사적 발전과 현재의 방향을 검토했습니다.
강연에서 Zhang은 초기 가우시안 혼합 모델-은닉 마르코프 모델(GMM-HMM) 시스템에서 자기 지도 트랜스포머 모델 기반의 대규모 멀티모달 아키텍처로의 발전을 설명했습니다. 그는 이 분야의 진보가 데이터셋과 모델 크기의 확장뿐만 아니라 컴퓨팅 자원의 확장과 시스템 수준의 엔지니어링 과제 극복에 의해 주도되었다고 언급했습니다.
Zhang에 따르면, 자기 지도 학습은 모델이 방대한 양의 라벨이 없는 오디오를 활용할 수 있게 함으로써 음성 시스템의 용량과 성능을 확장하는 데 핵심적인 역할을 했습니다. 그는 또한 음성 처리가 배경 소음, 묵음, 다양한 음향 조건과 같은 추가적인 요소를 다뤄야 하기 때문에 텍스트보다 훨씬 더 많은 계산 능력을 필요로 한다고 관찰했습니다.
Zhang은 더 나아가 자동 음성 인식에서 음성, 텍스트, 비전을 결합한 멀티모달 시스템으로의 전환에 대해 논의했습니다. 그는 GPT 스타일의 언어 모델에서 사용되는 것과 유사한 차기 토큰 예측(next-token prediction) 접근 방식이 이러한 전환의 중심에 있다고 강조했습니다. 또한 단어 오류율(WER)과 같은 전통적인 지표가 항상 인간의 품질 판단을 반영하는 것은 아니라고 지적하며, 보다 대표성 있는 평가 방법을 개발하는 것의 중요성을 강조했습니다.
안전성과 신뢰성 문제에 대해 Zhang은 음성 모델의 출력이 틀렸을 때 더 설득력 있게 보일 수 있기 때문에 독특한 위험을 초래할 수 있다고 언급했습니다. 그는 정렬(alignment), 벤치마킹, 긴 문맥 입력의 효율적인 처리를 지속적인 연구 과제로 꼽았습니다. 그는 음성과 텍스트 및 비전의 통합이 멀티모달 시스템의 발전과 인공 일반 지능(AGI)에 대한 잠재적 기여에 큰 역할을 할 것이라고 결론지으면서도, 진보는 과학적 연구와 실질적인 엔지니어링 솔루션 모두에 달려 있음을 강조했습니다.[7]
August 28, 2026. 21:27 UTC
편집 요약:
Expand Yu Zhang summary and timeline (+110w)
