最后更新:
Jiahui Yu(于嘉晖)是一位人工智能研究员和企业家,以其在多模态模型、计算机视觉、生成式人工智能和推理模型方面的工作而闻名。他此前在 Meta 超级智能实验室(Meta Superintelligence Labs)内共同创立了 TBD Lab,曾领导 OpenAI 的感知研究,并曾在 Google DeepMind 共同领导 Google Gemini 项目的多模态部分。2026 年 8 月,Yu 宣布离开 Meta 创办一家新公司。[7] [8]
Yu 在中国科学技术大学获得了计算机科学学士学位。随后,他在伊利诺伊大学厄巴纳-香槟分校完成了博士学位,其研究重点是深度学习、计算机视觉和高效神经网络。[1]
Yu 的研究生涯始于 2015 年 5 月至 12 月在微软亚洲研究院(MSRA)担任实习生,从事大规模深度学习训练系统的工作。2016 年初,他加入旷视研究院(Megvii Research)担任研究实习生,专注于目标检测并对 UnitBox 做出贡献。在 2016 年 6 月至 2018 年 5 月期间,他还担任 Jump Trading 的研究顾问,开发涉及金融数据的模型。[1] [6]
2017 年 5 月至 12 月,Yu 在 Adobe Research 实习,其工作包括生成对抗网络(GAN)和图像修复。这一时期的相关项目包括 DeepFill 以及随后的图像补全工作。2018 年 1 月至 8 月,他在 Snap Research 从事高效深度学习模型的研究,包括 Slimmable Networks。随后,他先后在百度研究院、英伟达研究院(Nvidia Research)和 Google Brain 实习,研究领域涵盖 AutoML、高效神经网络和生成模型。[1] [6]
Yu 于 2020 年 2 月加入 Google 担任研究科学家。他的工作包括自动语音识别、多模态表示学习、计算机视觉和生成模型。后来他晋升为高级研究科学家,并随后在 Google DeepMind 工作。[1] [6]
在 Google DeepMind 期间,Yu 共同领导了 Google 多模态 AI 模型系列 Gemini 的多模态支柱。他还从事多模态理解与生成的研究,并为 Google 向大规模多模态基础模型转型的相关研究做出了贡献。
Yu 于 2023 年离开 Google DeepMind。[1]
2023 年 10 月,Yu 加入 OpenAI,领导感知(Perception)团队。他的工作重点是多模态能力,使 AI 模型能够处理图像以及文本信息并进行推理。[1] [6]
根据 Yu 的个人网站,他为 OpenAI 的多次模型发布做出了贡献。他参与了 GPT-4o 的数据、编码器、预训练和后训练工作,随后担任 GPT-4o 图像生成能力的预训练数据个人贡献者和后训练顾问。Yu 是 OpenAI “Thinking with Images”工作的项目负责人,是 o3 的多模态后训练负责人,也是 o4-mini 从预训练到后训练的直接负责人(DRI)。[1]
Yu 于 2025 年离开 OpenAI,加入 Meta 新成立的超级智能组织。[2] [3]
Yu 于 2025 年加入 Meta 的超级智能计划,当时该公司正在从包括 OpenAI、Google DeepMind 和 Anthropic 在内的机构招募研究人员。Meta 于 2025 年 6 月正式组建了 Meta 超级智能实验室 (MSL),作为开发先进基础模型和追求超级智能的更广泛努力的一部分。[2] [3]
在 Meta 期间,Yu 共同创立了 TBD Lab(Meta 超级智能实验室旗下的模型开发团队),并领导其多模态工作。[1] [8] [9]
在任职期间,Yu 的多模态团队致力于 Muse Spark、语音模式(Voice Mode)、Muse Image 和 Muse Video。Yu 称自己是 Muse Spark 1.0、1.1 和 1.2 以及 Muse Image 和 Muse Video 的多模态小组负责人(pod lead)。[1]
Muse Spark 于 2026 年作为 Meta 下一代 AI 模型的一部分推出。该团队随后的发布和项目扩展到了语音、图像生成、视频生成、代码编写、智能体任务和多模态能力。[8] [9]
Yu 将与 Meta 首席执行官马克·扎克伯格(Mark Zuckerberg)和 Meta 首席 AI 官亚历山大·王(Alexandr Wang)共同建立 TBD Lab 描述为他在公司期间的重要部分。他在加入约 14 个月后的 2026 年 8 月离开了 Meta。[8] [9] [7]
2026 年 8 月,Yu 宣布他将离开 Meta 创办一家新公司。[7] [8] [9] [10] [11]
在宣布这一举动时,Yu 表示,随着时间的推移,他对自己认为可能对人类未来产生重大影响但目前研究相对不足的一个问题越来越感兴趣。他说,这个问题已成为他的主要关注点,他将随着工作的进展披露更多信息。[7] [8] [9]
截至 2026 年 8 月,Yu 尚未公开披露新公司的名称、具体的研究或产品方向、其他创始人或团队成员,或其融资安排。他的个人网站目前将其状态简单描述为“创办一家新公司”。[1] [8] [9]
这家新公司独立于 Yu 在 Meta 工作期间共同创立的 TBD Lab。TBD Lab 仍属于 Yu 此前在 Meta 的工作成果,而非他离职后宣布的创业项目名称。[1] [8]
Yu 在其代表性作品中列出了许多主要的多模态和基础模型项目:
Yu 早期的研究还包括计算机视觉、神经网络效率、图像生成、图像修复、多模态表示学习和自动语音识别方面的工作。[1]
Yu 在公开采访和技术演讲中讨论过他的研究。在 Google 的《Meet a Google Researcher》节目中,Yu 与研究员 Yonghui Wu 讨论了 Parti,这是一种自回归文本生成图像模型。讨论涵盖了 Parti 将图像生成表示为序列建模问题的方法、缩放文本生成图像模型、多模态研究以及功能日益强大的生成系统的开发。[4]
2026年8月17日。01:37 UTC
编辑摘要:
Updated wiki: removed Perception/OpenAI and Gemini Multimodal/DeepMind line; added ..; tags -> Developer; category -> People in crypto; added 5 refs
