阿希什·瓦斯瓦尼是印度裔美国研究者,在印度完成本科教育后赴美深造,博士毕业后进入谷歌大脑工作,并在这里成为现代大模型架构的奠基者之一。2017 年,他与七位谷歌同事共同发表论文《Attention Is All You Need》,提出完全基于注意力机制的 Transformer 架构,抛弃了循环与卷积结构,使模型可以大规模并行训练。这篇论文成为此后所有主流大语言模型的共同基础,GPT、BERT 等模型都建立在 Transformer 之上,他作为第一作者也因此成为生成式 AI 时代被引用最多的研究者之一。2022 年他离开谷歌加入 Adept AI,探索能与软件交互、可以调用工具的智能体;2023 年他与同事联合创办 Essential AI,目标是构建能自动完成企业级工作流的基础模型与产品。他长期主张,在架构与规模化之外,效率与产品化才是大模型真正落到业务里的关键。这篇论文发表时并未立刻引发热潮,直到大规模预训练兴起之后,Transformer 才成为整个行业的标准架构。