AI芯片原生计算范式崛起:从GPU翻译计算到专用硬件设计
1. 从“算力搬运工”到“计算本体”一场芯片设计的范式革命最近一个由前英伟达和AMD的资深架构师组成的团队发布了一项足以让整个行业侧目的成果他们设计了一款全新的AI芯片宣称能以每秒处理17000个token的速度“屠榜”。这个数字背后不仅仅是性能的飙升更可能预示着我们习以为常的“GPU计算”范式正在面临一场根本性的挑战。当所有人都在为如何搞到更多的H100、如何优化CUDA内核、如何压榨出最后一点GPU利用率而绞尽脑汁时有人选择了一条更激进的路——不再把AI计算“映射”到为图形渲染而生的通用处理器上而是直接将AI“刻”进硅片里。这听起来有点像“降维打击”。我们熟悉的GPU无论是英伟达的Tesla系列还是AMD的Instinct系列本质上都是非常强大的并行计算引擎。它们通过CUDA或ROCm这样的软件栈将矩阵乘法、卷积等AI核心运算翻译成成千上万个流处理器SM/CU能理解的指令。这个过程我们可以称之为“翻译计算”或“模拟计算”。GPU就像一个万能的多语言翻译官虽然精通多种语言图形、科学计算、AI但在处理特定语言如AI推理时总免不了要经过一道“翻译”的工序这本身就带来了开销。而所谓的“将AI刻在芯片上”其核心思想是“原生计算”。它不再需要一个庞大的、复杂的软件翻译层。芯片的硬件逻辑从晶体管级别的互联、数据通路的设计到内存的层级结构都是为了执行特定的AI计算图比如Transformer模型的前向传播而量身定制的。指令集极度精简数据流路径高度固化且优化就像为一条高速公路专门修建的收费站和分流通道车辆数据从入口到出口路径最短几乎没有红绿灯控制逻辑开销和岔路分支预测错误。这带来的直接好处就是极致的能效比和超低的延迟。每秒17000个token这个数字如果属实在特定模型和精度下其能效比很可能远超当前最先进的通用GPU。那么为什么是现在为什么这些从GPU巨头出来的大神要“另起炉灶”原因在于AI工作负载尤其是大语言模型的推理其计算模式已经变得足够清晰和稳定。Transformer架构及其变体在可预见的未来将是AI基础设施的基石。这种确定性为专用硬件ASIC的设计提供了前所未有的机会窗口。当一种计算模式从“探索期”进入“成熟期”通用计算架构的效率瓶颈就会凸显专用化就成了必然选择。这就像在个人电脑普及初期CPU包打天下但当3D游戏成为主流GPU便应运而生。现在AI计算正在经历从“GPU兼职”到“专属硬件”的类似转折。2. 拆解“屠榜”性能不仅仅是数字游戏每秒17000个token这个“屠榜”级别的数字究竟意味着什么我们需要把它放到具体的场景中理解。首先token是LLM处理文本的基本单位在英文中大约相当于0.75个单词。17000 tokens/秒意味着这块芯片每秒钟可以处理大约12750个英文单词。如果是一个典型的对话回合比如用户输入200个token模型生成500个token那么这块芯片一秒钟可以处理几十个这样的交互。这对于高并发、低延迟的在线服务如智能客服、实时翻译、AI助手来说是极具吸引力的指标。但性能数字背后是多重技术选择的叠加结果。要达成这样的性能绝不仅仅是堆砌更多的晶体管那么简单。我们可以从几个关键维度来拆解2.1 计算精度与数据流的协同设计当前GPU进行AI推理普遍采用FP16、BF16甚至INT8/INT4量化精度来提升吞吐和能效。而一款原生AI芯片可以在设计之初就为低精度计算进行深度优化。例如它可能采用更激进的混合精度策略在模型的不同层使用不同的定点数格式并在芯片内部设计专用的数据转换和累加单元避免精度损失的同时最大化计算密度。其数据流架构很可能是“权重静止”或“输出静止”的即让数据激活值在计算单元阵列中流动而权重常驻在紧邻计算单元的缓存中从而彻底消除从全局内存读取权重的巨大延迟和功耗。这与GPU需要频繁通过高带宽内存HBM访问权重的模式有本质区别。2.2 片上存储与带宽的极致优化AI计算特别是大模型是典型的“内存墙”问题。GPU通过堆叠HBM和巨大的片上缓存如L2 Cache来缓解。原生AI芯片则可以走得更远。它可能会采用超大规模的分布式片上SRAM网络将存储直接嵌入到计算单元旁边形成数百甚至上千个微小的、独立可寻址的存储块与计算阵列紧密耦合。这种近存计算或存内计算架构能实现理论上的最大内存带宽和最低访问延迟。17000 tokens/秒的吞吐必然依赖于一个颠覆性的内存子系统其有效内存带宽利用率可能远超传统GPU的架构。2.3 定制指令集与编译器的深度绑定这是软件栈层面的根本不同。这类芯片通常会定义一套极度精简、高度专用的指令集架构ISA每条指令都直接对应一个AI算子如GELU激活、LayerNorm、注意力头的缩放点积运算。其编译器的工作不是将高级框架如PyTorch的代码“翻译”成通用的并行线程指令而是将整个计算图“映射”和“切分”到芯片的物理计算阵列上并调度数据流。这个过程更像是硬件布线而非软件调度。因此其软件栈的挑战在于模型的兼容性和灵活性但一旦模型被成功编译和映射其运行效率是通用架构难以企及的。注意评估这类芯片的性能时必须关注其标称数据的前提条件包括测试的具体模型如Llama 3 8B还是70B、输入输出长度、精度FP8, INT4?、批次大小Batch Size以及是否包含预处理和后处理时间。脱离上下文谈性能数字没有意义。3. 对现有生态的冲击CUDA护城河还牢不可破吗英伟达之所以能在AI领域建立近乎垄断的地位其核心技术壁垒并非仅仅是硬件而是CUDA生态。数百万开发者熟悉的编程模型、丰富的库cuDNN, cuBLAS, TensorRT以及庞大的社区构成了一个极其强大的护城河。任何新硬件首先要回答的问题就是我的软件在哪用户怎么把现有的PyTorch/TensorFlow模型跑起来前英伟达/AMD大神们创业做AI芯片必然深刻理解这一点。因此他们的产品策略绝不会是“硬碰硬”地要求开发者学习一套全新的底层编程语言。更可能的路径是3.1 提供高层级框架兼容性他们会开发一个编译器能够直接将主流的AI框架PyTorch, TensorFlow, JAX的模型定义编译到自己的芯片上执行。对开发者而言可能只需要更改几行代码将设备指定为他们的专用芯片剩下的工作由编译器完成。这类似于谷歌TPU通过TensorFlow XLA编译器所做的事情。他们会极力降低用户的迁移成本。**3.2 瞄准CUDA生态的“缝隙市场”CUDA虽然强大但并非在所有场景下都是最优解。尤其是在云端推理市场对成本每token成本和延迟极度敏感。如果专用AI芯片在特定模型如当前流行的开源LLM的推理任务上能够提供数倍于同价位GPU的性价比那么它就有机会在推理服务器、边缘AI盒子等市场撕开一道口子。创业公司或中型企业在采购天价的H100集群面临压力时性价比更高的专用方案会变得非常有吸引力。3.3 与云厂商深度绑定最有可能的落地路径是与大型云服务提供商如AWS, Azure, GCP合作以后端加速卡或实例的形式提供服务。终端用户无需关心底层硬件是什么只需在云平台选择对应的“AI推理优化型实例”。云厂商有最强的动力去引入更具能效比的硬件来降低运营成本并提高利润率。一旦在主流云平台上线就等于获得了巨大的分销渠道和市场验证机会。然而挑战依然巨大。专用芯片的灵活性是其阿喀琉斯之踵。下一代Transformer变体如Mamba等状态空间模型如果成为主流现有芯片的架构是否还能高效支持软件栈的成熟度、驱动稳定性、工具链的完善度都需要时间积累。CUDA生态是过去十余年构建的成果新玩家需要证明自己不仅能做出更快的芯片还能构建一个可持续、易用且能跟上算法快速迭代的软件生态。4. 开发者视角机遇、挑战与应对策略对于身处AI应用开发一线的工程师和研究者来说这场潜在的变革既是机遇也是挑战。我们不必立刻担心GPU会“凉”但必须保持关注并调整技术视野。4.1 关注计算抽象层的演进未来的AI硬件可能会更加多样化包括GPU、专用AI芯片、神经拟态芯片等。这对开发者意味着紧绑在某一特定硬件厂商的底层API如直接写CUDA内核可能会限制可移植性。更高层级的计算抽象变得更重要。例如MLIR多级中间表示这样的编译器基础设施旨在为不同的硬件后端提供统一的中间层。关注和了解这些跨平台编译技术如Apache TVM、OpenXLA能让你的模型在未来更容易地部署到新兴的硬件上。4.2 模型设计与硬件协同优化在专用硬件时代模型架构的设计可能需要考虑硬件特性。这类似于移动端AI的模型轻量化。未来我们可能会看到更多“硬件感知的神经网络架构搜索HW-NAS”即搜索出的模型不仅在精度和参数量上最优还在目标硬件上具有最高的吞吐和能效。作为开发者理解你的模型在目标硬件上的计算、内存和通信瓶颈将成为一项核心技能。4.3 实践建议构建可移植的模型部署流水线在当前阶段一个务实的策略是训练阶段依然利用强大的GPU集群使用PyTorch等主流框架进行模型开发和训练。部署准备在模型导出时优先使用标准格式如ONNX。ONNX作为一个开放的模型表示格式是连接不同推理后端的重要桥梁。推理后端多样化测试建立一套评估流程不仅用TensorRT在GPU上测试推理性能也可以尝试将ONNX模型放到其他推理引擎如针对CPU优化的ONNX Runtime或未来针对专用芯片的编译器上运行进行成本和性能的对比。基础设施抽象在服务化部署时考虑使用像KServe、Triton Inference Server这样的推理服务框架。它们支持多种后端和硬件可以让你通过配置而非代码修改来切换推理设备。4.4 对现有工作的影响短期内绝大多数AI开发尤其是模型训练和探索性研究仍将牢牢扎根于GPU生态。CUDA的工具链、调试器、性能分析器Nsight以及庞大的社区知识库是无可替代的生产力工具。专用AI芯片首先冲击的是大规模、稳定态的模型推理生产环境。对于大多数开发者而言当前的重点仍是深耕主流框架和GPU优化。但保持对行业前沿的敏锐度了解不同硬件范式的优劣能让你在未来技术选型时做出更明智的决策。这场由芯片设计老将发起的冲击其意义不在于立刻取代GPU而在于证明了一条超越现有范式的技术路径的可行性。它像一条鲶鱼搅动着AI算力市场迫使所有玩家思考当AI成为明确的、持续的核心负载我们究竟需要什么样的计算基础答案可能不是更快的“图形处理器”而是真正为智能计算而生的“智能处理器”。这个过程将充满竞争、融合与迭代而最终的受益者将是整个AI产业和所有致力于将AI落地的开发者。我们正站在一个计算架构分水岭的起点保持开放和学习的心态是应对变化的最好方式。

相关新闻

最新新闻

日新闻

周新闻

月新闻