周末K3很火爆,看测试视频效果真好,本来今天想开个基础版会员体验下,谁知有钱都花不出去,会员售罄,明天再看看情况。

周末关于K3
国泰海通开了个电话会议交流,里面有段交流内容提到“K3不适合传统GPU分离式部署,更适合超节点部署”,“单卡比不上,就上超节点”的说法,今天就掰次掰次啥是超节点?国产模型上超节点的目的是啥?这个趋势会带动哪些产业趋势?

一、啥是超节点
话说,现在AI服务器不都是很多GPU连在一起吗?为什么突然又冒出来一个"超节点"?超节点和传统分离式部署又有啥区别?英伟达NVL72、NVL144不是超节点吗?其实,超节点这个词代表的不是算力等硬件,而是算力的组织方式。过去,AI集群更多采用的是一种"分离式部署"。什么意思?假设一个集群有256张GPU,它们通常分布在几十台服务器、多个机柜里。每台服务器有自己的CPU、内存和网络,再通过InfiniBand或者RoCE网络连接成一个大集群。这种方式可以不断扩展GPU数量,但GPU之间的数据交换,需要频繁跨服务器、跨交换机,通信路径比较长。它会把大量GPU,通过NVLink、NVSwitch等超高速互联,组成一个统一的计算域(Scale-Up Domain)。在这个计算域内,GPU之间可以像一块更大的GPU一样协同工作。所以,超节点并不是"GPU更多"。而是让更多GPU先组成一个整体,再参与整个集群的计算。Kimi这里说的,就是在强调这种区别于传统互联的部署方式。很多国产GPU集群,目前仍然采用比较传统的分离式部署。即使GPU数量很多,Expert(专家)也可能随机分布在不同服务器之间。而超节点部署,则会尽可能让需要频繁通信的GPU、甚至MoE专家,优先部署在同一个超节点内部,把大量通信留在节点内完成,而不是频繁跨服务器通信。所以,超节点不仅是一种硬件架构,更是一种系统设计思想。
二、超节点解决什么问题?
过去几年,整个行业都在拼GPU性能。A100、H100、B200,每一代GPU都在不断提升单卡算力。那个时候,真正的瓶颈就是GPU本身。但对于国产模型厂商来说,情况有些特殊。一方面,国内大模型厂商有钱也不一定买得到高端GPU,算力受限;另一方面,模型参数越来越大,对算力的需求越来越大。这两者出现了很大的需求供给偏差。所以国产模型厂只能另辟蹊径,如果单张GPU性能有限,那就只能部署更多GPU!很多GPU并不是在计算,而是在等待其他GPU把数据传过来。过去,计算可能占整个系统一半时间;如今,越来越多时间消耗在通信和存储。
而是GPU越来越多之后,如何尽可能减少通信开销,提高整个系统效率。超节点提升的不是GPU算力,而是GPU协同效率。

三、超节点带来什么趋势变化?
如果把超节点仅仅理解成一种服务器架构,其实低估了它的重要性。它背后真正反映的是,AI基础设施建设思路的一次变化。
过去,我们讨论AI服务器,更多关注的是:GPU性能是不是更强?显存是不是更大?单卡FLOPs是不是更高?
而未来几年,关注点会越来越多地转向另一个问题:如何让几百张GPU像一张GPU一样协同工作?
因此,你会发现,越来越多的新技术开始围绕"互联"展开。
例如:NVLink、NVSwitch、Scale-Up网络。
再往外,是800G、1.6T光模块、Ultra Ethernet、InfiniBand。
再往下,是高速PCB、铜连接、CPO……
这些技术看似分散,其实都在解决同一个问题:
让越来越庞大的GPU系统,高效协同。
未来,GPU当然依然重要。但GPU已经不再是唯一决定AI性能的因素。网络、交换、互联、软件调度,以及整个系统架构,都会变得越来越重要。这就是K3交流里说的:“按当前GPU效率,GPU算力(FLOPs)几乎已不是瓶颈:过去算力占一半、存储通信占一半,如今FLOPs占比可能已降至两成以下,其余全部依靠通信与存储。”

本报告基于公开信息整理,仅供参考,不构成投资建议。投资者应独立判断,自行承担投资风险。报告中的数据、观点可能存在滞后性,请以最新官方信息为准。
作者声明: 本文转载自第三方,旨在提供资讯参考,并非证券推荐或投资建议。作者对内容的真实性、准确性不承担保证责任。本文不构成任何投资建议或证券推荐。截至发文日,作者与文中提及的标的不存在持仓关系。