
针对速 AI 理中内存带宽这中枢瓶颈,Cerebras 周二发布了新代晶圆引擎(WSE)及 Nexus 机架系统。其餐盘大小的 AI 加快器内存带宽达 21.6 PB/s,堪称是英伟达或 AMD 旗舰 GPU 的 1000 倍。新系统旨在将每瓦糊涂量擢升至上代的十倍。
WSE-3T:频率翻倍的"涡轮"版
新发布的 WSE-3T(T 代表 Turbo)在打算才气、内存互连总线和 I/O 带宽上均终了翻倍。数据示常德管道保温工程,其稀薄 FP16 算力从 125 PFLOPS 升至 250 PFLOPS,密集 FP16 算力从 12.5 PFLOPS 升至 25 PFLOPS,内存带宽从 21.6 PB/s 增至 43.2 PB/s,I/O 带宽从 1.2 Tbps 增至 2.4 Tbps。
值得介意的是,WSE-3T 并未编削硅片基础规格。其晶圆面积(46,225 mm ²)、工艺节点(台积电 5nm)、晶体管数目(4 万亿)、中枢数(90 万)及 SRAM 容量(44 GB)均与两年前的 WSE-3 保执致。能擢升主要源于供电率的化,使芯片使命频率从 1.4 GHz 翻倍至 2.8 GHz,从而终了的令生成速率。晶圆 TDP 瞻望从 15 kW 增至 33 kW,系统 TDP 瞻望从 23 kW 增至 46 kW。
尽管纸面数据亮眼,但试验能需理看待。Cerebras 的能宣传度依赖稀薄,而空话语模子(LLM)理频繁垂青密集算力。若按 10 倍稀薄度折算,WSE-3T 的密集 FP16 能约为 25 PFLOPS。此外,峰值内存带宽可能仅为表面值,因为在 LLM 理中,单芯片每每难以填塞其 SRAM。
在诈骗计谋上,Cerebras 不再试图立启动悉数这个词理堆栈,而是与亚马逊云科技(AWS)和 AMD 伙同,将打算密集的教唆处分部分卸载至 Trainium XPUs 和 Instinct GPU,自己则注于充任解码加快器。凭借板上广漠的 SRAM 容量,Cerebras 仅需几十个处分单位即可启动万亿参数模子,远低于其他案所需的数千个单位。鉴于 SRAM 容量自 WSE-2 以来未著加多,业界测下代 WSE-4 可能会在截止擢升算力的同期常德管道保温工程,翻倍 SRAM 容量。
CS-4 机架:模块化与去交换直连
随同 WSE-3T 发布的 CS-4 机架系统,铝皮保温记号着 Cerebras 认真进攻机架规模打算。模仿英伟达 NVL72 和 AMD Helios 的念念路,CS-4 给与模块化架构,将打算、供电和布线别离。芯片被封装在名为"背包"的立模块中,每个 CS-4 多可容纳三个"背包",插入机架后头,正面则部署电源架。由于单系统加快器数目加多三倍,瞻望总系统功耗在 120 kW 至 140 kW 之间,虽于前代,但比拟竞品行将出的 240-250 kW 机架仍保守。
在互联面,CS-4 通过移除额酬酢换机,让芯片径直通讯,将延伸从 5 微秒降至 2 微秒。这种二维环形拓扑结构相沿活水线并行,终点得当对延伸敏锐的多加快器理场景。固然也相沿基于 RoCE 的交换式 fabric,但延伸会略有加多。据基准测试数据,在单个 CS-4 系统上,gpt-oss-120b 模子的理速率可达每秒 4400 个令,远刻下基于 GPU 业绩的每秒约 350 个令。该拓扑结构表面上可相沿达 50 万亿参数的模子。
Cerebras 瞻望,批基于 CS-4 的系统将于本季度晚些时辰上线。
【星途科讯 图文丨 Patrick 发于 ZAKER 科技,转载请注明出处】地址:大城县广安工业区相关词条:铁皮保温施工 隔热条设备 锚索 离心玻璃棉 万能胶生产厂家
1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定常德管道保温工程,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》,以此来变相勒索商家索要赔偿的违法恶意行为。
