旗下矩阵

  • 投资界
  • 天天IPO
  • 解码LP
  • 并购
  • 前哨
  • 投资界AI

凌波智芯与天津大学共建联合实验室,推进无链接 RoCE 与高性能 AI 网卡研发

9月4日天津大学—凌波智芯先进算力互联技术联合实验室揭牌,聚焦人工智能算力互联,双方还签入股增资协议,延伸至成果转化与产业协同。
·投资界综合

凌波智芯与天津大学共建联合实验室,推进无链接 RoCE 与高性能 AI 网卡研发

配图:天津大学—凌波智芯先进算力互联技术联合实验室揭牌仪式

AI 基础设施的竞争,正在从单点算力扩展到集群协同效率。9月4日,天津大学-凌波智芯先进算力互联技术联合实验室在天津大学正式成立。联合实验室聚焦人工智能算力互联,将围绕高性能 AI 网卡、Scale-out 网络、无链接 RoCE、先进流量控制、高并发状态管理和可靠传输等方向开展联合攻关。

在大模型训练和推理场景中,GPU 并不是孤立工作。多节点、多 GPU 集群需要频繁进行 Collective 通信、All-to-All 数据交换、专家并行和跨节点 KV 数据交换。Scale-out 网络也因此从服务器的配套部件,逐渐成为决定 GPU 有效利用率和系统吞吐的关键变量。

凌波智芯切入的正是 AI 集群中的网络互联问题。公司围绕 LINGBO 系列高性能 AI 网卡研发,提出“无链接 RoCE”技术路线,希望在保持 RoCEv2 和开放以太网基础生态的前提下,通过重新设计网卡内部通信状态、队列与可靠传输机制,让网卡在高并发 AI 通信下仍能维持高效的数据面处理。

传统面向连接的 RDMA 网卡通常以 QP 及其关联上下文作为传输和可靠性管理的重要粒度。一个通信关系背后,需要维护序列号、窗口、重传、拥塞控制以及队列等状态。当 GPU 数量、并发通信关系以及 Collective 并行度同时上升时,状态项数量、查表频率和片上 SRAM 压力会快速放大。

所谓“无链接 RoCE”,并不是取消 RDMA 的可靠性语义,也不是让数据包无序、无状态地在网络中自由发送,而是把数据传输从大量细粒度连接上下文中解耦。凌波智芯采用面向目的端的状态聚合思路,使同一目的端的多条通信流能够共享部分传输上下文和调度资源,降低连接数量增长对片上存储和状态访问带来的压力。

围绕这一架构,凌波智芯还设计了 HP4 流控和 SSR 选择性重传。HP4 的核心思想是依据接收端可承载能力、网络往返特征和当前活跃发送关系,对可注入网络的数据量进行主动约束,把拥塞管理从“事后退让”尽可能前移到“事前注入控制”。SSR 则采用 Packet Container 思想,通过选择性确认反馈缺失位置,使发送端只重传真正丢失的数据,而不是重复发送已经正确到达的整个数据段。

从产业观察角度看,这一项目的关注点不在于单一技术名词,而在于能否把网络论文、硬件 IP 和真实集群验证连成一条链。联合实验室将把高校在网络体系、拥塞控制和系统研究方面的原创成果,与企业在 FPGA、芯片 RTL、板卡、驱动和客户场景验证方面的工程能力连接起来。

后续在客户 POC 阶段,还需要进一步覆盖主流 GPU、交换机、训练框架和不同拓扑,验证软硬件互操作性,以及新网卡与现有 RoCE 网络混合部署时的兼容能力。这也意味着,真实多节点网络中的有效带宽、Collective 完成时间、P99 尾时延、丢包恢复时间和规模扩展效率,将成为观察这一技术工程化进展的重要指标。

同日,天津大学与凌波智芯签署相关入股增资协议,双方合作由联合科研进一步延伸到成果转化和产业协同。凌波智芯创始人、天津大学教授李文信表示,LINGBO 系列 AI 网卡是现阶段技术落地的重要产品载体,但联合实验室长期希望沉淀的是协议、架构、算法、核心 IP 和系统能力。

【本文经授权发布,不代表投资界立场。本平台仅提供信息存储服务。】
【免责声明】:本文不构成任何投资建议。市场有风险,投资需谨慎。
如有任何疑问,请联系(editor@zero2ipo.com.cn)投资界处理。