ZD至顶网网络频道 11月11日 北京消息: InfiniBand明年将从100 Gbps走向200 Gbps。记者日前采访了Mellanox营销副总总裁Gilad Shainer。
Shainer表示,Mellanox将自下而上提供200 Gbps HDR InfiniBand规范产品,包括开关、芯片、网卡和相应的网线。
即将上市的Quantum开关设备支持40端口200 Gbps HDR InfiniBand,或80端口100 Gbps,将以模块化开关的形式提供,可以扩展到200 Gbps速度的800个端口或100 Gbps 速度的1600个端口。切换延迟为90 ns,总容量达16 Tbps。
200 Gbps的ConnectX适配器设备的延迟为0.6微秒,支持第三代、第四代PCIe,包括Mellanox多主机支持(如果不需要200 Gbps,则可将分适配器分割给多个主机使用)。
假如有人觉得此类速度翻倍的游戏没有什么意思,Mellanox也一直在推动利用开关减少CPU的负载的工作,这一点兴许会更有意思。
Shainer表示,现在业界需要“在各种地方分析数据,特别是在迁移数据的时候。InfiniBand HDR设备着眼于高性能计算环境,并将扩大网络计算和自适应路由功能,二者在运行上一代100 Gbps的环境里都颇为有用。”
Shainer称,卸载处理器方面的工作多年前以RDMA(远程直接内存访问)起步,即是说数据迁移用到的CPU时间不到1%。这在Quantum和ConnectX里得以扩展。
他表示,“Quantum开关的功能包括执行数据整合和削减协议,以减少CPU的负载。”他还表示,机器学习训练算法用到相同的基本概念。
ConnectX适配器也提供网络内存储、加密和其他安全方面的卸载功能。超级计算环境中的消息传递接口(MPI)也属于ConnectX卸载功能的一部分,MPI利用集总和匹配减少CPU的负载。Shainer表示,ConnectX的卸载功能可以将“60%至70%的MPI工作负载卸载到网络里……有朝一日,整个MPI框架将会迁移到网络里”。
他表示,存储卸载也是卸载功能的一部分,原因是检查点的设置(将应用程序的状态保存为返回点以备崩溃是用)目前是CPU负载的一部分。Shainer表示,“如果运行的节点达数千个,而又不想重新启动应用程序,那么这一点就十分关键。”
检查点的设置需要CPU时间,而HPC管理员不愿意在这些事务管理上消耗资源,因此ConnectX可以做背景检查点的设置。
适配器加密卸载为磁盘加密添加一个有意思的功能。如果用了全盘加密,那么数据保护涉及的不是单个用户。据Shainer介绍,“但如果是在网络上,不同的用户在网络上可以使用不同的密钥或不同的应用程序。”
Quantum和ConnectX还添加了遥测功能,内置的硬件传感器可以提供实时数据收集。
200 Gbps的配件包括HDR铜电缆和拆分器(用于3米内的机架链接)、主动硅光光学电缆(用于100米以内的数据中心链接)和光收发器(2000米以内的链接)。
新产品将于2017年应市。
好文章,需要你的鼓励
CoreWeave发布AI对象存储服务,采用本地对象传输加速器(LOTA)技术,可在全球范围内高速传输对象数据,无出口费用或请求交易分层费用。该技术通过智能代理在每个GPU节点上加速数据传输,提供高达每GPU 7 GBps的吞吐量,可扩展至数十万个GPU。服务采用三层自动定价模式,为客户的AI工作负载降低超过75%的存储成本。
IDEA研究院等机构联合开发了ToG-3智能推理系统,通过多智能体协作和双重进化机制,让AI能像人类专家团队一样动态思考和学习。该系统在复杂推理任务上表现优异,能用较小模型达到卓越性能,为AI技术的普及应用开辟了新路径,在教育、医疗、商业决策等领域具有广阔应用前景。
谷歌DeepMind与核聚变初创公司CFS合作,运用先进AI模型帮助管理和改进即将发布的Sparc反应堆。DeepMind开发了名为Torax的专用软件来模拟等离子体,结合强化学习等AI技术寻找最佳核聚变控制方式。核聚变被视为清洁能源的圣杯,可提供几乎无限的零碳排放能源。谷歌已投资CFS并承诺购买其200兆瓦电力。
上海人工智能实验室提出SPARK框架,创新性地让AI模型在学习推理的同时学会自我评判,通过回收训练数据建立策略与奖励的协同进化机制。实验显示,该方法在数学推理、奖励评判和通用能力上分别提升9.7%、12.1%和1.5%,且训练成本仅为传统方法的一半,展现出强大的泛化能力和自我反思能力。