公司动态
今年会2024-摩尔线程发布TensorFlow
2026-08-29 20:02:18
【CNMO科技动静】8月21日动静,摩尔线程正式发布TensorFlow-MUSA v1.5.0。作为面向MUSA同一体系架构GPU推出的TensorFlow插件,该版本进一步完美了对于搜刮、告白、保举(如下简称“搜广推”)营业的撑持,开发者可以于摩尔线程全功效GPU上直接开展AI模子练习与推理,无需对于原有TensorFlow模子代码举行年夜幅修改。这次更新还有针对于搜广推营业的模子特色举行了专项优化,并已经于GitHub开源,同时提供预构建镜像,利便开发者快速部署。 搜广推营业凡是需要处置惩罚海量用户举动数据及年夜范围稀少特性,其计较特色与视觉、语音等常见AI使命存于较年夜区分。一方面,Embedding参数范围较年夜,模子布局也需要频仍迭代;另外一方面,练习阶段需要较高的吞吐能力及漫衍式计较能力,而于线推理又对于延迟及吞吐提出较高要求。因为练习及推理往往需要共用模子代码和工程链路,是以AI框架不仅需要具有较为完备的算子撑持,还有需要统筹混淆精度及漫衍式计较能力。 针对于这些需求,TensorFlow-MUSA v1.5.0于框架层面实现了对于TensorFlow数据流图、主动微分以和漫衍式练习等焦点机制的撑持,并将MUSA装备作为TensorFlow原生装备举行注册。对于在原本基在TensorFlow开发的搜广推模子而言,可以继承沿用原有开发方式,将模子迁徙至摩尔线程全功效GPU上运行,从而降低适配历程中需要举行的代码及工程调解。 于模子兼容性方面,TensorFlow-MUSA v1.5笼罩规模进一步扩展。该版本不仅继承撑持ResNet等经典视觉、语音模子,还有插手了年夜量搜广推模子,包括Wide&Deep、FNN、PNN、DeepFM、NFM、MLR、SharedBottom等经典模子,以和DCN、xDeepFM、AutoInt、FGCNN、FiBiNet、FWFM等特性交织模子。同时,针对于用户举动序列建模及多使命进修场景,该版本撑持DIN、DIEN、DSIN、BST、MMoE、ESMM、PLE等模子。 此外,TensorFlow-MUSA v1.5还有针对于最近几年来呈现的新型搜广推架构举行了适配,撑持EDCN、DCNmix、Wukong、RankMixer、OneTrans及TokenMixerLarge等模子。摩尔线程暗示,这些模子笼罩了从传统保举算法到新型模子架构的多个运用场景,可以满意开发者于差别搜广推营业中的练习及推理需求。 软件版本方面,TensorFlow-MUSA v1.5撑持TensorFlow 2.6.1及2.15.1,并可共同MUSA SDK 4.3.5或者5.1.0利用。摩尔线程暗示,思量到TensorFlow 2.15.1以后的功效变化相对于有限,同时部门初期特征被移除了,后续将重要维护TensorFlow 2.15.1版本,并连结前向兼容,同时按照开发者需求评估其他版本的撑持。 机能方面,摩尔线程宣布的试验室测试数据显示,基在AI训推一体智算卡MTT S5000运行搜广推模子时,于BF1六、TF32等数据精度以和多流履行、算子交融、图优化及XLA编译优化等能力撑持下,部门模子体现出较较着的机能晋升。以TokenMixerLarge为例,单步练习耗时为138.048ms,相较国际主流GPU的加快比到达1.81倍。摩尔线程同时给出的总体测试成果显示,部门前沿搜广推模子练习吞吐晋升幅度到达1.5倍至1.85倍。不外,官方也注明,相干数据来自摩尔线程试验室,现实机能会遭到模子实现、硬件配置、软件版本以和练习参数等因素影响。 今朝,TensorFlow-MUSA v1.5.0已经经于GitHub开源,开发者可以根据官方申明自行编译安装,也能够直接利用预构建镜像。这次版本更新将重点从通用模子撑持进一步延长至搜广推等高计较需求场景,摩尔线程也于经由过程框架适配、模子笼罩及机能优化等方式,完美MUSA GPU的软件生态。 版权所有,未经许可不患上转载
摩尔线程
相干信息

