天垓100率先完成百亿级参数大模型训练,天数智芯迎来新的里程碑
来源:I云咨询 发布日期:2024-12-20
6月10日,在第五届智源大会AI系统分坛,海天数智芯半导体有限公司(以简称“天数智芯”)对外宣布,在天100加速卡的算力集群,基于北京智源人工智能研究院(以简称“智源研究院”)70亿参数的Aquila语言基础模型,使用措数据进行继续训练,稳定运行19天,模型敛效果符合预期,证明天数智芯有支持百亿级参数大模型训练的能力。
在北京市海淀区的大力支持,智源研究院、天数智芯与爱特云翔共同合作,联手开展基于自主通用GPU的大模型CodeGen(高效彪)目,通过中文描述来成可用的C、Java、Python措以实现高效彪。智源研究院负责算法设计、训练框架开发、大模型的训练与调优,天数智芯负责提供天100加速卡、构建算力集群及全程技术支持,爱特云翔负责提供算存网基础硬件及智能化运维服务。
在三方的共同努力,在基于天100加速卡的算力集群,100B Tokens编程语料、70亿参数量的AquilaCode大模型参数优化工作结果显示,1个Epoch后loss降到0.8,训练速度达到87K Tokens/s,线性加速比高达95%以。与国际主流的A100加速卡集群比,天100加速卡集群的敛效果、训练速度、线性加速比当,稳定性更优。在HumanEval基准数据集,以Pass@1作为评估指标,自主算力集群训练出来的模型苍结果达到近参数级别大模型的SOTA水平,在AI编程能力与国际主流GPU产品训练结果近。