海光DCU Day0极速适配Kimi K3:3万亿级开源模型满血落地国产算力

七颜百科 °C 栏目:历史大事记
海光DCU Day0极速适配Kimi K3:3万亿级开源模型满血落地国产算力

  (来源:海光信息

  727日,月之暗面正式推出迄今能力最强的开源大模型Kimi K3海光信息同步实现Day0极速适配,当日完成该模型在海光DCU平台的全流程适配、部署与性能验证,让国产算力用户无需等待、即刻体验这款3万亿级开源模型的满血性能。

  Kimi K3是一个2.8万亿参数模型,基于KDA混合线性注意力机制(Kimi Delta Attention)与注意力残差(Attention Residuals)技术构建,原生支持视觉理解,并拥有100token上下文窗口,是全球首个开源的3万亿级别模型,面向长程编程、知识工作和推理等前沿智能场景而设计。

  依托超大稀疏MoE架构,Kimi K3结合Stable LatentMoE框架,可在896个专家中高效激活16个;配合训练方法与数据配方优化,模型相比K2的整体扩展效率提升约2.5倍,能更有效地把算力转化为能力。在整套评测中,Kimi K3展现出前沿水平的能力,稳定超过其他所有开源模型。

  凭借三重硬核能力,K3不仅能持续完成长时间工程任务、理解和处理大型代码库,还能一次性读入百万级超长上下文,并基于截图与视觉反馈实现真正的视觉闭环迭代。这对软件开发、科研计算、长文档处理等场景非常实用。

  与模型权重同步公开的,还有Kimi K3技术报告与三项关键Infra技术——MoonEPFlashKDAAgentEnv,覆盖从高性能通信、高性能算子到分布式RL环境的关键链路。

  从算子到引擎全栈调优,海光DCU释放K3满血性能

  围绕Kimi K3的架构特性,海光DCU团队依托自研DAS/DTK软件栈,完成了从底层算子、训练推理框架到推理引擎的全栈适配,带来部署与性能的双重升级:

  无缝迁移,开箱即用:Kimi K3在海光DCU上实现零改造部署——模型代码与业务逻辑均无需任何调整,开发者拿到算力即可上线,迁移成本几乎为零。

  架构级调优,性能满血:针对KDA混合线性注意力机制与896专家超大稀疏MoE架构,海光完成算子级定制优化。即便在百万级超长上下文的重载场景下,推理依然高效、稳定、低延迟,实测表现与GPU原生版本高度一致。

  从写代码到造芯片:国产算力跑通K3前沿场景

  满血落地的Kimi K3,把一批过去只存在于演示中的前沿智能场景,真正带到了国产算力之上:

  • 长程智能体工程:K3可在极少人工监督下持续完成长时间工程任务,理解大型代码库并协调终端工具——GPU内核优化到从零构建类Triton编译器,硬核软件工程在海光DCU上自主闭环。

  • 视觉闭环创作:原生视觉理解打通代码截图优化回路,3D交互世界、游戏开发、前端与CAD设计即时可见、即刻优化,创意所想即所得。

  • 科研计算提效:打通科学文献与可执行代码,自主完成复杂计算研究流程的实现、验证与分析,把资深研究人员数周的工作压缩到小时级。

  • 自主芯片设计:基于开源EDA工具链,K3可连续数十小时自主完成芯片的构建、优化与验证,在国产算力上跑通“模型设计芯片”的完整流程。

  Kimi K3在海光DCU的极速适配,丰富了国产AI算力生态,让万亿级顶尖开源模型不再局限于海外算力平台。未来,海光将持续跟进前沿大模型迭代趋势,以高性能、高兼容、高安全可控的DCU底座,筑牢国产AI产业规模化、普惠化发展的算力根基。#海光信息