从CUDA到MLX:K-Search将数十年内核经验带到苹果芯片

📡 BAIR Blog (Berkeley AI Research)2026-07-29 17:00

K-Search项目将CUDA内核优化经验迁移到苹果芯片的MLX框架,实现高效计算。

AI 深度解读

CUDA积累了数十年的GPU内核优化经验,但新硬件如苹果芯片缺乏这些积累。本文介绍如何通过K-Search框架自动将CUDA内核知识迁移到MLX,实现接近专家水平的性能。

  • K-Search是一个基于进化搜索的GPU内核优化框架,利用AI自动生成高效内核。
  • 研究团队将其扩展到苹果的MLX框架,开发了结构化的CUDA到MLX翻译层,自动适配优化策略。
  • 翻译后的注意力内核性能达到原生MLX Attention内核的0.97倍,Mamba SSM内核预填速度比社区实现快20倍。
  • 核心价值在于避免从头重新发现优化,而是迁移已验证的CUDA经验。
  • 随着硬件多样性增加,自动知识迁移将加速新平台AI性能。
  • 影响/看点:跨平台内核知识迁移方法有望降低新硬件的开发门槛,让苹果芯片等新兴架构更快获得高效AI内核。

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com