在计算领域,我们正迎来一个新时代。硬件正在迅速变化——不仅速度更快,而且来自不同厂商的各种芯片,每种芯片都有其独特的架构,通常针对特定的AI工作负载进行了优化。软件的变化同样迅速,现在AI编码工具可以在几分钟内生成几个月前需要数月努力才能完成的东西。
随着计算越来越集中在AI上,GPU内核成为了其成功的关键组件。这些是运行在GPU内部的低级程序,编写高效的 ones 远非显而易见——这需要多年的专业知识才能做好。将内核从一个厂商的硬件转移到另一个厂商的硬件要困难得多,通常意味着从头开始重新发现相同的优化。例如,CUDA生态系统已经积累了数十年的内核专业知识:手工调整实现的注意力、状态空间模型和其他关键操作代表了数千小时的工程努力。较新的硬件生态系统(苹果硅、定制AI加速器等)正在迅速发展,但缺乏这种深度。
在这项工作中,我们询问是否可以将这些专业知识自动转移。我们在Berkeley Sky Lab的Cao等人介绍的进化内核搜索框架K-Search的基础上进行了扩展,并增加了...
推荐意见