AI编译器 —— 笔记
challenge 新模型 新module出现,需要对应算子进行计算,还需要结合硬件进行特性优化和测试,尽量充分发挥硬件性能 硬件厂商还会发布新技术的加速计算库 专用加速芯片爆发导致性能可移植性成为一种刚需 不同厂商的ISA不尽相同 一般缺乏如GCC、LLVM等编译工具链,使得针对CPU和GPU已有的优化算子库和针对语言的优化Pass很难短期移植到NPU上 架构 和传统编译器对比 在编译优化层通过统一IR执行不同的Pass进行优化,从而提高执行性能 软件结构栈:分成前端、优化、后端三段式,IR解耦前端和后端使得模块化表示 AI编译器对Graph IR进行优化后,将优化后的IR转换成传统编译器IR,最后依赖传统编译器进行机器码生成 左边是旧编译器架构,右边是ai编译器架构 ...