标签: GPU编程

0

Triton 3.8 没有“大功能”,却暴露了 AI 算力工程最难的部分

Triton 3.8.0 的更新分散在前端类型、编译器后端、多 CTA、AMD CDNA 5、调试检测和自动调优等环节。单独看,每项改动都不像模型发布那样醒目;放在一起,却能看出 GPU 编程正在从“写出高性能内核”走向“跨硬件、可验证、可调试、可持续维护”。AI 基础设施的竞争已经深入编译器层,性能只是目标之一,数值一致性、并发正确性和多后端可移植性同样决定生产可用性。

0

CUDA Python 1.0 到底解决了什么:Python 正在从“调用 GPU 库”变成 CUDA 的一等公民

Python 早就是 AI 和科学计算的主语言,但长期以来,它和 GPU 的关系有一个明显断层。大多数开发者通过 PyTorch、CuPy、RAPIDS 等高层库使用 GPU,只有当这些库暴露的能力不够时,才不得不跳到 CUDA C++、编译扩展、维护绑定和处理复杂构建链。结果是 Python GPU 生态很繁荣,底层却长期由许多不同 binding layer 拼接而成:每个库都有自己的 st