分类: 技术观察

0

CUDA Python 1.0 到底解决了什么:Python 正在从“调用 GPU 库”变成 CUDA 的一等公民

Python 早就是 AI 和科学计算的主语言,但长期以来,它和 GPU 的关系有一个明显断层。大多数开发者通过 PyTorch、CuPy、RAPIDS 等高层库使用 GPU,只有当这些库暴露的能力不够时,才不得不跳到 CUDA C++、编译扩展、维护绑定和处理复杂构建链。结果是 Python GPU 生态很繁荣,底层却长期由许多不同 binding layer 拼接而成:每个库都有自己的 st

0

运营 23 年、240 万行 Python 代码,EVE Online 为什么现在才开始迁移 Python 3?

如果要找一个“技术债并不等于烂代码”的案例,EVE Online 很合适。这个大型多人在线游戏从 2003 年上线起就重度使用 Stackless Python,2010 年升级到 Python 2.7,此后整整 16 年没有再切换 Python 主版本。Python 2.7 在 2020 年已经结束官方支持,EVE 却继续稳定运行;直到 2026 年 8 月,开发团队才正式宣布启动 Pytho

0

加密的“隐藏推理”为什么还能被别的模型读出来:一次 LLM API 安全研究暴露了会话日志的新风险

2026 年 8 月,一篇题为《Stealing Reasoning Traces from Proprietary LLM APIs》的研究论文引起了 AI 安全社区关注。研究者测试了多家前沿模型 API 在处理隐藏推理状态时的行为,发现一些服务为了保持 API 无状态,会把模型内部推理以加密块的形式返回给客户端,后续请求再由客户端原样送回。研究指出,这些加密块在部分模型生态中可以跨会话、跨用

0

大模型服务崩一次为什么要几分钟才能回来:NVIDIA“影子引擎”把 283 秒恢复压到 7.3 秒

大模型线上服务的可靠性问题,过去很容易被“多部署几个副本”掩盖。真正到了大规模推理集群,副本并不能消除故障成本:一个 worker 进程崩溃以后,剩余 worker 要立刻承接流量,首 Token 延迟升高,单用户生成速度下降;如果模型有数百 GB 权重,还要重新从存储加载、建立通信器、完成编译和 autotune、重新捕获 CUDA Graph,冷启动可能持续几分钟。对于面向 Coding A

0

OpenAI 自研推理芯片 Jalapeño:当大模型公司开始自己设计硅片,GPU 的护城河会松动吗?

2026 年 8 月 25 日,SemiAnalysis 公布了对 OpenAI 首款自研推理芯片 Jalapeño 的现场测试和架构分析。两个月前,OpenAI 与 Broadcom 已经正式宣布这款芯片,并明确把它定位为面向大语言模型推理的专用加速器。官方当时给出的信息相对克制:Jalapeño 从零开始设计,重点优化模型推理中的计算、内存移动、网络和服务调度,工程样片已经能够以目标频率和功