标签: vLLM
0
vLLM 0.28 一口气改了584次:新一代模型正在逼推理框架重写底层
2026年8月26日,vLLM 0.28.0 发布。单从版本号看,它像一次常规升级;翻开 release notes,规模却很不寻常:584 个提交、270 名贡献者,其中 76 名是首次参与。更值得关注的是这些提交集中在什么地方。K...
0
同一个27B模型,为什么在你电脑上像7B:量化、KV Cache和推理引擎正在偷偷改掉模型
同一个大模型在本地部署后为何表现明显变化?量化格式、KV Cache精度、Attention Backend、底层Kernel与推理框架共同决定模型的实际运行效果。