摘要

llama.cpp 发布了 b10068 版本。发布说明显示,此次更新涉及 DFlash 模型:在使用 K/V 量化时轮换注入的 K/V 缓存。

该版本提供 macOS(Apple Silicon、Intel)、iOS XCFramework,以及多个 Linux CPU、Vulkan 和 ROCm 构建包。

影响

使用 DFlash 与 K/V 量化配置的 llama.cpp 开发者可评估升级;其他用户可按自身平台选用对应的预构建包。

原始来源:GitHub Releases