Redis创始人发布ds4:本地运行超大MoE模型

Redis创始人antirez开源ds4,支持本地运行超大MoE模型。通过不对称2-bit量化与KV缓存磁盘化,让DeepSeek V4等模型在128GB内存设备上实现高效推理。

Redis 创始人 antirez 发布开源项目 ds4,这是一款面向高内存 Mac、CUDA 及 ROCm 设备的轻量级 C 语言本地推理引擎。该工具支持在本地运行 DeepSeek V4/V4.1 Flash、GLM 5.x 以及 Qwen3.8 Flash Next 等模型,涵盖文本与视觉任务,并提供 API、CLI 及本地代理接口。

不对称量化使超大MoE模型适配本地硬件

核心架构:从云端到本地的逆向约束

ds4 的设计初衷是应对大模型本地化部署的挑战。以拥有 2840 亿参数的 DeepSeek V4 Flash 为例,传统路径依赖远程服务,而 ds4 则从相反的方向——即硬件约束出发进行优化。

通过不对称量化技术,ds4 对路由专家(Routing Experts)进行压缩,同时保持关键共享路径的精度。这种“崩塌”式的压缩策略使得超大参数量的 MoE(混合专家)模型能够在具备高内存配置的机器上实用化运行。

最终,这一本地引擎整合了 CLI、HTTP API 和本地代理三种接口,它们共享同一套模型状态和缓存机制。

关键技术特性

  • 不对称 2-bit 量化:仅压缩路由专家部分,确保核心路径精确度,使大型 MoE 模型适配目标硬件。
  • KV 缓存磁盘化:长上下文的前缀数据保存至 SSD,并通过提示哈希恢复。重启时无需完全重新预填充,显著提升效率。
  • 多模态输入:支持视觉输入。
  • 其他优化:包括 SSD 流式传输、张量并行、会话分组以及 DSPARK + MTP 技术。

快速上手指南

用户可通过以下命令克隆仓库并下载模型:

$ git clone https://github.com/antirez/ds4
$ cd ds4 && ./download_model.sh ds4f-q2

编译项目:

$ make
$ make cuda-spark

启动聊天或本地服务器:

$ ./ds4
$ ./ds4-server --ctx 100000

性能基准测试

根据官方基准表,DeepSeek V4 Flash Q2 为基线配置。在 128GB 内存设备上,GLM 5.3 Q2 和 Qwen Q4 也能顺利运行;V4.1 Q2 则可通过 SSD 流式加载。以下是特定硬件下的性能数据:

设备型号 上下文长度 预填充速度 (t/s) 生成速度 (t/s)
M5 Max, 128GB Q2 · 2,048 790.2 39.4
M5 Max, 128GB Q2 · 65,536 398.5 27.6
DGX Spark, 128GB Q2 · 2,048 825.8 18.1
DGX Spark, 128GB Q2 · 65,536 823.0 13.8

参考数据显示,在 M5 Max 128GB 设备、32K 上下文环境下,生成速度可达 34.4 t/s,预填充速度为 557 t/s。

生态集成

ds4 提供标准的 OpenAI 兼容接口端点,包括 /v1/chat/completions、/v1/messages 和 /v1/responses。这使得开发者可以将编辑器、智能体或 API 客户端直接连接至本地运行的 AI 推理服务,实现私有化的本地 AI 部署。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读