# 模型与专家数据(不入库,请本机下载/生成) ## 为什么要做 目标不是「把 80B 常驻塞进 64G」,而是用本机 **64G 统一内存** 做压力验证:把约 **77G 专家权重** 以流式专家池压到约 **33G 常驻**,在 8bit 下跑通 Qwen3-Next-80B-A3B。 验证点对应下游的 **黄金拐点**:Qwen3 **30B 8bit A3B** 一类模型,用同一套流式装载思路,能放进 **32G / 16G** 统一内存机器,相对「整模进内存」可 **节省 50% 以上统一内存**。本仓库的 80B @ 64G 是这条路径的上限探针;量产形态落在更小机型上的 30B 拐点模型。 --- ## 运行依赖版本 权重本身不绑版本,但本仓库预编译扩展与锁文件对齐如下(换版本可能无法 `import native_moe_ext` 或加载 8bit): | 项 | 要求 / 已验证 | |----|----------------| | Python | **3.14.***(已验证 3.14.6;须匹配 `native_moe_ext.cpython-314-darwin.so`) | | mlx | `>=0.31`(锁文件 **0.31.2**) | | mlx-lm | `>=0.31`(锁文件 **0.31.3**) | | numpy | `>=2.0`(锁文件 **2.4.6**) | | fastapi | `>=0.115`(锁文件 **0.140.0**) | | uvicorn | `>=0.30`(锁文件 **0.51.0**) | | textual | `>=0.80`(锁文件 **8.2.8**) | 安装:在仓库根目录 `uv sync`(或使用已有 `.venv`)。完整约束见根目录 `pyproject.toml` / `uv.lock`。换 Python 小版本需 `make -C native/ext native_moe_ext` 重编 `.so`。 权重体积约 **160GB**,不进 Git。按下面准备后目录应类似: ``` models/ ├── Qwen3-Next-80B-A3B-Instruct-MLX-8bit/ # ~79GB 主模型 ├── experts_8bit_g64/ # ~77GB 专家 blob(运行时常驻约 33G) └── qn_mtp_weights.safetensors # ~3.1GB MTP ``` ## 下载(NAS) 全部模型与专家数据从 NAS 共享下载: - 链接:https://ug.link/dxp4800plus-8761/filemgr/share-download/?id=86b004b90f4a477e84c7f65c87943b2f - 密码:`sparkle` 解压/放置到本仓库 `models/` 下,目录结构与上文一致即可。 > 说明:本仓库当前跑通的是 **80B** 探针;包内若含 **Qwen3-30B-A3B-Instruct-2507-MLX-8bit**,供下游 16G/32G 机型对照,不替代本机 80B 数据准备。 ## 可选 `prefix_snapshots/` 会在首次跑通后自动生成,可不预置。