slotstream 用 Swift + MLX 把 Qwen3.8-Flash-Next(125B 稀疏专家模型、4-bit 下 104GB)从 SSD 流式加载,让只有 16GB 内存的 Mac 也能跑起来,48GB 机型温暖解码约 12 token/s。它将大模型拆成专家缓存按需读取,磁盘成为门槛,内存反而可以很省。