本地大模型不需要 C++ 或 Python:用 .NET 10 做 15MB 的原生 AOT 推理引擎
来源:dev.to — 2026-09-13
📋 概述
作者认为高性能本地推理并非 C++ 运行时的专利。Glacier.Inference 是纯 C# 的 .NET 10 引擎,直接内存映射 GGUF 模型,在 NVIDIA、AMD、Intel 硬件上运行且不带任何外部 C++ 二进制。它绕开 CUDA 运行时层,通过 P/Invoke 直接调用 nvcuda.dll 派发内核,把整条工具链压成一个约 15MB 的单文件原生 AOT 可执行文件;为了不让每个 token 都把 608KB 的 logits 搬过 PCIe,它把最终投影与归约融合进 512 线程的 warp 洗牌内核,只回传 4 字节。
🔑 核心要点
- 纯 C# 直接内存映射 GGUF,不依赖 cudart64.dll、cublas64.dll 等外部二进制。
- 直接 P/Invoke 调用 nvcuda.dll 派发内核,绕过 CUDA 运行时层。
- 约 15MB 的单文件原生 AOT 程序,替代约 4.5GB 的工具链。
- 常规定义下每个 token 要搬约 608KB logits,融合归约后只传 4 个字节。
- 归约延迟降到约 3.2 微秒,避免 PCIe 往返带来的微停顿。
💡 金句
与其每个 token 都在总线上搬 608KB,Glacier 只传输精确的 4 个字节——一个 int32 的 token ID。
👍 0
👎 0
← 返回 dev.to 首页