dev.to | 📄 原文链接 | 2026-09-14 收录

本地大模型不需要 C++ 或 Python:用 .NET 10 做 15MB 的原生 AOT 推理引擎

来源:dev.to — 2026-09-13

📋 概述

作者认为高性能本地推理并非 C++ 运行时的专利。Glacier.Inference 是纯 C# 的 .NET 10 引擎,直接内存映射 GGUF 模型,在 NVIDIA、AMD、Intel 硬件上运行且不带任何外部 C++ 二进制。它绕开 CUDA 运行时层,通过 P/Invoke 直接调用 nvcuda.dll 派发内核,把整条工具链压成一个约 15MB 的单文件原生 AOT 可执行文件;为了不让每个 token 都把 608KB 的 logits 搬过 PCIe,它把最终投影与归约融合进 512 线程的 warp 洗牌内核,只回传 4 字节。

🔑 核心要点

💡 金句

与其每个 token 都在总线上搬 608KB,Glacier 只传输精确的 4 个字节——一个 int32 的 token ID。
← 返回 dev.to 首页