Hacker News | 📄 原文链接 | 2026-09-27 收录

在本机跑开源决策模型:兼容 Jev 风格接口的 Ollaya

来源:ollaya.dev — 540 分 · by Ardakilic

📋 概述

Ollaya 把决策模型搬到本地:它下载并在你自己的机器上服务开源决策模型,对任意文本或 JSON 提问并返回带概率的答案。因为决策模型是一次前向传播而不是逐 token 生成,延迟极低——在 RTX 4090 上通过 HTTP API 问五个问题,Laya 约 8 到 10 毫秒端到端,而 TypeSafe 托管的 Jev API 在第三方基准中位数为 236 到 276 毫秒;本地模型梯队里 decider:0.8b 约 155 毫秒、decider:2b 约 190 毫秒。它刻意做到与 TypeSafe 的 API 兼容:服务 /v1/systemone 与 /v1/models 并沿用其请求响应结构,官方 Python SDK 0.7.1 可以不改代码直接指向本地服务器,只需设置 TYPESAFE_BASE_URL 等环境变量。示例输出展示了 agent 预设如何回答"该不该 force push"这类问题,并给出是否偏离任务、风险与破坏性的判断和置信度。

🔑 核心要点

💡 金句

在单次前向传播中给出答案,没有逐 token 生成。
← 返回 Hacker News 首页