Hacker News | 📄 原文链接 | 2026-09-27 收录

一个函数搞定多种模型:给 LLM 加图像输入的 Jev 式封装

来源:allanrbo.blogspot.com — 115 分 · by allanrbo

📋 概述

Allan R. Bo 介绍了自己被 Jev 与 OpenJev、SemIf 这类自托管项目引出的一个小技巧:读模型的 token 概率。做法是把问题写成"状态 + 问题 + 带字母的选项",在兼容 Chat Completions 的请求里加上 max_completion_tokens: 1、logprobs: true 与 top_logprobs: 20,模型就只吐一个字母以及各选项的对数概率,既短又快,而且由于前缀相同还能被 KV 缓存复用。他认为最有趣的地方是这套方法对视觉模型同样成立:他自己加了 attachments 字段传图片,用 OpenCV 抓摄像头帧、发 base64 JPEG、输出一张表回答"画面里有人吗、室内还是室外、亮度如何",在 RTX 3090 上跑 Gemma 4 12B 大约每秒 1 帧(每帧三个问题),换成 OpenAI 的 gpt-6-luna 大约 0.2 帧每秒。他承认专用视觉模型效率更高,但喜欢这里的灵活性——改一个判断条件只需要改一句自然语言描述。

🔑 核心要点

💡 金句

最好玩的地方在于:这个技巧对视觉模型同样管用。
← 返回 Hacker News 首页