Allan R. Bo 介绍了自己被 Jev 与 OpenJev、SemIf 这类自托管项目引出的一个小技巧:读模型的 token 概率。做法是把问题写成"状态 + 问题 + 带字母的选项",在兼容 Chat Completions 的请求里加上 max_completion_tokens: 1、logprobs: true 与 top_logprobs: 20,模型就只吐一个字母以及各选项的对数概率,既短又快,而且由于前缀相同还能被 KV 缓存复用。他认为最有趣的地方是这套方法对视觉模型同样成立:他自己加了 attachments 字段传图片,用 OpenCV 抓摄像头帧、发 base64 JPEG、输出一张表回答"画面里有人吗、室内还是室外、亮度如何",在 RTX 3090 上跑 Gemma 4 12B 大约每秒 1 帧(每帧三个问题),换成 OpenAI 的 gpt-6-luna 大约 0.2 帧每秒。他承认专用视觉模型效率更高,但喜欢这里的灵活性——改一个判断条件只需要改一句自然语言描述。