dev.to | 📄 原文链接 | 2026-09-15 收录

我在黑客松评审工具里找到两个 Bug,但都不能解释我为什么落选

来源:dev.to — 2026-09-14

📋 概述

作者为 Africa Deep Tech Challenge 2026 做了 StacksNG:一个离线编码助手,用四个尼日利亚金融科技 API(Paystack、Flutterwave、Monnify、Termii)的文档做检索增强,780 个文档分片全部在设备上经 llama.cpp 运行,不联网、无密钥、不编造接口。他没进半决赛,也没有任何反馈,于是自己去查。他发现自己的 submission.json 里 accuracy 字段是一个空数组——占评分公式 50% 的分数被静默地记成零。想补齐这项指标时又撞上两个 Bug:评审工具把 base_url 写成 local 而不是合法 URL;lm-eval-harness 的 GGUF 后端仍期待旧的 echo 行为,而现行 llama-server 只对新生成的 token 返回 logprobs。

🔑 核心要点

💡 金句

我选择了正确性而不是评分公式,并且在报告里写明了理由——结果证明我防守错了地方。
← 返回 dev.to 首页