16 分•作者: HenryNdubuaku•3 个月前•原帖
嗨,HN,Henry 和 Roman 来自 Cactus。 一个小型的设备端模型快速且私密,但有时会出错,而前沿模型的成本正在迅速上升。因此,我们对 Gemma 4 E2B 进行了后期训练,使其能够识别何时出错。每个响应都会附带一个介于 0 到 1 之间的置信度分数。当置信度高时,开发者可以选择使用设备端模型;当置信度低时,则可以切换到更强大的云模型。通过将仅 15-35% 的查询路由到 Gemini 3.1 Flash-Lite,Gemma-4-E2B 在大多数基准测试中与 Gemini 3.1 Flash-Lite 的表现相当。 - ChartQA: 15-20% - LibriSpeech: 25-30% - MMBench, GigaSpeech, MMAU: 30-35% - MMLU-Pro: 45-55% 我们一直对混合应用依赖的路由信号感到沮丧:要求模型用文本自我评分(不可靠,而且需要解析文本),或者使用标记熵启发式(在我们的测试中几乎与抛硬币一样好)。因此,我们对小型模型,特别是 Gemma 4 进行了机械研究,发现不同层的隐藏状态在各种情况下携带有意义的自我意识信号。 因此,我们扩展了模型,增加了一个 68k 参数的探测层(LayerNorm、低秩投影、注意力池化、小型 MLP 头),在解码过程中读取一个中间层并预测 p(wrong);置信度 = 1 - p(wrong),以结构化数据返回,而不是从答案文本中解析出来。 在涵盖文本、视觉和音频的 12 个保留基准测试中,该探测器的平均 AUROC 为 0.814,而标记熵的 AUROC 为 0.549。让我们相信这一点的结果是:该探测器在零音频数据上训练,但在四个音频基准测试中得分为 0.79-0.88 AUROC,而熵接近随机或更差(0.32-0.52)。它从隐藏状态中读取了一种与模态无关的正确性信号,而不是记忆训练数据中的模式。 我们在 HuggingFace 上发布了所有权重,并提供了在 Transformers、MLX、Llama.cpp 或 Cactus 上运行的复制粘贴代码。Ollama、vLLM、SGLang 等也在开发中。对于 llama.cpp,我们提供了一系列补丁,您只需编译一次(计划进行上游更新)。代码采用 MIT 许可证;Gemma 模型的使用仍需遵循 Gemma 条款。 GitHub: [https://github.com/cactus-compute/cactus-hybrid](https://github.com/cactus-compute/cactus-hybrid) 权重: [https://huggingface.co/collections/Cactus-Compute/cactus-hybrid-6a60da4551074db058e8bb64](https://huggingface.co/collections/Cactus-Compute/cactus-hybrid-6a60da4551074db058e8bb64) 一些注意事项: - 该探测器仅对单序列解码进行评分,最多支持前 1024 个生成的标记。 - 在多步骤过程中按任务路由时,切换效果最佳,而不是按步骤进行。 - 分层路由仍在开发中:先尝试设备端,然后是 DeepSeek v4 Flash,再到 Fable/GPT5.5/Gemini/Muse/Grok。 - 该技术针对每个模型都是定制的,我们会在每次发布时分享权重。 这些问题目前正在 Cactus 进行处理,更新的权重将直接发布到 HuggingFace 集合和 GitHub 仓库。请告诉我们您的想法,这有助于我们逐步改进设计。 非常感谢!