12 分•作者: HenryNdubuaku•大约 2 个月前•原帖
大家好,<p>我是来自Cactus的Henry!<p>我们之前发布了Cactus Needle,这是一款14MB的代理型大语言模型(LLM),用于工具调用、设备使用和结构化提取,适用于手机、可穿戴设备、智能家居、小型机器人和微控制器。我们收到了非常好的反馈,并根据建议发布了Needle 2。<p>整个模型是一个14MB的单一二进制文件,运行一个完整会话需要28MB的RAM;参数量为4500万,采用2位压缩。Needle在Raspberry Pi 5上达到每秒500个令牌的解码速度,在Meta Quest 3S和Apple Vision Pro等VR设备上介于每秒400到1500个令牌之间,在售价低于200美元的手机(如三星A系列)上则在每秒300到700个令牌之间。<p>在工具调用和移动设备使用的基准测试中,Needle 2与LFM2.5 230M和Apple Foundation Model等最接近的小型模型交替获胜,后者的体积是Needle 2的5到70倍,均采用f16,而Needle 2使用的是2位压缩。Needle基于我们论文中的简单注意力网络(Simple Attention Networks)(<a href="https://arxiv.org/abs/2607.18363" rel="nofollow">https://arxiv.org/abs/2607.18363</a>)。<p>边缘人工智能(Edge AI)最近主要指的是Mac和PC,但这仅占全球超过210亿个连接物联网设备中的15亿,而在新兴市场,大多数手机的售价低于200美元,且没有NPU,使用廉价GPU。这些设备包括预算手机、Raspberry Pi、微控制器、可穿戴设备、小型机器人(如Reachy Mini)和连接家居设备。<p>一款与Needle相同宽度和深度的传统变换器(transformer)每处理一个令牌需要消耗164 MFLOPs,即使是压缩到Needle参数数量的变换器也需要87,而Needle仅需70。即使在高端手机上,始终在线的助手也必须在功耗预算内运行;每个MFLOP都代表毫瓦时,而Needle每处理一个令牌所消耗的功耗比最小的高性能LLM少7到85倍。有关架构的更多信息,请查看链接。<p>当我们将智能结构化为具有类型参数的函数时,唯一困难的部分是将混乱的句子映射到这些函数上;使用哪个函数,传入哪些值。我们的研究发现,当以这种方式框定问题时,不需要任何世界知识和开放式散文,这就是为什么4500万参数足够的原因。<p>Needle 2扩展到结构化提取,允许在工具位置传递模式,模型返回结构化输出。您可以将Needle用作具有枚举字段的文本分类模型,或通过提供提取关键字段的模式来作为摘要模型,除了自由解码之外的所有功能。<p>每个产品都有其自己的工具词汇,微调Needle可以帮助其在自定义任务上实现前沿水平的性能,因此使用Python包(<a href="https://github.com/cactus-compute/needle" rel="nofollow">https://github.com/cactus-compute/needle</a>),可以在Mac或PC上在几分钟到几小时内完成Needle的微调,配合自动化数据生成管道,只需传递几个样本。<p>尽管如此,每个响应都带有基于我们Cactus Hybrid技术的学习置信度评分。如果高于您的阈值,则采取行动;如果低于阈值,则升级到云或更大的模型。将Needle 2与私有的DeepSeek-v4-Flash部署结合使用,特别适合企业级任务,几乎没有成本,我们可以协助进行此设置。<p>我们对Needle 2进行了大量思考,但可能仍然缺少很多内容,请使用提供的链接中的游乐场测试Needle并分享您的想法,我们始终非常感激!