返回首页

24小时热榜

89作者: gitpusher42大约 9 小时前原帖
嗨,HN, 我为任何M系列Mac构建了一个专门的推理引擎,可以在大约2GB的RAM上运行4位Gemma 4 26B-A4B-IT。这个引擎叫做TurboFieldfare,使用Swift和Metal编写。 我一直很喜欢设备上的人工智能。能够在你的Mac或iPhone上运行强大的神经网络,感觉就像魔法一样。因此,我想挑战一下极限,尝试运行一个权重无法完全放入内存的模型。 该模型的4位量化权重大约占用14GB,这使得在包括操作系统、应用程序和KV缓存后,在8GB甚至16GB的Mac上使用传统推理工具几乎不可能。 解决方案是将模型的共享部分和KV缓存保留在RAM中,然后仅从SSD流式传输每个token所需的路由专家。SSD的速度远低于RAM,因此运行时使用一个小的专家缓存和有限的并行`pread`。在这些读取进行时,GPU会运行层的共享部分。 我进行了超过100次实验。大多数实验没有成功,只有少数几个让我走到了这里。这些实验的详细信息可以在GitHub仓库中找到。 目前,它在8GB的M2 MacBook Air上生成5-6个token,在M5 MacBook Pro上生成31-35个token。 我还添加了一个实验性的OpenAI兼容本地服务器。它支持流式传输和工具调用,并重用KV缓存中的一个提示前缀。 试试吧!这个Mac应用程序很容易安装。在第一次运行时,它会从Hugging Face下载15GB的权重。这个模型的能力令人惊讶。 我非常期待任何反馈!