2 分•作者: LozzKappa•2 个月前•原帖
我是一名机电一体化设计师,拥有控制系统、机器人技术、PCB设计和嵌入式硬件的背景。我设计物理系统:电机、传感器、微控制器和实时控制回路。 我将这种设计思维应用于大型语言模型(LLM)的内存管理——结果非常成功。 HotPin 是一组针对 llama.cpp 的补丁,可以在比其磁盘占用更少的 RAM 上运行 30B–120B 的专家混合(MoE)模型,并且输出与原始模型完全相同(无损)。 在 AMD Ryzen AI 9 HX 370(Zen5,AVX512)、23.6GB LPDDR5X、NVMe >1GB/s 的 CPU 环境下进行了测试。 结果如下: | 模型 | 磁盘 | 最小内存 | 节省 | 速度(tok/s) | |-------|------|---------|---------|-------| | gpt-oss:120b | 58.5GB | 19.1GB | -67% | 3.84 | | qwen3:30b-a3b | 18.0GB | 10.4GB | -42% | 19.7 | | gemma4:26b-a4b | 16.2GB | 10.6GB | -35% | 11.5 | | GLM-4.7-Flash | 19.0GB | 13.3GB | -30% | 12.4 | 输出与全内存运行的 SHA-256 位完全相同,已验证。 工作原理(在 llama.cpp 中约 50 行 C++ 代码): 1. 记录 MoE 专家路由频率。 2. 从磁盘映射整个模型。 3. 仅将最活跃的专家锁定到物理 RAM 中。 4. 使用 posix_fadvise / 预取冷专家到 NVMe 中,确保在需要之前加载。 边界条件:如果磁盘 > RAM,锁定可以带来 +45% 的速度提升(gpt-oss: 2.64 → 3.84 tok/s)。如果模型可以完全放入 RAM,锁定则不会增加任何开销。 在以下环境中进行了测试:Linux 原生、WSL、Windows 原生(VirtualLock)。 代码库地址:https://github.com/LozzKappa/hotpin-llm 论文(PDF + LaTeX)在代码库中,arXiv 提交正在等待 cs.LG 的认可。 我正在寻找: 1. 一位 arXiv 认可者(cs.LG)——如果您是一名研究人员,对这项工作感兴趣,请与我联系。 2. 希望从任何在其硬件上测试此技术的人那里获得反馈。 该技术简单、无损,并且今天就能使用。请测试并告诉我您的基准结果。 感谢您的阅读。
2 分•作者: Log007•2 个月前•原帖
在全球多个国家生活并远程工作后,我发现最佳的工作文化是异步工作文化。异步工作文化是一种模型,团队成员可以在各自的时间表上进行协作和完成任务,而无需同时在线或即时回复。这意味着员工可以在任何时间和地点工作,以实现最大的生产力。通常,成功实施异步沟通的公司,其团队成员遍布全球。 我创建了一个专门汇总这类工作的招聘网站,因为我坚信异步沟通将在未来成为许多职位的标准。您可以在这里查看该网站:<a href="https:&#x2F;&#x2F;workingasync.io" rel="nofollow">https:&#x2F;&#x2F;workingasync.io</a> 目前网站上列出了超过400个职位(包括来自DuckDuckGo、GitLab和Docker等公司的职位)。我计划在接下来的几周内添加新功能,并定期更新博客。 欢迎反馈!
5 分•作者: mavsman•2 个月前•原帖
也许这个问题有些愚蠢,但我觉得在我的职业生涯中,我从未经历过如此多的等待时间,因此我更容易打开 YouTube、HN 等网站,尽管我并不真的想这样做。 最可能的答案就是坐下来什么都不做。但是,你有没有找到一种方法,让主动编码等活动对你有效,而不被分散注意力和注意力缺陷所影响?