1 分•作者: kirito1337•大约 1 年前•原帖
你对内存损坏漏洞有什么看法?这是因为像C/C++这样的低级语言造成的吗,还是仅仅是技能问题?<p>我们真的应该转向Rust吗?<p>在我看来,我认为不需要。
1 分•作者: technoabsurdist•大约 1 年前•原帖
嘿,HN!我们正在构建一个机器学习推理的性能分析工具,它能够真实地展示硬件层面的运行情况,而无需手动解析火焰图或设置nsys和ncu。 问题:当前的机器学习性能分析工具要么输出过多的数据(如torch.profiler),要么抽象掉你需要的细节。你无法看到模型实际变慢的原因——是内存带宽问题?内核启动开销?缓存未命中? 我们的方案:我们正在对GPU执行进行逆向工程,从Python操作追踪到PTX指令。一个装饰器可以为你提供完整的执行图,并突出显示实际的瓶颈。 技术细节: - 跟踪Python → CUDA内核 → PTX,并提供时间分解 - 显示内存访问模式和带宽利用率 - 内核占用率和调度分析 - 支持PyTorch/JAX,TensorFlow即将推出 我们用这个工具优化了Llama推理,发现了之前看不到的瓶颈,获得了超过50%的速度提升: [https://www.herdora.com/blog/the-overlooked-gpu](https://www.herdora.com/blog/the-overlooked-gpu) 免费测试版,提供10小时的性能分析:[https://keysandcaches.com](https://keysandcaches.com) GitHub:[https://github.com/Herdora/kandc](https://github.com/Herdora/kandc) 文档:[https://www.keysandcaches.com/docs](https://www.keysandcaches.com/docs) 我们很好奇其他人遇到的推理瓶颈,而当前工具无法诊断的情况。你对现有性能分析工具的使用体验如何?听听社区的看法会非常有帮助 :)