我向四个主流人工智能咨询了一个基本的消费者使用案例问题,令我感到不同风格的回答颇具启发性。
前提:一台悬挂不牢的干衣机在运转时从墙上猛然脱落,撞上了下面的洗衣机,并试图以一种让人联想到斯蒂芬·金的鬼魂洗衣店故事《磨刀石》的方式冲出洗衣房门。
在清理完所有的玻璃碎片、墙壁灰泥等后,那台六个月大的洗衣机却无法正常工作——这并不令人意外,但问题出在电子系统,而非机械部分。显示屏闪烁着空白,没有错误代码等。在尝试了所有显而易见的解决办法后,我把这个难题提交给了四个人工智能:Chat GPT、Perplexity、Claude(专业版)和谷歌搜索的人工智能模式。
它们都建议了或多或少相同的检查点,然后推荐找技术人员,但各自的个性和想法却大相径庭。
Chat GPT:表现得很有同情心,恭维地说:“你把洗衣事故变成了一个量子学习的练习……这是一个措辞得体、直截了当的问题描述,可以给你的技术人员或西屋公司展示……你应该感到自豪……”
Perplexity:像最糟糕的老师一样训斥,基本上说:“机器损坏是因为你造成的情况。即使在保修期内,blah blah。”你查阅过洗衣机手册吗?我可以帮你找到它。(是的,我查过手册,但我并没有问Perplexity关于保修维修的事。)
谷歌人工智能模式:迅速转向“新洗衣机”的话题。例如:“你最喜欢西屋的哪一点?你想要另一台前置式洗衣机,还是考虑到你与干衣机的创伤经历,你更喜欢一体式洗衣机和干衣机?附带大量的推荐链接。”
Claude:明确指出这是电子方面的问题——例如:连接带故障、焊点开裂等等。如果你觉得可以,并且有序列号,我可以提供拆解说明等等。
我其实对这个想法很感兴趣,也喜欢Claude愿意和我一起探讨这个问题,但由于我也有截止日期,堆积如山的臭衣物在旁,我最终还是选择了人类直觉(H.I.)。
凭直觉——而这在洗衣机手册中并没有提到——我长按了开关,洗衣机复活了——没有拆解,没有新机器,也没有为西屋公司撰写优雅的简报,更没有从他们那里寻求帮助的阴暗尝试。
返回首页
最新
我创建 OpenParser 是因为我希望能在一个实际可用的端点上使用 PaddleOCR-VL-1.6。现在已经开源了 CLI 和 TypeScript/Python SDK:
```
npm install -g @openparser/cli
openparser auth login
openparser parse sync document.pdf
```
就是这么简单。没有比这更容易和便宜的了。给它一个 PDF 文件,就能返回文本和文档结构。
代码库: [https://github.com/eigenpal/openparser](https://github.com/eigenpal/openparser)
我非常希望能收到任何愿意尝试 CLI 的人的反馈,告诉我还有哪些地方需要改进。
我在十多年前从Belkin购买了一个WiFi开关,但应用程序已经停止服务。<p>我想用这个开关来自动化我的驱蚊器。不幸的是,它仍然在运行圣诞节时设置的定时器,这意味着它关得太早了。这影响了我昨晚的睡眠。<p>早上第一件事我打开了应用程序,想要更改定时器。<p>但应用程序离线,我在网上看到它已经停用。现在这个开关基本上变成了垃圾。<p>起初我很生气,但随后我给我的AI助手下了一个指令:<p>“在我的本地网络中找到WiFi开关。应用程序已经结束生命周期。尝试连接到它,并将定时器设置为晚上10点开启,早上8点关闭。”<p>几分钟后,它告诉我已经完成。<p>我让它解释是如何做到的。<p>它在网络中找到了设备,并发现了一个开放协议,因此可以快速地开关设备。<p>它深入挖掘,找到了pywemo,这是一个开源库,允许它读取设备中保存的定时器。<p>它自己备份了现有的定时器。<p>然后,它使用这个库将新的定时器推送到设备。这意味着即使没有WiFi或我的电脑,开关也能独立工作。<p>我是一名程序员,我本来也可以做到这一点,但我认为我至少需要一天的时间来完成这一切。它在几分钟内就完成了。<p>我真的很高兴Belkin关闭了他们糟糕的应用程序。反正用户体验也不好。<p>现在我可以通过我的Hermes助手在Discord上与我的开关聊天。
嗨,HN,
我为任何M系列Mac构建了一个专门的推理引擎,可以在大约2GB的RAM上运行4位Gemma 4 26B-A4B-IT。这个引擎叫做TurboFieldfare,使用Swift和Metal编写。
我一直很喜欢设备上的人工智能。能够在你的Mac或iPhone上运行强大的神经网络,感觉就像魔法一样。因此,我想挑战一下极限,尝试运行一个权重无法完全放入内存的模型。
该模型的4位量化权重大约占用14GB,这使得在包括操作系统、应用程序和KV缓存后,在8GB甚至16GB的Mac上使用传统推理工具几乎不可能。
解决方案是将模型的共享部分和KV缓存保留在RAM中,然后仅从SSD流式传输每个token所需的路由专家。SSD的速度远低于RAM,因此运行时使用一个小的专家缓存和有限的并行`pread`。在这些读取进行时,GPU会运行层的共享部分。
我进行了超过100次实验。大多数实验没有成功,只有少数几个让我走到了这里。这些实验的详细信息可以在GitHub仓库中找到。
目前,它在8GB的M2 MacBook Air上生成5-6个token,在M5 MacBook Pro上生成31-35个token。
我还添加了一个实验性的OpenAI兼容本地服务器。它支持流式传输和工具调用,并重用KV缓存中的一个提示前缀。
试试吧!这个Mac应用程序很容易安装。在第一次运行时,它会从Hugging Face下载15GB的权重。这个模型的能力令人惊讶。
我非常期待任何反馈!
Claude的Opus 5是一个近期推出的模型,作为Opus 4.8的替代品存在很多问题,包括忽视我们详尽记录的部署流程(在我们的短文档claude.md和架构文件中有清晰描述),并在激活后立即导致生产环境崩溃。
目前,我添加了一个监控层,让Opus 4.8实例来监督Opus 5并进行纠正。这稍微有所帮助。我在考虑是否降级到Opus 4.8,但也想给Opus 5一个机会。
你认为这个模型会有所改善,还是会停留在目前的能力水平?
你可以看到其他人的投诉:
https://www.reddit.com/r/ClaudeAI/comments/1v92csh/opus_5_extremely_rlfried_and_mistakeprone_for/
“在我看来,Opus 5在任何任务上都真的不好。我在一个大型复杂项目中彻底尝试了它在所有可能角色下的表现,结果它在所有任务上都很糟糕。”
Claudebot对该讨论串的总结:
> 该讨论串的压倒性共识是,Opus 5是一个有很多bug、过于自信的混乱产物,对于复杂编码来说是Opus 4.8的显著退步。