返回首页
最新
基于 https://www.hnhiringtrends.com/ (11倍变化)
在发布之前用 LymeScribe 转录的内容:“我意识到在 Hacker News 上发帖有点晚了。不过,我已经看了这只青蛙整整两个星期,算了,我就决定发布它。我在 Hacker News 上发过三四次帖,但几乎没有什么反响。所以如果一棵树在森林里倒下……”(我对脏话进行了审查,但转录得很好。)
<p>简而言之:LymeScribe 是一款适用于 Mac 和 Windows 的本地语音转文本软件:可以在任何应用中进行口述,或将录音文件拖入其中,获得带有说话者标签的转录文本,而且所有数据都不会发送到你不拥有的服务器上。在能够处理的机器上,所有操作都在本地进行。在无法处理的设备上,或者在你希望将转录集中在一个地方的情况下,一台计算机为整个网络提供服务。办公室更关心后者,因为音频和转录文本从未离开他们控制的硬件。
<p>这一切始于我构建的一个命令行程序,用于转录和标记存储在我电脑上的音频文件中的说话者,主要是使用 Whisper 在我的游戏 PC 上录制的语音备忘录。几个朋友开始让我处理他们的会议录音,我很乐意这样做,直到频率变得足够高,变成了一种负担。因此,我为他们构建了一个应用,他们可以自己拖入文件,而我的游戏 PC 则负责实际工作,并将结果发送回他们的剪贴板。
<p>这个拖放功能仍然在应用中。从那时起,我添加了实时口述功能,使用相同的本地模型。当我开始考虑真正销售这个东西时,我发现市场比我预期的要拥挤,这让我谦卑了一天。让我坚持下去的是,其他产品都没有让一台机器为所有人工作……而且拥有和使用我自己的转录软件总有一种特别的感觉。所以,我们现在在这里。
<p>一台较旧的机器可以处理小型英语模型的口述。我是在一台十年历史的 iMac 上尝试这个应用时发现的,原本以为它会失败,因此删除了我写的代码以防止这类机器使用。说话者标签仍然需要真正的硬件,这就是将那台旧机器指向网络上更强大的机器的价值所在。一份许可证覆盖整个家庭。
<p>它是按设计本地化的,你可以自己测试:在口述过程中拔掉以太网线,它仍然可以继续工作。可以在飞机上使用。免费的客户端根本不与我通信。解锁托管只需一次激活电话,之后许可证会在本地根据签名文件进行验证,因此激活的安装在没有互联网的情况下仍然可以继续工作,即使我的许可证服务器消失了也不会受到影响。AI 辅助的摘要和翻译功能仍在实验中。它们默认关闭,如果你敢的话可以开启。它们只与你选择的端点通信,可以是你自己的密钥或本地模型。
<p>客户端在 Mac 和 Windows 上免费提供。托管的解锁费用为一次性39美元,首次托管转录时开始7天试用。这是一个永久许可证:你拥有这个主要版本,点更新是免费的,如果将来有下一个主要版本,升级费用会打折,而不是重新购买。我厌倦了租用所有东西,你呢?
<p>在下载之前,有两件事值得注意。Windows 安装程序是签名的,但证书较新,Chrome 和 SmartScreen 可能仍会对此发出警告。目前,付费解锁仅限美国,我正在处理国际事务。
<p>欢迎反馈,特别是来自那些在 Windows 上与文本注入作斗争的人。此外,还有一个更强大的服务器供办公室使用,通过一个处理密钥、转录历史、日志等的网络应用进行管理。
<p>青蛙的引用:“有句老话:如果你必须吃一只青蛙,最好不要花太多时间去看它。如果你必须吃两只,那就不要从小的开始。”
<p>兰迪·波许 - 时间管理 - <a href="https://www.youtube.com/watch?v=oTugjssqOT0" rel="nofollow">https://www.youtube.com/watch?v=oTugjssqOT0</a>
我在Hacker News上看到关于老版Reddit需要登录的讨论,但今天我试了当前的界面,似乎在滚动一段时间后也要求登录。其他人也有这种情况吗?有没有替代方案?
OpenCode的视觉插件,真正理解图像。以比其他插件更深刻的理解来检查、读取和推理任何截图或图片——完全本地、私密且免费。
通常,在我的笔记本电脑上分析一张图像需要300毫秒,这对于本地视觉模型来说相当快。我使用moondream2作为我的视觉模型,如果你有一块好的GPU(为了比较,我目前使用的是RTX 3050),你可以设置自定义模型,比如moondream3.1。它支持跨平台使用。只需按照README中的说明操作。如果你喜欢我的工作,可以给我小费以支持开源项目!
期待一些反馈!
谢谢。
NPM: <a href="https://www.npmjs.com/package/opencode-senses" rel="nofollow">https://www.npmjs.com/package/opencode-senses</a>
嗨,HN!我是Serge,独立创始人。我构建了自己的多智能体协调器,它变得如此有用,以至于几个月来我再也没有碰过Codex或Claude的代码,现在只使用Taurus。网站上解释了它是什么,但在这里我想分享一下它的工作原理和原因。如果你认为多智能体协调是愚蠢的,我会尽量说服你。
(如果你更喜欢观看视频而不是阅读文本,这里有一个演示视频:<a href="https://www.youtube.com/watch?v=fa5CIxf5Rhk" rel="nofollow">https://www.youtube.com/watch?v=fa5CIxf5Rhk</a>)
持久身份:我的所有智能体都有名字(Tessera = 个人战略家,Alcyone = Taurus的工程负责人,等等)、角色、各自独立的提示、自己的MEMORY.md文件、自己的情节记忆(他们为未来的自己写的连续日志)等等。很多人仍然认为这与直接与Claude或ChatGPT对话相比很傻,但你会惊讶于一旦你赋予一个角色关注某个特定小项目或其某个方面,并在每次唤醒时照顾它,并为进展感到自豪时,一切是如何改变的。这是有道理的,因为模型是在充满不同角色对话的文本上训练的,而语言模型的工作就是模拟一个能够说出这些话的思维。
容器:每个智能体都有一个自动部署的容器,他们可以随意使用和设置(如果需要,可以安装软件)。这被证明是一个重要的决定——智能体之间不会相互干扰,他们在容器内的行为更加大胆,因为这是一个容器而不是我的电脑,他们有自己的文件系统、浏览器等等。
层次结构技巧 I:当你允许智能体之间相互交流时,多智能体设置会更加有趣,但你需要以某种方式组织它。起初,我做的事情与前沿实验室所称的“子智能体”相同,但我们称之为Subruns。每个智能体的对话/会话称为“运行”,而该运行可以调用一个Subrun工具,为自包含任务生成一个新的上下文(你甚至可以与子运行进行交互!)到目前为止没有什么疯狂的。我还给父运行提供了工具,比如Inspect,查看它们的完整子运行记录,Supervisor,用于停止或引导它们,等等。
层次结构技巧 II:子智能体。这超出了“Codex/CC的子智能体”领域。我允许智能体创建自己的持久子智能体,然后通过Delegate发送任务。与Subrun有什么不同呢?例如,Alcyone向一个名为“implementer1”的子智能体发送一个Delegate,后者执行编码任务,然后可以将结果发送给“critic3”。现在,implementer1倾向于为自己的工作辩护,但评论者没有这样的叙述动力,因此在一切都清晰之前,他们不会允许implementer1的代码被提交。即使它们可能在同一个模型上!但由于它们感觉像是不同的实体,因此行为也不同。
层次结构技巧 III:/shared文件夹。我很快意识到Delegate工具很好,但你无法通过它传输一个2GB的文件。智能体有容器,它们的主目录是/shared。我所做的是在整个智能体树上添加一个自动绑定挂载/shared。因此,父智能体可以引用/shared/...中的某个文件或存储库,或准备一个工作树,而子智能体可以立即访问它。它们很快学会在/shared中建立知识库,以便相互交换笔记并积累关于项目的知识。
好的,我为能够用Taurus构建的无数东西感到自豪(仪表板、继电器、按计划运行),但这已经太长了。如果这让你感到好奇,我希望你能访问<a href="https://taurusagents.com" rel="nofollow">https://taurusagents.com</a>,并分享你的真实反馈(请让你的主要智能体创建几个子智能体,以便你可以看到层次结构的运作方式)。如果你想直接交流,我会尽力在评论和TG聊天中回复你:<a href="https://taurusagents.com/community" rel="nofollow">https://taurusagents.com/community</a>
谢谢!