3 分•作者: bigmattystyles•2 个月前•原帖
这是来自宝马的一个意外提醒——你不必点击它,但如果你点击了,就会看到一段长达一分钟的《蜘蛛侠》视频广告。<p>我提交这个是因为我觉得这会引发有趣的讨论。就像煮青蛙一样。
4 分•作者: pancomplex•2 个月前•原帖
嗨,HN!我想分享一个我正在开发的开源项目。 这个项目叫做Yap,是一个适用于macOS的小型菜单栏应用,能够将语音转换为文本。你只需设置一个快捷键,按下它,开始说话,再次按下,文本就会粘贴到你所在的输入框中。所有操作都在本地进行,绝不会离开你的电脑。它是完全开源的,并且采用MIT许可证。 随着macOS 26的发布,苹果最近添加了两个新的API,SpeechAnalyzer和SpeechTranscriber,能够使用操作系统自带和管理的模型进行设备上的实时语音转文本。因此,该应用不自带任何模型,并且在说出第一个词之前不会加载任何内容。最近的一项基准测试显示,苹果的模型在准确性上略优于Whisper Small,并且速度快约3倍(详见:<a href="https://news.ycombinator.com/item?id=48894752">https://news.ycombinator.com/item?id=48894752</a>)。在Mac上,实际上不再需要下载模型或支付昂贵的API费用。 许多现有的听写工具都做了一些我希望避免的事情。它们要么: - 收费(而这些功能实际上是内置于操作系统中的) - 捆绑内存占用大的模型(例如Whisper或Parakeet) - 使用Electron封装的网页应用 - 在Intel Mac上根本无法使用 - 关闭源代码 - 使用第三方API,这些API会访问你所有的转录内容 这个应用大约有3000行原生Swift代码,大小为4MB,闲置时内存占用接近60MB。音频通过AVAudioEngine传入SpeechAnalyzer,开启了实时预览的波动结果,历史记录存储在SwiftData中。应用中完全没有网络代码。 代码库和演示可以在这里找到:<a href="https://github.com/FrigadeHQ/yap" rel="nofollow">https://github.com/FrigadeHQ/yap</a> 欢迎提问,也很期待听到任何功能请求!