返回首页
最新
这是来自宝马的一个意外提醒——你不必点击它,但如果你点击了,就会看到一段长达一分钟的《蜘蛛侠》视频广告。<p>我提交这个是因为我觉得这会引发有趣的讨论。就像煮青蛙一样。
嗨,HN!我想分享一个我正在开发的开源项目。
这个项目叫做Yap,是一个适用于macOS的小型菜单栏应用,能够将语音转换为文本。你只需设置一个快捷键,按下它,开始说话,再次按下,文本就会粘贴到你所在的输入框中。所有操作都在本地进行,绝不会离开你的电脑。它是完全开源的,并且采用MIT许可证。
随着macOS 26的发布,苹果最近添加了两个新的API,SpeechAnalyzer和SpeechTranscriber,能够使用操作系统自带和管理的模型进行设备上的实时语音转文本。因此,该应用不自带任何模型,并且在说出第一个词之前不会加载任何内容。最近的一项基准测试显示,苹果的模型在准确性上略优于Whisper Small,并且速度快约3倍(详见:<a href="https://news.ycombinator.com/item?id=48894752">https://news.ycombinator.com/item?id=48894752</a>)。在Mac上,实际上不再需要下载模型或支付昂贵的API费用。
许多现有的听写工具都做了一些我希望避免的事情。它们要么:
- 收费(而这些功能实际上是内置于操作系统中的)
- 捆绑内存占用大的模型(例如Whisper或Parakeet)
- 使用Electron封装的网页应用
- 在Intel Mac上根本无法使用
- 关闭源代码
- 使用第三方API,这些API会访问你所有的转录内容
这个应用大约有3000行原生Swift代码,大小为4MB,闲置时内存占用接近60MB。音频通过AVAudioEngine传入SpeechAnalyzer,开启了实时预览的波动结果,历史记录存储在SwiftData中。应用中完全没有网络代码。
代码库和演示可以在这里找到:<a href="https://github.com/FrigadeHQ/yap" rel="nofollow">https://github.com/FrigadeHQ/yap</a>
欢迎提问,也很期待听到任何功能请求!