返回首页
最新
嗨,HN,
我创建这个库是因为我想要一种清理杂乱文本数据并提取个人身份信息(PII)的方法,而不需要将敏感信息发送到云API或处理脆弱的正则表达式模式。
该工具通过 llama.cpp 在本地运行量化模型,并使用从 Pydantic 模型生成的 GBNF 语法。这强制大型语言模型(LLM)输出严格遵循模式的有效 JSON,从而解决了小模型常见的可靠性问题。目前,它支持 Pandas 和 Polars 数据框,并且可以与任何 GGUF 模型配合使用。
它仍处于早期 alpha 阶段,因此在较旧的 CPU 上的性能可能会成为瓶颈,相较于标准字符串操作,我发现它在正则表达式失效的语义提取任务中非常有用。我非常欢迎对实现的反馈或优化建议。
客户端应用程序,获取国家气象局(NWS)的数据,以便在您经历重大降雪事件时显示降雪进展。