你好,HN,
我开发了批量图像生成器,因为我对迭代视觉资产的速度感到沮丧。像Midjourney这样的工具非常适合单张图像,但当你需要基于特定参考生成50多种产品照片或游戏资产的变体时,手动处理就显得很麻烦。
它的功能包括:
- 上传一张参考图像,并生成100多种保持风格/结构的AI变体。
- 批量背景去除(因为一旦生成了100张图像,通常需要进行清理)。
- 快速批量下载。
我在这里分享这个工具的原因是:
我希望获得关于输出一致性的反馈。我还想知道在你的设计或开发过程中,是否还有特定的“批量”工作流程仍然过于手动。
我会在这里回答关于实现或未来规划的任何问题!
返回首页
最新
大约10个月前,我在这里发布了OSle [1],这是一个适用于x86汇编的操作系统,能够在510字节的引导加载程序中运行。它引发了热烈的讨论,我也继续对其进行改进。
直到上周,所有的用户空间程序都是16位汇编语言编写的。最近我开始尝试为它提供一个C运行时,现在你可以用C语言为OSle编写程序了。
SDK附带了一个小型C运行时,提供与汇编SDK相同的API——文件输入输出、进程管理、屏幕输出。来宾程序可以使用标准工具链编译,并在同样的510字节内核上运行。<p>在浏览器中试试吧:<a href="https://shikaan.github.io/osle/" rel="nofollow">https://shikaan.github.io/osle/</a>
[1]: <a href="https://news.ycombinator.com/item?id=43866585">https://news.ycombinator.com/item?id=43866585</a>
我用Go语言构建了一个命令行工具,可以从杂乱的PDF和HTML页面中提取结构化数据(JSON、CSV、Parquet)。<p>核心思想是:大型语言模型(LLMs)在理解结构方面表现出色,但在批量数据提取时效率较低。因此,smelt采用了双重处理架构:<p>1. 一个快速的Go捕获层解析文档并检测类似表格的区域。
2. 这些区域(而非整个文档)会发送给Claude进行模式推断——列名、类型、嵌套。
3. 然后Go层根据推断出的模式进行确定性提取。<p>这意味着LLM在实际数据处理的热路径中并不参与。它只需一次性确定“这是什么数据?”,然后Go高效地处理“提取10,000行”的部分。<p>使用非常简单:<p><pre><code> smelt invoice.pdf --format json
smelt https://example.com/pricing --format csv
smelt report.pdf --schema # 仅显示推断出的结构
</code></pre>
您还可以传递 --query “提取收入表” 来在文档中有多个表格时聚焦提取。<p>目前仍处于早期阶段(尚未支持OCR,HTML仅限于<table>元素),但它能很好地处理常见情况。非常欢迎对架构的反馈——尤其是来自那些在大规模PDF表格提取方面有经验的用户。
当开发者申请工作时,他们通常会发送一个作品集链接、GitHub 账号或简历。<p>但是这个过程完全是一个黑箱。<p>你永远不知道:<p>• 招聘人员是否打开了你的简历
• 他们查看了哪些代码库
• 哪些项目引起了他们的注意<p>因此,我为开发者的作品集构建了招聘人员分析工具。<p>它跟踪:<p>• 个人资料浏览量
• 代码库点击量
• 简历打开率
• 浏览者位置洞察
• 查看个人资料的公司类型<p>目标是为开发者提供类似于产品分析的反馈循环。<p>你不再需要猜测招聘人员重视什么,而是可以看到哪些项目或技能真正引起了关注。<p>我在这里写了一篇关于跟踪如何工作的技术分析以及设计背后的原因:<p>我很想听听 HN 社区对在开发者作品集中添加分析功能的看法。
世界模型在过去十年中迅速发展——从基于潜在模型的强化学习(如PlaNet、Dreamer)到生成视频模拟器(如Genie、DriveWorld)以及具身/多智能体系统。<p>相关文献在强化学习、扩散模型、三维占用预测、安全感知建模和自动驾驶等领域日益分散。<p>我整理了一个结构化的资料库,组织了489篇论文(2012–2026),包括:<p>– 双重分类法(表示 × 应用)
– 视觉演变树
– 会议与趋势统计
– 195个开源实现<p>目标是将该领域组织成一个连贯的地图,而不仅仅是一个汇总列表。<p>欢迎反馈和补充缺失的作品。<p><a href="https://github.com/Bowen12137/Awesome-World-Models" rel="nofollow">https://github.com/Bowen12137/Awesome-World-Models</a>
播放链接:<a href="https://p.migdal.pl/chromatron-oxide/" rel="nofollow">https://p.migdal.pl/chromatron-oxide/</a>
代码库:<a href="https://github.com/stared/chromatron-oxide/" rel="nofollow">https://github.com/stared/chromatron-oxide/</a>(仅用于教育目的)
原始内容:<a href="https://www.silverspaceship.com/chromatron/" rel="nofollow">https://www.silverspaceship.com/chromatron/</a>
<p>完整故事请参见博客文章。</p>
展示HN:为Claude Code的思考旋转器提供的118条学习提示
我为Claude Code构建了一套118条双语旋转提示。这些提示会在“思考中...”的旋转器下方显示——每个思考周期随机显示一条提示。
分类:Claude Code快捷键(63条)、Git(12条)、Python(12条)、JS/TS(12条)、Shell(12条)、编程智慧(12条)。
它使用Claude Code的原生`spinnerTipsOverride`,位于~/.claude/settings.json。安装只需一个bash脚本,无需依赖,保留所有默认提示。
github.com/dongsheng123132/claude-code-spinner-tips
一份精彩的精选开源语音转文本和语音输入工具列表,适用于Linux、macOS、Windows、Android和iOS。