返回首页
最新
“持续学习”被认为是大型语言模型(LLMs)的一个“障碍”:它们无法在工作中学习,无法随着时间的推移而改进等。特别是,Dwarkesh Patel将其描述为必须解决的一系列问题,以实现通用人工智能(AGI)。
许多学术文章提出了一种记忆系统,可能被视为“持续学习”的一种形式。但大多数评估侧重于记忆事实,这实际上并不是很有用(通过工具使用获取事实比将其存储在神经记忆中更好),而这些提议可能不太适合常见的LLM API使用模式。
在这篇文章中,我提出了一种“新”的方法,称为“技能胶囊”,这种方法非常务实,易于理解和评估,并且可能很好地融入现有工具中。
技能胶囊是一个具体的对象——基本上是一组向量。你可以将其插入到LLM上下文的某个中间位置,从而提高在特定技能上的表现,例如,使工具调用更加可靠,使用特定的写作风格、编码风格等。理论上,它可以用来修补任何LLM的不足。一个胶囊可以包含知识(例如,如何调用特定的API或编写涉及特定库的代码)。
技能胶囊可以通过对“单个示例”的单次前向传播生成,而不需要梯度或“微调”。因此,它可能允许LLM“在工作中学习”——即通过一次正确执行某项操作的演示,可以用来创建一个胶囊。
你可能会问——为什么是“Show HN”,而不是学术文章?因为研究人员已经知道这种方法——它被称为“软提示”、“超网络”、“引导向量”、前缀调优等。所有这些术语都很糟糕,并不能传达这种方法的可能性。我只是希望更多的人知道LLM可以即时改进。而一个更好的术语——“技能胶囊”——可能会帮助人们思考如何应用这些技术(我希望如此)。
另一个原因是它是“Show HN”:
* 它展示了一个人可以在几天内使用Claude Code和几美元的GPU费用进行一种相当酷的机器学习实验
* 以及我如何到达那里的一些有趣故事
在Hacker News和Twitter上,大家的共识是没有人感到害怕。人们承认初级工程师和研究生可能是受影响最大的群体,但他们似乎仍然认为自己的处境是可持续的。我的问题是,这是否只是人们的美好愿望和人性的一部分,试图抵抗不可避免的现实?我之所以这样问,是因为我真的看不到未来还有大量程序员的前景。我看到的是程序员的大规模失业。人们处于否认状态,所有关于人工智能无法在不犯错误的情况下编写代码的说法,一旦有AI可能在一夜之间发布并能编写无瑕疵代码,这些说法就不再成立。Claude 4.5就是一个很好的例子。我真的看不到任何有效的论据表明这项技术不会发展到使这份工作变得无关紧要的地步,甚至不仅仅是无关紧要,而是完全改变经济格局。
大家好!我叫卢克,我和赖利·沃尔兹一起制作了最初的Jmail。昨晚,我们有很多朋友一起合作,扩展了应用程序套件,以回应司法部发布的“爱泼斯坦档案”。<p>请随便问我任何问题!