4作者: pera1 天前原帖
年初,我决定在我的一个个人网站上搭建一个爬虫和大型语言模型(LLM)蜜罐,其中包含一个虚假的 Git 仓库,里面的代码包含虚假的 HTTP 端点。这个仓库的地址隐藏在一个公共页面的评论中。 大约三周前,来自亚马逊搜索机器人(Amazon Searchbot)的 IP 地址尝试向包含在一个 shell 脚本中的虚假端点发起请求。 我的 robots.txt 文件中明确包含了 Amazonbot。 老实说,我对这来自亚马逊的行为感到惊讶。这种行为合法吗?
23作者: tehwebguy1 天前原帖
不仅仅是HN这个网站,大家的模糊搜索都很糟糕。让我进行精确匹配搜索吧。即使这个选项存在,我也得费很大劲才能找到。 当我运营一个有大量搜索使用的网站时,我曾为提升搜索质量而苦恼,绝不会为了某些模糊匹配而取消精确匹配。我希望其他人也能这样做。
3作者: dfps1 天前原帖
X将基本上拥有其用户的完整画像,将财务数据与用户的支付对象、每周日程、兴趣和愿望,以及模仿他们的写作风格和形象的能力结合在一起。<p>任何社会是否应该允许任何机构同时拥有这些类型的数据?这基本上否定了抗议和反对政治家的能力,因为美国政府可以控制X,这在很大程度上否定了民主的理念,而民主依赖于教育、私人思想、言论和集会的自由,以及这些类似中国应用程序想要收集和汇编的一切的缺失。<p>(我知道苹果公司也在这样做,但苹果用户通常被认为是盲从者,而苹果的全数据收集,像X一样,也可以成为我提问的主题。)