
今天试验一下OpenClaw抓取数据的能力,以股吧论坛为例,采集平安银行最近两天的帖子。先看看OpenClaw的解题过程,再说TA掉进了什么陷阱。
只要通过聊天界面,告诉TA我的目的,随后看见,在硬盘中生成了py文件,其中程序就是真正的采集数据爬虫,写得还挺好。但是从聊天界面的记录可以看出,OpenClaw并不是一次性就成功的。
8:14大模型生成了一个爬虫py文件,让OpenClaw执行。

但是,执行结果没有生成csv文件。

所以,OpenClaw把这些情况反映给大模型,大模型重新写了爬虫程序 8:15.

最终,抓取到数据,并在本地生成了csv文件。
惊叹其能力时,我打开csv文件看了看,发现有错误,比如居然有2026-12-25的帖子,穿越了吗?在浏览器里看了看页面,是03-20,是什么原因造成的?
通过查看源代码,发现股吧把帖子数据写了两遍。一个是在html前面,html编码的。另一个是在后面,json编码的。
OpenClaw写的爬虫是针对html编码的数据,然而这些数据有个别错误,在浏览器的跟踪功能中发现12-25 (但实际上是2025-12-25)。浏览器解析的是后面的,json数据,所以造成了最终采集结果的错误。显然,这是股吧设置的一个陷阱,OpenClawI爬虫抓取了HTML编码的记录,但实际上应当是JSON的。聪明一世的OpenClawI最终逃不过人类的陷阱。
关于陷阱
爬虫与反爬虫的对抗一直存在,反爬虫要付出很大代价,甚至可能以降低网站并发访问为代价。股吧这次的做法显然是 把人工智能安全中的数据投毒策略给用过来了,OpenClaw写的爬虫不慎掉进了有毒的数据空间。股吧设置的这个陷阱看起来是针对AI写的爬虫,人类需要检查页面,是不可能调到这个坑里。
虽然抓回来数据,但是是错误的,显然不能用。看看程序,显然也不是小修小改就能用的,因为要提取json而非html。 人类花费了token和时间,最后却不得不亲自介入。将来,人类会有更多的花招,来误导大模型,但实际上一波人误导使用AI的人。所以AI真的不能完全相信,AI如何让人类相信TA,将一直是个问题。
理解AI安全的投毒、逃避,对于人类理解AI风险是极为必要的:
关注复旦大学IntBigData













