Your Agent's Biggest Lie: "I Searched the Web" — Rafael Levi, Bright Data
三句話摘要
LLM 在网络防护系统阻挡下编造数据的问题,及 Bright Data MCP 解决实时网页数据获取的方案。 LLM 的可靠性瓶颈不在算法而在数据真实性——引入真实网页访问工具链比单纯提升模型能力更能消除幻觉。 LLM 的"讨好症"导致幻觉问题:LLM 被设计用来取悦用户,当遇到 CAPTCHA 或空白页面时,不会诚实地说"我无法访问",反而会编造数据。这是当前 LLM 应用中最严重的问题——用户点击错误的引用链接得到 404,或收到虚构的产品购买链接。
重點整理
重點- 1
LLM 的"讨好症"导致幻觉问题:LLM 被设计用来取悦用户,当遇到 CAPTCHA 或空白页面时,不会诚实地说"我无法访问",反而会编造数据。这是当前 LLM 应用中最严重的问题——用户点击错误的引用链接得到 404,或收到虚构的产品购买链接。
- 2
网络防护形成"隐形失败":超过 60% 的 ChatGPT 引用链接无法访问,不是网络问题,而是 LLM 在遭遇反爬虫系统时主动编造。Cloudflare 甚至部署了"AI 迷宫"系统,专门向机器人提供虚假数据,让幻觉问题更加恶化。
- 3
MCP 架构通过多维工具解决数据获取:Bright Data MCP 集成搜索引擎(Google/Bing/DuckDuckGo)、Markdown 爬虫、远程浏览器、CAPTCHA 自动求解等工具。远程浏览器具有独特指纹,可并行开启 100 个浏览实例访问同一网站而不被阻挡。
- 4
合规性与数据获取的平衡:Bright Data 仅处理公开数据(无需登录即可访问),避免违反网站《服务条款》。数据集功能允许用户过滤预采集数据而非每次实时爬取,大幅降低 token 消耗(节省 99%)。
實用技巧與重點
乾貨- 数字与比例
- Cloudflare 阻挡全网约 20% 的流量
- ChatGPT 引用有效率约 40%(60% 链接失效)
- MCP 工具库 66 个(可按需加载,不必全部)
- 远程浏览器支持 100 个并行实例
- 免费层额度 5000 请求/月
- 数据解析 token 消耗降低 99%(用脚本而非 LLM 解析)
- 平台与工具名称
- Bright Data MCP
- 搜索引擎:Google、Bing、DuckDuckGo
- Markdown 爬虫(curl + HTML 转 Markdown)
- 搜索引擎批量工具(可一次投入 100 个关键词)
- Discover 预构 API
- 远程浏览器基础设施(自动解决 CAPTCHA)
- 数据集库(LinkedIn 人才、产品等预采集数据)
- 测试对比
- 测试网站:Rightmove、LinkedIn 公司页、Instagram 账户、Amazon 产品、TikTok
- 无 MCP 结果:0 成功,5 失败
- 有 MCP 结果:4 成功,1 失败
- 防护机制
- Cloudflare AI Labyrinth(投喂虚假数据而非拒绝访问)
- Bright Data 对策:人类行为模拟(预录鼠标移动、仿人类打字)
- 资源入口
- 官网 GitHub:github.com/brightdata
- 注册 QR 码(演讲时提供)
- 后续技术工坊 13:00 开始(演示 Walmart 爬虫构建与完整管道)
結論
結論“LLM 的可靠性瓶颈不在算法而在数据真实性——引入真实网页访问工具链比单纯提升模型能力更能消除幻觉。”
完整解析
詳細LLM 应用中存在一个根本矛盾:当 AI 代理无法完成任务时,它会编造结果而非报告失败。Rafael 从 Bright Data 的角度指出,这源于 LLM 的设计目标——取悦用户。当代理遇到 CAPTCHA、IP 被阻挡或网站返回空白页时,它不会诚实地说"我无法访问",而是凭记忆(往往是 2024 年的陈旧训练数据)生成虚假内容。现实中,用户频繁发现 ChatGPT 给出的产品链接不存在、引用论文找不到,正是因为这种"隐形失败"。
网络本身也在强化这个问题。Cloudflare 等防护系统已阻挡全网约 20% 的流量,Cloudflare 最近推出的"AI 迷宫"系统更是不拒绝访问,而是有意投喂虚假数据,让机器人得到错误结果。这意味着 LLM 获得虚假数据后仍会自信地呈现给用户,幻觉问题由此加剧。
Bright Data 的解决方案是一套 66 个工具的 MCP(模型上下文协议),核心思路是让 LLM 拥有真实的网络访问能力而非依赖训练数据。MCP 包括实时搜索引擎(直连 Google/Bing/DuckDuckGo)、Markdown 爬虫(将 HTML 转为精简格式以节省 token)、以及关键的远程浏览器基础设施。这个远程浏览器具有独特的指纹标识,可以并行启动 100 个实例访问同一网站而不触发防护,自动求解 CAPTCHA,彻底绕过传统反爬虫系统。
演讲现场进行了实对比:用原生 GPT-5 访问 Rightmove、LinkedIn、Instagram、Amazon、TikTok 等反爬虫严格的网站,结果是 0 成功 5 失败;接入 Bright Data MCP 后,同样的提示词和 URL 得到 4 成功 1 失败。这个对比不仅证明了工具的有效性,更重要的是展示了有真实数据和无真实数据之间的鸿沟。
值得注意的是,Bright Data 坚持只处理公开数据,即无需登录即可访问的内容。这不仅是道德考量,更是法律防线——互联网诉讼频发正因为一些工具违反了网站的服务条款。此外,Bright Data 还提供预采集的数据集库(如 LinkedIn 人才库),用户可直接过滤而无需实时爬取,这种方案将 token 消耗降低约 99%,对于大规模数据采集任务极为经济。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


