揭示智能体式互联网上的良性/不良行为

Jin-Hee LeeMarina Elmore

阅读时间:9 分钟

本文另有 EnglishDeutschEspañolEspañol (Latinoamérica)FrançaisItaliano日本語한국어繁體中文.

互联网并不是一条单行道。长久以来,Web 安全领域的经验法则是:机器人是不好的,而人类是可信的。当然,这种普遍性的概括早已不适用。人类可能存在欺诈行为,而机器人在不同层级上也可能是有益的。网站所有者希望自动化流量能够与其网站互动,这样互联网才能正常运转并具备可发现性。

更复杂的是,“人类”和“机器人”之间的界限越来越模糊。现在,存在一种“混合”型流量,其中单个会话在人类和智能体之间来回切换。(想象一下用户浏览商店,然后将结账过程交给自动购物助手。)

那么,网站所有者如何管理这种复杂场景呢?这里关键在于评估行为。这是不是一种滥用行为?是否存在恶意?这里存在什么风险,我是否可以根据该访客的行为信任他们?要解决这个问题,需要超越静态、基于时间点的检查方式。评估信任需要分析持续的行为。

本文深入介绍 Web 完整性与信任(Web Integrity & Trust,负责机器人与欺诈问题领域)团队有关检测和分析良性/不良行为的策略,并提供一些工具,助力站点所有者应对不断演变的智能体式互联网所带来的各类新兴挑战。我们还将分享 Precursor 上线以来有关智能体流量的相关发现,并提供一套模拟工具,以便您查看系统如何判定您自身的光标移动来自人类还是机器人。此外,本文还将介绍近期值得期待的多项重磅发布更新。

定义风险与信任

让我们谈一下风险信任二者的区别,Cloudflare 内部负责机器人检测的各团队所采用的讨论口径。二者通常被视为一个连续体互相对立的两极。在 Cloudflare,我们将它们视为独立但相互补充的价值。信任是针对您的流量制定处置决策时不可或缺的核心要素。 

风险代表请求或操作产生危害的可能性,通常是短暂的。然而,信任是随着时间积累的,并且基于声誉。

我们可以借助一则现实生活中的例子对此加以说明:设想您夜晚在家看着电视,突然听到门铃被反复按响。这种行为不仅令人烦恼,也很奇怪。夜晚门铃急促响起令人不安。

您查看门口摄像头,发现按门铃的人是住在隔壁的挚友。当然,您信任您的好朋友,我们敢打赌您会让他们进来。

在该示例中,设定 “拒绝所有夜间按响我家门铃的人” 或者 “拒绝所有按门铃超过 10 次的人” 这类规则是不够的。信任再一次成为关键要素。

回到互联网流量方面,我们在机器人和欺诈领域建立产品的策略侧重于基于信任构建整个生态系统。我们的目标是为站点所有者提供相应激励手段与基础能力,以此引导各类行为,让互联网对所有人而言都更加安全:从底层拦截恶意行为起步,到在上层推动各方参与共建更安全的互联网。

信任级别:从顶部的可信行为,到底部的不可信恶意行为。右列指示站点所有者通常如何处理此行为。
信任级别:从顶部的可信行为,到底部的不可信恶意行为。右列指示站点所有者通常如何处理此行为。

良性行为,植根于透明度

从上层切入:何为良性行为?我们可以从 BotBase 中的已验证机器人和代理中获得清晰的示例。上个月,我们发布了一套更新后的实用分类体系,用于梳理系统所追踪的良性机器人。该体系将 “已验证” 的定义精简为两点:1)如实声明自身身份;2)不滥用已获得的信任。 

站点所有者与机器人运营方之间的透明性可构建共生关系:站点所有者能够明确其网站允许的行为及数据使用方式,机器人运营方也可更便捷地获取访问权限。透明性能够为双方关系建立信任;倘若您并无需要隐瞒的信息,主动申明自身身份,理应降低那些希望接纳您行为的站点所带来的访问阻力。

BotBase 不仅仅用于声明“谁是良性机器人”。它旨在作为收录全部已知机器人与智能体的目录,并提供事实依据。与我们之前仅包括已知良性机器人的机器人目录相比,BotBase 还能够跟踪非良性的机器人和代理。为什么?由于我们的系统会跟踪和验证已知良好行为者的行为,这意味着我们拥有工具来识别这些预期未满足的情况。如果您在 Cloudflare 网络上滥用信任,便不应轻松获得访问许可,您的已验证状态将会被撤销。

不良行为:公然、隐秘以及介于两者之间的一切

几周前,我们宣布推出 Precursor,这是一个持续运行的客户端系统,能够发现仅仅评估网络信号时会遗漏的微妙非人类机器人流量。当客户启用 Precursor 时,JavaScript 检测是通过 CDN 注入的,因此无需坐在电脑前去弄清楚在哪里以及如何重新运行这些检测。此外,Precursor  在整个会话中持续评估用户行为,因此,那些曾设法通过一次客户端和浏览器端检查的滥用流量将不再获得“免费通行证”。

通过将我们的风险和信任框架应用于这些客户端检测时,我们可以指出,CAPTCHA 或一次性障碍是基于风险的,这意味着它们缺乏上下文。另一方面,使用行为特征进行验证是基于信任的,因为它可以从完整的用户会话中捕捉更多的上下文线索。Precursor 是用于我们分析这种行为的工具。总而言之,Precursor 之所以如此强大,是因为它:

  1. 针对整个用户会话提供基于信任的检测。
  2. 增加了机器人开发者在多页面时间线中复刻人类行为的成本

通过让机器人开发者规避此类检测在经济层面得不偿失,我们便可在这场攻防博弈中占据上风。

那么,自我们发布该功能以来,我们获得了哪些实践认知?查看撰写本文时的 24 小时内数据,我们可以看到 Cloudflare 网络上共有 2.06 亿次 Precursor 评估事件,涉及 73,438 个区域

屏幕截图,显示 Precursor 在一个 24 小时期间的使用统计数据。
屏幕截图,显示 Precursor 在一个 24 小时期间的使用统计数据。

我们可以在数据中看到一些模式,这些模式揭示了我们在推出该检测能力时的猜想,但如今已在数万个域名上得到验证:

  • 可疑行为常常发生在会话中期,基于时间点的检测无法发现。
  • 一次会话过程中,访问行为经常会在人类与智能体之间来回切换。在这类场景下,厘清意图十分重要,以免站点所有者拦截自身实际期望保留的用户访问流量。
    • 这凸显出机器人分类体系的重要性,以便允许网站所有者依据场景、目的以及数据用途对流量进行处置。这正是我们优先更新 BotBase 分类体系的原因。

如果您希望进一步了解 Precursor 的实际工作原理,我们已在公告博客文章中简要披露过所分析信号的相关情况,从中可以看出 “人难免犯错” 这一道理。今天,我们将更进一步:向互联网上的所有用户提供交互式演示,模拟 Precursor 如何追踪您的光标移动轨迹。

屏幕截图,显示 Precursor 评估自定义光标移动的界面。
屏幕截图,显示 Precursor 评估自定义光标移动的界面。

Precursor Trace  现已上线,展示我们如何利用 Precursor 的(部分)检测机制评估您的光标移动。在此处,您可以查看光标正在加速还是修正、光标移动的节奏与形态等多项信息 —— 这些都是真实人类在和计算机交互时,几乎不会去关注的细节。立即试用!

Adaptive Intelligence 即将推出

Cloudflare 的 机器人检测引擎在评估给定请求是否为自动化时,可能会产生 不同的结果。对于判定为自动化发起的请求,评估结果分为两类:1)确定为自动化请求,依据经过验证的确定性检测方法或机器人指纹得出;2)疑似自动化请求,基于 Cloudflare 的 Bots ML 预测评分得出。

 Bots ML 以版本化方式迭代更新,意味着我们将每一个新模型版本作为新产品来发布。当机器人以小时乃至分钟级的速度完成自适应调整时,这种更新节奏将无法应对。

Adaptive Intelligence 是一个全新的检测引擎,不同于我们之前在 Bots ML 领域构建的任何东西。该模型本身是自适应的。。它从过去所见的一切中学到了经验,但更重要的是,它将继续根据它所观察到的内容进行学习,并自我调整。Adaptive Intelligence 将基于我们识别的各种流量模式进行自我升级,从良好行为到不良行为,客户无需升级到正式的新模型版本即可获得最新的预测性机器人检测能力。 

不久之后,所有 Bot Management 客户都将能够使用 Adaptive Intelligence。欢迎关注即将发布的上线公告。

跳出确定性检测的局限,进而干预机器人行为

到目前为止,我们一直专注于 Cloudflare 侧各方面的解决方案:策略、检测和分类。所有这些使 Cloudflare 能够为网站所有者提供所需工具,使其可在自己的站点上配置期望的流量策略。通过聚焦于网站所有者侧,希望借此机会讨论一些高级缓解措施,这些措施可以让网站所有者自身对机器人的行为施加影响。

若使用公开的缓解防护手段,我们便会遭遇一个问题,我们戏称为 “机器人抗生素问题( Bot Antibiotic Problem )”。始终向机器人发送确定性的响应(例如 403 阻断)会让恶意机器人开发者轻易探测、观测并逆向破解您的防护体系。

我们知道这一点,因此正在设计专门用于对机器人进行限流的缓解防护手段,针对恶意机器人与良性机器人采用差异化处置方案。我们可以将其分为三种方法:

方法一:不可预测性和随机行动。对可疑自动化流量应用随机响应(如拦截、挑战或允许)可以破坏机器人的自动重试逻辑和指纹识别。

方法 2: AI Labyrinth,一种防御措施,将未经授权的机器人困在由 AI 生成的网页组成的无尽迷宫中。您可以借助错误引导手段消耗恶意机器人的计算资源与爬取额度。在 AI Labyrinth 中,站点所有者将获得三个选项,按其偏好选择:

  • Maze:生成一个无尽的链接页面网络供机器人追踪。
  • Summary:为爬虫提供由 LLM 生成的页面摘要,看似真实但完全无法用作 AI 训练数据。
  • Poison:故意向机器人提供假信息(如虚假的价格或库存),以污染其为 AI 训练收集的数据。

方法三:良性机器人排队机制。并非所有智能体流量都是不良的;通过排队管理合法自动化流量(例如用户指示的购物智能体)的吞吐量,而不会完全拒绝为其提供服务。

这些机器人特定的高级缓解措施预计将在年末推出,网站所有者将可选择缓解措施的严格程度。

我们同样清楚,优秀的防护应当具备预测能力:能够自主学习并动态修正策略,无需多名安全专家协同介入,被动制定应对方案来处置最新的隐蔽攻击。这也许像 “一次性” 规则体系,其规则集具备动态可变的特性。这是有意为之:如果攻击不断演变,防御也应如此。正因如此,我们致力于让检测能力与缓解防护手段始终领先一步。

建立对您行之有效的信任生态系统

任何人都可以采取措施来定义自动化智能体与其基础设施进行交互的方式。 

可尝试以下几种方案:

通过摒弃静态、基于时间点的检查,转向持续信任评估机制,我们缓解了以打地鼠方式应对机器人攻击的困境。如果您尚未使用 Cloudflare 的机器人检测,欢迎了解并建立对您行之有效的信任生态系统。

BLOG-3467 5.png