揭開智慧體網際網路上的良好與不良行為

Jin-Hee LeeMarina Elmore

閱讀時間:9 分鐘

這篇文章亦提供 EnglishDeutschEspañolEspañol (Latinoamérica)FrançaisItaliano日本語한국어简体中文.

網際網路並非單一車道。長久以來,網站安全領域的經驗法則是:機器人是不好的,而人類是好的。當然,我們早已擺脫這種以偏概全的觀點。人類可能從事詐騙行為,而機器人在不同層面上也可能有所助益。網站擁有者實際上希望某些自動化流量能與我們的網站互動,以使網際網路發揮功能且可被探索。

讓事情更加複雜的是,「人類」與「機器人」之間的界線正越來越模糊。現在,我們有一種「混合型」流量,其中單一工作階段會從人類切換到智慧體模式,然後再切換回來。(試想一下,使用者在瀏覽商店時,將結帳流程交由自動購物助理來完成。)

那麼,網站擁有者要如何管理這種複雜性呢?這裡的關鍵在於評估行為。這種行為是否具有濫用性質?是否惡意?這裡呈現的風險是什麼?根據訪客的行動,我能否信任他們?要解決這個問題,需要超越靜態的、單一時間點的檢查,而是需要分析連續的行為來評估信任。

在這篇文章中,我們將深入介紹網路完整性與信任團隊(涵蓋機器人與詐騙問題領域)在偵測與分析良好及不良行為方面的策略,並提供工具來協助網站擁有者應對不斷變化的智慧體網際網路所帶來的新興挑戰。我們也將分享自 Precursor 推出以來,有關智慧體流量的研究發現,以及一個模擬工具,以及一個模擬體驗,讓您可以親自檢視自己的滑鼠游標移動會被判定為人類還是機器人。此外,還有一些令人期待的近期發布更新。

定義風險與信任

讓我們來談談風險信任之間的區別,這也是 Cloudflare 負責機器人偵測的團隊內部探討的議題。這兩者常被視為連續光譜上的兩個極端。但在 Cloudflare,我們將它們視為獨立但相互影響的價值指標。「信任」是針對您的流量做出明智決策時不可或缺的要素。 

風險是指某個請求或動作造成損害的可能性,通常是短暫的;而「信任」則是隨時間累積而成,建立在聲譽之上。

我們可以用一個現實生活中的例子來說明:假設你正在家裡享受晚間電視時光,突然聽到門鈴不停地響。除了令人困擾之外,這種行為也很奇怪。深夜急促的門鈴聲會讓人感到驚慌。

當你透過門鈴攝影機查看時,發現按門鈴的人竟然是你住在隔壁的摯友。既然是摯友,你自然是信任對方的,想必也會開門讓其進來。

在這個範例中,僅僅設定「拒絕所有在夜間按門鈴的人」或「拒絕所有按門鈴超過 10 次的人」這類簡單規則是遠遠不夠的。再次強調,信任才是關鍵要素。

回到網際網路流量的情境,我們在機器人與詐騙領域建構產品時的策略,是專注於建立一個基於信任的完整生態系統。我們的目標是提供誘因和基本元件,讓網站擁有者可以用來鼓勵行為,使網際網路對所有人都更加安全:從底層封鎖惡意活動開始,到頂層鼓勵參與更安全的網際網路。

信任光譜由上而下,頂端為高信任度行為,底端為不受信任之惡意行為。另附一欄,標示網站擁有者對此類行為的典型處置方式。
信任光譜由上而下,頂端為高信任度行為,底端為不受信任之惡意行為。另附一欄,標示網站擁有者對此類行為的典型處置方式。

良好行為,根植於透明性

讓我們從最頂端開始:什麼算是良好行為?我們可以從 BotBase 中的經驗證機器人與智慧體中找到明確的例子。上個月,我們宣布針對系統中所追蹤的良性機器人,更新了一套務實的分類法,將「經驗證」的定義歸結為兩點:1) 誠實地表明自己的身分,以及 2) 不濫用已贏得的信任。 

網站擁有者與機器人營運者之間的透明性,能夠建立一種共生關係:網站擁有者可以註明他們希望允許哪些行為和資料使用方式,而機器人營運者則能更順利地獲得存取權限。這種透明度是雙方信任的基礎;若無不可告人之事,主動宣告身分理應能減少那些有意放行此類行為的網站所設下的阻礙。

BotBase 的目標不僅僅是宣告「誰是好的」。它旨在成為所有已知機器人與智慧體的目錄,並提供客觀事實。與我們先前僅收錄已知良性機器人的 Bots Directory 相比,BotBase 也能夠追蹤不那麼良好的機器人與智慧體。為什麼?因為我們的系統會追蹤並驗證已知良好行為者的行為,這意味著我們擁有足夠的工具來識別這些期望何時未被滿足。如果某個機器人在 Cloudflare 網路上濫用信任,就應該被輕易放行,因此也將會被取消經驗證資格。

不良行為:從明目張膽到隱蔽行徑,以及介於兩者之間的各種形式

幾週前,我們宣布推出 Precursor,這是一個持續運作的用戶端系統,能夠識別那些極其隱蔽、非人類特徵微弱,且僅憑網路訊號難以察覺的機器人流量。當客戶啟用 Precursor 時,JavaScript 偵測會透過 CDN 插入,因此不需要手動坐在電腦前,費心思考要在哪裡或如何重新執行這些偵測。更重要的是,Precursor 會在整個工作階段中持續評估使用者行為,因此那些僥倖通過一次性用戶端或瀏覽器端檢查的濫用流量,再也無法拿到「免死金牌」。

將我們的風險與信任框架套用至這些用戶端偵測時,我們可以指出:CAPTCHA 或一次性障礙是基於風險的,意味著它們缺乏上下文脈絡。另一方面,使用行為特徵進行的驗證則是基於信任的,因為它可以從完整的使用者工作階段中捕捉到更多上下文線索。Precursor 正是我們用來分析這種行為的工具。總結來說,Precursor 之所以如此強大,是因為它:

  1. 在整個使用者工作階段中提供基於信任的偵測。
  2. 提高了機器人開發者在跨頁面時間軸上模擬人類行為的成本

透過讓機器人開發者在試圖繞過這些偵測時面臨經濟上的不利局面,我們得以在這場對抗博弈中勝出。

那麼,自推出以來我們學到了什麼?僅看撰寫本文時的一個 24 小時期間,我們就能看到 2.06 億次 Precursor 評估事件,涵蓋 Cloudflare 網路上的 73,438 個區域

Precursor 在 24 小時期間內的使用統計數據截圖。
Precursor 在 24 小時期間內的使用統計數據截圖。

我們可以在數據中看到一些模式,這些模式揭示了我們在推出該偵測功能時的一些猜想,但現在可以透過數萬個網域來加以驗證:

  • 可疑行為經常發生在工作階段中期,這是單一時間點偵測無法捕捉到的。
  • 行為經常在一個工作階段中從人類轉變為智慧體,然後再轉變回來。在這些情況下,理解其意圖非常重要,這樣網站擁有者才不會封鎖他們實際上希望允許的使用者流程。
    • 這凸顯了建立一套機器人分類系統的重要性——讓網站擁有者能依據使用案例、目的及資料用途來處理流量。這也正是我們優先更新 BotBase 分類法的原因。

對於那些想進一步瞭解 Precursor 實際運作原理的人,我們在先前的部落格文章中已分享了一個內幕:我們分析的訊號如何告訴我們「犯錯乃人之常情」。今天,我們更進一步:向所有網際網路使用者提供一個互動式示範,模擬 Precursor 將如何追蹤您的游標移動。

Precursor 評估自訂游標移動軌跡的螢幕截取畫面。
Precursor 評估自訂游標移動軌跡的螢幕截取畫面。

Precursor Trace 現已上線,展示我們如何利用 Precursor 偵測機制(的一部分)來評估您的游標移動。在這裡,您可以看到自己是在加速還是在修正,您的游標移動的節奏與質地,以及更多細節——這些都是您作為一個真實人類與電腦互動時,可能從未想過的事情。快來試試看吧!

Adaptive Intelligence 即將登場

Cloudflare 的機器人偵測引擎在評估某個請求是否為自動化時,可能會產生不同的結果。對於被判定為自動化的請求,評估結果可分為:1) 確定為自動化,基於已證實的、確定性的方法或機器人特徵;或 2) 可能為自動化,基於 Cloudflare 的 Bots ML 所進行的預測性評分。

過去,Bots ML 的更新通常採用版本迭代的方式,即我們將每個新模型版本的發布都視為一次正式的產品發布。然而,當機器人的適應速度是以小時甚至分鐘為單位時,這種節奏已無法滿足需求。

Adaptive Intelligence 是一套全新的偵測引擎,與我們過往在 Bots ML 領域打造的任何產品都截然不同。該模型本身是「具適應性」的。它雖然學習了我們過去觀察到的所有資料,但更重要的是,它會根據即時觀測到的現象持續學習並自我調整。Adaptive Intelligence 將根據我們識別出的各種流量模式(從良好行為到不良行為)自動進行升級。客戶無需再手動升級至正式的模型新版本,即可享有最新的預測性機器人偵測能力。 

所有 Bot Management 客戶都將在近期獲得 Adaptive Intelligence 的存取權限——請持續關注即將發布的官方消息。

跳出確定性思維,主動影響機器人行為

到目前為止,我們聚焦於 Cloudflare 這一側的策略、偵測與分類法。所有這些都讓 Cloudflare 能夠為網站擁有者配備所需的工具,以在他們的網站上設定所需的流量政策。現在將鏡頭轉向網站擁有者這一側,藉此機會討論一些進階的緩解措施,讓網站擁有者本身也能夠影響機器人的行為。

在使用較為直接的緩解技術時,我們會面臨一個被戲稱為「機器人抗生素問題」的困境。總是對機器人傳送確定性的回應(例如 403 block)會讓惡意的開發者機器人輕易地探查、觀察並逆向工程您的防禦機制。

我們明白這一點,因此正在設計專門用於對機器人進行限流的緩解措施——針對惡意機器人與良性機器人採用不同的方法。我們將其歸納為三種方法:

方法一:不可預測性與隨機行動。對疑似自動化的流量採取隨機回應(包括封鎖、質詢或放行),能破壞機器人的自動重試邏輯與特徵碼辨識。

方法二:AI 迷宮。這是一種防禦性回應,能將未經授權的機器人困在由 AI 產生的無盡網頁迷宮中。透過誤導策略,您可以大量消耗惡意機器人的運算資源與爬取預算。AI 迷宮中提供三個選項,網站擁有者可依據偏好選擇其一:

  • 迷宮 (Maze):產生無盡的連結網頁,引導機器人無限循環。
  • 摘要 (Summary):向爬蟲提供由 LLM 產生的頁面摘要,內容看似真實,但作為 AI 訓練資料卻毫無用處。
  • 投毒 (Poison):向機器人提供刻意捏造的內容(如虛假價格或庫存),污染其用於 AI 訓練的資料集。

方法三:為良性機器人設定排隊機制。並非所有智慧體流量都是惡意的;排隊機制能有效管理合法自動化流量(如使用者指派的購物助理)的輸送量,同時不會完全拒絕為其提供服務。

這些針對機器人設計的進階緩解措施預計於今年底前陸續推出,屆時網站擁有者可自行選擇緩解措施的嚴格程度。

我們也明白,卓越的防禦應具備預測性——即系統能夠自主學習並動態調整,無需多位安全專家緊急召開會議,針對最新的隱蔽攻擊制定被動修復方案。這可能像是擁有一套「一次性」規則的系統,其規則集本質上是動態的。這是刻意的設計:如果攻擊不斷演化,防禦也必須與時俱進。正因如此,我們致力於確保偵測與緩解能力始終領先一步。

建立適合您的信任生態系統

任何人都可以採取行動,定義自動化智慧體應如何與其基礎架構互動。 

以下是一些可以嘗試的做法:

透過擺脫靜態的、單一時間點的檢查,轉而採用持續性的信任評估,我們減少了與機器人營運者之間「打地鼠」般的遊戲。如果您尚未體驗 Cloudflare 的機器人偵測功能,不妨一試,並建立適合您的信任生態系統。

BLOG-3467 5.png