Detectar los comportamientos buenos y malos en la Internet agéntica
Esta publicación también está disponible en English, Deutsch, Español, Français, Italiano, 日本語, 한국어, 繁體中文 y 简体中文.

Internet no es una única vía de tráfico. Durante mucho tiempo, la regla general en la seguridad web era que los bots son malos, mientras que los humanos son buenos. Por supuesto, estamos mucho más allá de esta generalización. Los humanos pueden ser fraudulentos, y los bots pueden ser útiles a diferentes niveles. Los propietarios de sitios web desean activamente que algún tráfico automatizado interactúe con nuestros sitios para que Internet sea funcional y accesible.
Para complicar las cosas aún más, la línea entre "humano" y "bot" se está desdibujando cada vez más. Ahora, tenemos un tipo de tráfico “híbrido” donde una sola sesión cambia de humano a agente y viceversa. (Piensa en un usuario que navega por una tienda y luego pasa el proceso de pago a un asistente de compras automatizado.)
Entonces, ¿cómo gestionan los propietarios de sitios web este tipo de complejidad? Lo que importa aquí es evaluar los comportamientos. ¿Este comportamiento es abusivo? ¿O malicioso? ¿Cuál es el riesgo aquí? ¿Se puede confiar en este visitante basado en sus acciones? Resolver esto requiere ir más allá de las verificaciones estáticas en un momento específico. Se requiere analizar comportamientos continuos para evaluar la confianza.
En esta publicación, compartiremos una visión interna de la estrategia del equipo de Integridad y Confianza en la Web (que cubren los espacios problemáticos de bots y fraude) en torno a la detección y análisis de comportamientos buenos y malos, y que proporcionan herramientas para ayudar a los propietarios de sitios a enfrentar los desafíos emergentes en la dinámica Internet agéntica. También compartiremos hallazgos sobre el tráfico agéntico desde el lanzamiento de la herramienta Precursor, y una simulación donde puedes ver cómo tus propios movimientos del cursor serían evaluados como humanos o bots, además de algunas actualizaciones de lanzamiento interesantes que se esperan en el futuro cercano.
Concepto de riesgo y confianza
Hablemos sobre la distinción entre riesgo y confianza, tal como la discutimos dentro de los equipos en Cloudflare que trabajan en la detección de bots. Generalmente, se consideran polos opuestos de un continuo. En Cloudflare, los consideramos valores independientes, pero recíprocos. La confianza es el ingrediente esencial para tomar decisiones informadas sobre qué hacer con el tráfico.
El riesgo es cuán probable es que algo como una solicitud o acción sea dañino, y en general, es efímero. La confianza, sin embargo, se construye con el tiempo y se basa en la reputación.
Podemos ilustrar esto con un ejemplo de la vida real: digamos que estás disfrutando de la televisión por la noche en casa, cuando de repente escuchas el timbre que suena repetidamente. Además de ser molesto, este comportamiento es extraño. Las frenéticas llamadas al timbre tarde en la noche son alarmantes.
Revisas la cámara de tu puerta y ves que la persona que toca tu timbre es tu mejor amigo que vive al lado. Por supuesto, confías en tu mejor amigo y seguramente lo dejarías entrar.
En este ejemplo, no sería suficiente con que dijeras, "Rechaza a cualquiera que toque el timbre de mi puerta de noche" o "Rechaza a cualquiera que toque el timbre de mi puerta más de 10 veces". Una vez más, la confianza es el ingrediente esencial.
Regresando al tráfico en Internet, la estrategia al desarrollar productos en el ámbito de bots y fraude se centra en construir todo un ecosistema basado en la confianza. Y nuestro objetivo es proporcionar los incentivos y las primitivas para que los propietarios de sitios los utilicen para incentivar un comportamiento que haga que Internet sea más seguro para todos: comenzando por bloquear la actividad maliciosa en la base, hasta fomentar la participación en un Internet más seguro en la cima.

Buenas prácticas basadas en la transparencia
Iniciamos desde lo general ¿qué se considera un buen comportamiento? Podemos extraer ejemplos claros de los bots verificados y los agentes dentro de BotBase. El mes pasado, anunciamos una taxonomía pragmática actualizada para los bots buenos que rastreamos en nuestro sistema, y reducimos la definición de "Verificado" a dos cosas: 1) te declaras con honestidad, y 2) no abusas de la confianza que has ganado.
La transparencia entre un propietario de sitio y un operador de bot permite una relación simbiótica: los propietarios de sitios pueden señalar qué comportamientos y usos de datos desean permitir en sus sitios web, y los operadores de bots pueden obtener acceso con mayor facilidad. La transparencia permite la confianza en la relación; si no tienes nada que ocultar, declarar quién eres debería reducir las dificultades con los sitios que desean permitir tus comportamientos.
BotBase no está destinado solo a hacer declaraciones de “quién es bueno". Está destinado a ser un directorio de todos los bots y agentes conocidos, y a proporcionar los hechos. En comparación con nuestro directorio de bots anterior, que solo incluía los bots conocidos como buenos, BotBase también es capaz de rastrear los bots y agentes no tan buenos. La razón Dado que nuestros sistemas rastrean y validan el comportamiento de actores conocidos por su buena conducta, significa que tenemos las herramientas para identificar cuando no se cumplen estas expectativas. Si abusas de la confianza en la red de Cloudflare, no se te debería permitir fácilmente, por lo que no estarás verificado.
Malos comportamiento: evidentes, sigilosos y todos las demás.
Hace unas semanas, anunciamos Precursor, un sistema continuo del lado del cliente para detectar incluso el tráfico de bots sutilmente no humanos que puede pasar desapercibido al evaluar únicamente las señales de la red. Cuando un cliente habilita Precursor, la detección de JavaScript se inyecta a través de la CDN, por lo que no es necesario estar sentado frente al ordenador averiguando dónde o cómo volver a ejecutar estas detecciones. Es más, Precursor evalúa el comportamiento del usuario de forma continua durante la sesión, así que ya no habrá más indulgencias para el tráfico abusivo que logró pasar las verificaciones de cliente y navegador solo una vez.
Mediante la implementación de nuestro marco de Riesgo y Confianza a estas detecciones del lado del cliente, podemos señalar que los CAPTCHA o los obstáculos temporales son basados en el Riesgo, lo que significa que carecen de contexto. Por otro lado, la verificación mediante señales de comportamiento se basa en la confianza, ya que puede captar más pistas contextuales de toda la sesión del usuario. Precursor es la herramienta para que analicemos este comportamiento. En resumen, Precursor es tan sólida porque:
- Proporciona una detección basada en la confianza durante toda la sesión del usuario.
- Aumenta el costo para los desarrolladores de bots de replicar el comportamiento humano en una línea de tiempo de varias páginas.
Al hacer que no sea económicamente ventajoso para los desarrolladores de bots superar estas detecciones, ganamos el juego adversario.
Ahora, ¿qué hemos aprendido desde que lanzamos? Al observar solo un período de 24 horas al momento de escribir este blog, podemos ver 206 millones de eventos de evaluaciones de Precursor, a través de 73.438 zonas en la red de Cloudflare.

Podemos ver patrones en los datos que revelan cosas que habíamos sospechado al lanzar la detección, pero que ahora podemos validar en decenas de miles de dominios:
- El comportamiento sospechoso suele ocurrir a mitad de la sesión, lo cual no detectaría un sistema de detección puntual.
- El comportamiento en general varía de humano a agente y viceversa durante una sesión. En estos casos, es importante comprender la intención para que los propietarios del sitio no bloqueen los flujos de usuario que realmente desean.
- Esto destaca la importancia de un sistema de clasificación de bots que permite a los propietarios de sitios web manejar el tráfico según el caso de uso, propósito y utilización de los datos. Por eso precisamente priorizamos las actualizaciones de taxonomía para BotBase.
Para aquellos curiosos por saber más sobre cómo funciona realmente Precursor, compartimos un adelanto: cómo las señales que analizamos nos mostraron que errar es humano, en nuestro anuncio artículo del blog. Hoy vamos un paso más allá: dándole a cualquiera en Internet una demostración interactiva que simula cómo Precursor trazaría los movimientos de su cursor.

Precursor Trace está en vivo ahora, compartiendo cómo evaluaríamos tus movimientos del cursor utilizando (parte de) el mecanismo de detección de Precursor. Aquí podrás ver si estás acelerando o corrigiendo, el ritmo y la textura del movimiento del cursor, y mucho más; cosas en las que probablemente nunca habías pensado como ser humano real interactuando con una computadora. Realizar una prueba
Adaptive Intelligence estará disponible pronto
Los motores de detección de bots de Cloudflare pueden producir diferentes resultados al evaluar si una solicitud dada es automatizada o no. Para las solicitudes que se consideran automatizadas, la evaluación puede ser 1) definitivamente automatizada, basada en métodos determinísticos comprobados o huellas digitales de bots, o 2) probablemente automatizada, basada en una puntuación predictiva del aprendizaje automático de bots de Cloudflare.
Históricamente, el aprendizaje automático de bots se ha actualizado en versiones, lo que significa que anunciábamos cada nueva versión del modelo como un lanzamiento de producto. Este ritmo no funciona cuando los bots se adaptan en el transcurso de horas o incluso minutos.
Adaptive Intelligence, un motor de detección completamente nuevo, es diferente a cualquier cosa que hayamos construido antes en el ámbito del aprendizaje automático de los bots. El modelo en sí es adaptable. Ha aprendido de todo lo que hemos visto en el pasado, pero lo más importante, continuará aprendiendo y autoajustándose en función de lo que ve. Adaptive Intelligence se actualizará automáticamente basándose en una amplia gama de patrones de tráfico que identificamos, desde comportamientos buenos hasta malos, y los clientes ya no necesitarán actualizar a una nueva versión formal del modelo para tener las últimas detecciones predictivas de bots funcionando para ellos.
Todos los clientes de gestión de bots tendrán acceso a Adaptive Intelligence en un futuro cercano: mantente atento para el anuncio de lanzamiento que llegará pronto.
Superar el determinismo para influir en el comportamiento de los bots
Hasta ahora, nos hemos centrado en el lado de Cloudflare: estrategia, detección y taxonomía. Todo esto permite a Cloudflare equipar a los propietarios de sitios web con las herramientas que necesitan para establecer las políticas de tráfico que desean en sus sitios. Centrándonos en el lado del propietario del sitio web, queremos aprovechar esta oportunidad para discutir algunas mitigaciones avanzadas que permiten a los propietarios de sitios web influir en el comportamiento de los bots.
Con técnicas de mitigación más evidentes, nos enfrentamos a algo que hemos apodado el "problema de los antibióticos para bots". Siempre enviar a los bots una respuesta específica (como un bloqueo 403) facilita que un bot de desarrollador malicioso sondee, observe e ingenie a la inversa tus defensas.
Sabemos esto, así que estamos diseñando mitigaciones específicamente creadas para limitar bots, con diferentes enfoques para bots maliciosos frente a bots buenos. Podemos dividirlos en tres enfoques:
Enfoque 1: Imprevisibilidad y acciones aleatorias. Aplicar respuestas aleatorias (entre bloquear, desafiar o permitir) al tráfico automatizado sospechoso interrumpe la lógica de reintento automático y el fingerprinting de un bot.
Enfoque 2: AI Labyrinth, una respuesta defensiva que atrapa a los bots no autorizados en un laberinto interminable de páginas web generadas por inteligencia artificial. Puedes desperdiciar el presupuesto de cálculo y rastreo de los bots maliciosos usando una dirección incorrecta. Dentro de AI Labyrinth se ofrecerán tres opciones a los propietarios del sitio, según su preferencia:
- Maze: genera una interminable red de páginas enlazadas para que los bots las sigan.
- Summary: envía a los rastreadores un resumen generado por el LLM de una página que parece real pero no sirve para nada como datos de entrenamiento de la IA.
- Poison: entrega intencionalmente contenido falso (como precios o inventario falsos) a un bot, contaminando los datos que recopila para el entrenamiento de la IA.
Enfoque 3: Colas para los bots buenos. No todo el tráfico agente es malo; la cola gestiona el rendimiento para el tráfico automatizado legítimo (como los agentes de compras dirigidos por el usuario) sin negarles el servicio por completo.
Estas mitigaciones avanzadas y específicas para bots se implementarán hacia finales del año, y estarán disponibles para que el propietario del sitio web elija cuán estrictas desea que sean sus mitigaciones.
También sabemos que una gran defensa es una que predice: una que autoaprende y corrige el curso sin necesidad de múltiples expertos en seguridad en una llamada para establecer de manera reactiva una solución que tenga en cuenta el más reciente ataque sigiloso. Esto podría parecer tener un sistema de reglas “desechables”, en el cual el conjunto de reglas es dinámico por naturaleza. Esto es intencional: si los ataques evolucionan constantemente, las defensas también deben hacerlo. Por eso estamos trabajando para mantener tanto las detecciones como las mitigaciones actualizadas.
Establece el ecosistema de confianza que funcione para ti
Cualquiera puede tomar medidas para definir cómo interactúan los agentes automatizados con su infraestructura.
Estas son algunas cosas que puedes intentar:
- Activar Precursor
- Experimentar con Precursor Trace
- Más información sobre BotBase
Al alejarnos de las verificaciones estáticas y puntuales y adoptar evaluaciones continuas de confianza, reducimos las idas y vueltas con los operadores de bots. Si aún no estás utilizando la detección de bots de Cloudflare, pruébala y establece el ecosistema de confianza que funcione para ti.


