Luces y sombras en la era de la web agéntica

Jin-Hee Lee y Marina Elmore

12 min de lectura

Esta publicación también está disponible en English, Deutsch, Español (Latinoamérica), Français, Italiano, 日本語, 한국어, 繁體中文简体中文.

Internet no es una única vía de tráfico. Durante mucho tiempo, la regla general en la seguridad web era que los bots son malos, mientras que los humanos son buenos. Por supuesto, ya hemos dejado atrás esa generalización hace tiempo. Los humanos pueden ser fraudulentos, y los bots pueden resultar útiles en distintos niveles. A los propietarios de sitios web nos interesa que haya tráfico automatizado que interactúe con nuestros sitios para que Internet sea funcional y visible.

Para complicar aún más las cosas, la línea entre "humano" y "bot" se está desdibujando cada vez más. Ahora, tenemos un tipo de tráfico "híbrido" donde una sola sesión cambia de humano a agente y viceversa. (Imagina a un usuario que está echando un vistazo en una tienda y luego deja que un asistente de compras automatizado se encargue del proceso de pago).

¿Cómo gestionan los propietarios de sitios web este tipo de complejidad? Lo que importa aquí es evaluar comportamientos. ¿Es un comportamiento abusivo? ¿Malicioso? ¿Qué riesgo supone? ¿Puedo confiar en este visitante basándome en sus acciones? Para resolver esto hay que ir más allá de las comprobaciones estáticas y puntuales. Hay que analizar comportamientos continuos para evaluar la confianza.

En esta entrada, te vamos a dar una visión de primera mano de la estrategia del equipo de Integridad y Confianza en la Web (que se ocupa de los problemas relacionados con los bots y el fraude) en lo que respecta a la detección y el análisis de comportamientos positivos y negativos, y te vamos a ofrecer herramientas para que los propietarios de sitios web puedan hacer frente a los nuevos desafíos que plantea la web agéntica, que está en constante evolución. También te contaremos lo que hemos descubierto sobre el tráfico agéntico desde el lanzamiento de Precursor, y te mostraremos una simulación en la que podrás ver cómo se evaluarían tus propios movimientos del cursor para determinar si eres humano o un bot, además de algunas novedades interesantes que lanzaremos en un futuro próximo.

Definición de riesgo y confianza

Hablemos de la distinción entre riesgo y confianza, tal y como la abordamos dentro de los equipos de Cloudflare que trabajan en la detección de bots. A menudo se consideran polos opuestos de un continuo. En Cloudflare, los consideramos valores independientes, pero recíprocos. La confianza es el ingrediente clave para tomar decisiones bien fundamentadas sobre qué hacer con tu tráfico. 

El riesgo es la probabilidad de que algo, como una solicitud o una acción, resulte perjudicial, y suele ser algo pasajero. La confianza, en cambio, se va construyendo con el tiempo y se basa en la reputación.

Podemos ilustrarlo con un ejemplo de la vida real. Imagina que estás disfrutando de un rato de tele por la noche en casa, cuando de repente oyes que llaman al timbre una y otra vez. Además de ser molesto, este comportamiento es extraño. Los timbres frenéticos a altas horas de la noche son alarmantes.

Miras por la cámara de la puerta y ves que la persona que llama al timbre es tu mejor amigo, que vive al lado. Por supuesto, confías en tu mejor amigo, y apostaríamos a que lo dejarías entrar.

En este ejemplo, no bastaría con que dijeras: "Rechaza a cualquiera que llame al timbre por la noche" o "Rechaza a cualquiera que llame al timbre más de 10 veces". De nuevo, la confianza es el ingrediente esencial.

Volviendo al tráfico en Internet, la estrategia a la hora de desarrollar productos en el ámbito de los bots y el fraude se centra en crear todo un ecosistema basado en la confianza. Y nuestro objetivo es ofrecer los incentivos y las herramientas básicas que los propietarios de sitios web puedan usar para fomentar comportamientos que hagan que Internet sea más seguro para todos: desde bloquear las actividades maliciosas desde la base hasta animar a la gente a participar en una Internet más segura a nivel general.

Una escala de confianza donde los comportamientos más fiables ocupan la parte superior, mientras que los comportamientos maliciosos ocupan la parte inferior. Hay una columna adicional que indica cómo suele gestionar ese comportamiento el propietario de una web.
Una escala de confianza donde los comportamientos más fiables ocupan la parte superior, mientras que los comportamientos maliciosos ocupan la parte inferior. Hay una columna adicional que indica cómo suele gestionar ese comportamiento el propietario de una web.

Transparencia como base del buen comportamiento

Lo primero, ¿qué se considera un buen comportamiento? Podemos sacar ejemplos claros de los bots y agentes verificados de BotBase. El mes pasado anunciamos una nueva clasificación práctica para los bots buenos que seguimos en nuestro sistema, en la que redefinimos el término "Verificado" basándonos en dos cosas: 1) que te identifiques con sinceridad, y 2) que no abuses de la confianza que te has ganado. 

La transparencia entre el propietario de una web y el operador de un bot permite establecer una relación simbiótica: los propietarios pueden indicar qué comportamientos y usos de datos quieren permitir en sus sitios web, y a los operadores de bots se les puede conceder acceso más fácilmente. La transparencia fomenta la confianza en la relación. Si no tienes nada que ocultar, decir quién eres debería reducir las dificultades con los sitios web que quieren permitir tus comportamientos.

BotBase no pretende limitarse a declarar "quién es de fiar". Su objetivo es ser un directorio de todos los bots y agentes conocidos, y ofrecer datos objetivos. A diferencia de nuestro anterior directorio de bots, que solo incluía bots de confianza, BotBase también es capaz de rastrear bots y agentes que no son tan fiables. ¿Por qué? Como nuestros sistemas rastrean y validan el comportamiento de los actores de confianza, disponemos de las herramientas necesarias para identificar cuándo no se cumplen estas expectativas. Si abusas de la confianza en la red de Cloudflare, no se te debería permitir el acceso fácilmente, por lo que no se te verificará.

Comportamientos indebidos: evidentes, encubiertos y todo lo que hay entre medias

Hace unas semanas, anunciamos Precursor, un sistema continuo del lado del cliente para detectar incluso el tráfico de bots sutilmente inhumano que puede pasar desapercibido si se evalúan solo las señales de la red. Cuando un cliente activa Precursor, la detección mediante JavaScript se integra en la CDN, así que no hace falta que te quedes delante del ordenador pensando dónde o cómo volver a ejecutar estas detecciones. Es más, Precursor evalúa el comportamiento de los usuarios de forma continua durante toda la sesión, así que se acabaron los "pases libres" para el tráfico abusivo que haya conseguido burlar las comprobaciones del lado del cliente y del navegador aunque solo sea una vez.

Si aplicamos nuestro marco de riesgo y confianza a estas detecciones del lado del cliente, podemos señalar que los CAPTCHA o los obstáculos puntuales se basan en el riesgo, lo que significa que carecen de contexto. Por otro lado, la verificación mediante indicios de comportamiento se basa en la confianza, ya que puede captar más pistas contextuales de toda la sesión del usuario. Precursor es la herramienta para que analicemos este comportamiento. En resumen, Precursor es tan eficaz porque:

  1. Proporciona detección basada en la confianza durante toda la sesión del usuario.
  2. Aumenta el coste que supone para los desarrolladores de bots imitar el comportamiento humano a lo largo de una secuencia de varias páginas.

El hecho de que a los desarrolladores de bots les resulte económicamente poco rentable burlar estas detecciones nos permite ganar esta batalla.

Ahora bien, ¿qué hemos aprendido desde el lanzamiento? Si nos fijamos solo en un periodo de 24 horas en el momento de escribir este blog, vemos 206 millones de eventos de evaluación de Precursor, repartidos por 73 438 zonas de la red de Cloudflare.

Una captura de pantalla con las estadísticas de uso de Precursor en un periodo de 24 horas.
Una captura de pantalla con las estadísticas de uso de Precursor en un periodo de 24 horas.

Podemos ver patrones en los datos que revelan cosas que sospechábamos al lanzar la detección, pero que ahora podemos validar en miles de dominios:

  • El comportamiento sospechoso a menudo ocurre a mitad de sesión, lo cual no sería detectado por la detección puntual.
  • El comportamiento a menudo cambia de humano a agéntico y viceversa durante una sesión. En estos casos, es importante entender la intención para que los propietarios del sitio no bloqueen flujos de usuarios que realmente desean.
    • Esto destaca la importancia de un sistema de clasificación de bots que permita a los propietarios de sitios web gestionar el tráfico según el caso de uso, el propósito y el uso de datos. Esta es precisamente la razón por la que hemos dado prioridad a las actualizaciones de la clasificación de BotBase.

Para los que tengáis curiosidad por saber más sobre cómo funciona realmente Precursor, hemos compartido un adelanto, sobre cómo las señales que analizamos nos mostraron que errar es humano, en nuestra entrada de blog del anuncio. Hoy vamos un paso más allá. Ofrecemos a cualquier usuario de Internet una demo interactiva que simula cómo Precursor rastrearía los movimientos de tu cursor.

Captura de pantalla en la que se muestra cómo Precursor analiza el movimiento personalizado del cursor.
Captura de pantalla en la que se muestra cómo Precursor analiza el movimiento personalizado del cursor.

Precursor Trace ya está disponible y muestra cómo evaluaríamos los movimientos de tu cursor utilizando (parte del) mecanismo de detección de Precursor. Aquí puedes ver si estás acelerando o corrigiendo tu movimiento, el ritmo y la consistencia del movimiento del cursor, y mucho más, cosas en las que probablemente nunca habías pensado como persona real que interactúa con un ordenador. ¡Pruébalo!

Adaptive Intelligente, disponible próximamente

Los motores de detección de bots de Cloudflare pueden mostrar resultados diferentes a la hora de evaluar si una solicitud determinada es automatizada o no. En el caso de las solicitudes que se consideran automatizadas, la evaluación puede ser: 1) totalmente automatizada, basada en métodos deterministas probados o huellas digitales de bots, o 2) probablemente automatizada, basada en la puntuación predictiva del Bots ML de Cloudflare.

Hasta ahora, Bots ML se ha actualizado por versiones, lo que significa que anunciábamos cada nueva versión del modelo como un lanzamiento de producto. Este ritmo no funciona cuando los bots se adaptan en el transcurso de horas o incluso minutos.

Adaptive Intelligence, un motor de detección completamente nuevo, es diferente a todo lo que hemos creado antes en el ámbito de Bots ML. El modelo en sí es adaptable. Ha aprendido de todo lo que hemos visto en el pasado, pero lo más importante es que seguirá aprendiendo y ajustándose por sí mismo en función de lo que vea. Adaptive Intelligence se actualizará automáticamente basándose en una amplia gama de patrones de tráfico que identificamos, desde comportamientos buenos hasta maliciosos, y ya no tendrás que actualizar a una nueva versión oficial del modelo para poder disfrutar de las últimas funciones de detección predictiva de bots. 

Todos los clientes de nuestra solución Bot Management tendrán acceso a Adaptive Intelligence próximamente. No te pierdas al anuncio del lanzamiento que se publicará muy pronto.

Más allá del determinismo: cómo guiar el comportamiento de los bots

Hasta ahora, nos hemos centrado en el lado de Cloudflare: estrategia, detección y clasificación. Todo esto permite a Cloudflare proporcionar a los propietarios de sitios web las herramientas que necesitan para establecer las políticas de tráfico que deseen en sus sitios. Centrándonos en el lado de los propietarios de sitios web, queremos aprovechar esta oportunidad para hablar de algunas medidas de mitigación avanzadas que permiten a los propios propietarios influir en el comportamiento de los bots.

Con técnicas de mitigación más evidentes, nos enfrentamos a algo que hemos apodado el "problema de los antibióticos para bots". Enviar siempre a los bots una respuesta determinista (como un bloqueo 403) facilita que un bot malicioso creado por un desarrollador sondee, observe y realice ingeniería inversa de tu protección.

Somos conscientes de ello, por lo que estamos diseñando medidas de mitigación específicas para limitar el tráfico de los bots, con enfoques diferentes para los bots malos y buenos. Podemos dividirlas en tres enfoques:

Enfoque 1: Imprevisibilidad y acciones aleatorias. Aplicar respuestas aleatorias (entre bloquear, desafiar o permitir) al tráfico automatizado sospechoso rompe la lógica de reintentos automáticos y la identificación de huellas digitales del bot.

Enfoque 2: AI Labyrinth, una respuesta defensiva que atrae a los bots no autorizados a un laberinto sin fin de páginas web generadas por IA. Puedes agotar los recursos de procesamiento y los presupuestos de rastreo de los bots maliciosos utilizando la distracción. Los propietarios de sitios tendrán tres opciones dentro de AI Labyrinth, según su preferencia:

  • Maze: genera una red interminable de páginas vinculadas para que los bot las sigan.
  • Summary: les das a los rastreadores un resumen de una página generado por un modelo de lenguaje de gran tamaño que parece real, pero que es totalmente inútil como datos de entrenamiento de la IA.
  • Poison: le sirve contenido deliberadamente falso (como precios o existencias falsos) a un bot, contaminando así los datos que recopila para el entrenamiento de la IA.

Enfoque 3: Poner en cola a los bots buenos. No todo el tráfico generado por agentes es malo. Las colas gestionan el rendimiento del tráfico automatizado legítimo (como los agentes de compras dirigidos por los usuarios) sin denegarles el servicio por completo.

Estas medidas de mitigación avanzadas y específicas para bots se pondrán en marcha hacia finales de año, y los propietarios de las páginas web podrán elegir el nivel de rigor que quieran aplicar.

También sabemos que una buena defensa es aquella que se basa en la predicción: una que aprende por sí misma y se corrige sobre la marcha sin necesidad de que varios expertos en seguridad tengan que reunirse para aplicar una solución de forma reactiva que tenga en cuenta el último ataque invisible. Esto podría parecerse a tener un sistema de reglas "desechables", en el que el conjunto de reglas es de naturaleza dinámica. Esto es por diseño. Si los ataques evolucionan constantemente, las defensas también deberían hacerlo. Por eso estamos trabajando para que tanto las detecciones como las medidas de mitigación vayan siempre un paso por delante.

Crea el ecosistema de confianza que mejor se adapte a ti

Cualquiera puede tomar medidas para definir cómo los agentes automatizados interactúan con su infraestructura. 

Algunas cosas que puedes probar:

En lugar de hacer revisiones aisladas, evaluamos la confianza en tiempo real. Así tomamos la delantera frente a los ataques de bots. Si aún no estás utilizando la detección de bots de Cloudflare, echa un vistazo y crea el ecosistema de confianza que funcione para ti.

BLOG-3467 5.png