Saltar al contenido
Software Supply Chain Security

Alerta de estafas en WhatsApp: cómo funciona

WhatsApp Scam Alert

WhatsApp ha comenzado un despliegue beta limitado de una función opcional que busca frenar las estafas que llegan por mensajería: la alerta de estafas WhatsApp. La propuesta combina inteligencia artificial con un enfoque centrado en la privacidad, de modo que la detección ocurra en el dispositivo del usuario.

Según la compañía, esta herramienta no pretende “rodear” el cifrado de extremo a extremo, sino trabajar en paralelo. Así, el sistema revisa mensajes entrantes de remitentes que no están en la lista de contactos y, cuando detecta señales compatibles con estafas conocidas, muestra un aviso únicamente dentro del chat del destinatario.

Qué es la alerta y a quién puede afectar

La alerta de estafas WhatsApp está pensada para mensajes de personas no guardadas, es decir, remitentes que no forman parte de los contactos del usuario. Al activarla, WhatsApp descarga a la aplicación del usuario un modelo de aprendizaje automático que analiza el contenido recibido en busca de patrones asociados a estafas.

La clasificación no se limita a palabras sueltas. WhatsApp indica que el modelo usa la estructura conversacional y señales lingüísticas para estimar si un mensaje podría encajar en esquemas fraudulentos.

Modelo en el dispositivo: privacidad y cifrado

Uno de los puntos clave de esta función es dónde ocurre la evaluación. WhatsApp afirma que la detección se ejecuta enteramente en el dispositivo y que no envía automáticamente el contenido del mensaje a WhatsApp ni a su empresa matriz, Meta.

Cuando un mensaje se marca como sospechoso, el aviso aparece solo para el destinatario en el propio hilo de conversación. El remitente no recibe ninguna notificación y, por tanto, no puede inferir que su mensaje fue clasificado.

Esto reduce tanto el riesgo de exposición del contenido como la posibilidad de que la estafa se ajuste en tiempo real al saber que fue detectada.

Qué puedes hacer cuando se activa la alerta

Si la alerta señala un mensaje, el usuario tiene varias opciones dentro de la app. Entre las acciones disponibles se incluyen:

  • Bloquear el contacto o remitente.
  • Reportar el mensaje.
  • Ignorar el aviso y continuar con la conversación.
  • Marcar el chat como confiable para que no se muestren alertas similares en el futuro.

Además, cuando un usuario marca una conversación como confiable, puede optar por compartir los últimos cinco mensajes recibidos. WhatsApp plantea esta opción como una vía para mejorar la precisión del modelo, con un control explícito del usuario.

En otras palabras: la alerta existe, pero el usuario mantiene el mando sobre el siguiente paso.

Cómo asegura WhatsApp que el modelo sea el correcto

La beta también incluye un componente de verificación orientado a evitar que un modelo manipulado llegue a los dispositivos. WhatsApp explica que cada liberación del modelo debe registrarse antes de distribuirse en un sistema de transparencia de terceros, descrito como un ledger (registro) con características de solo anexado.

Para reforzar la integridad, cada lanzamiento viene acompañado por un manifiesto con hashes SHA-256 que abarcan los pesos del modelo y archivos relacionados. Ese manifiesto incluye un resumen (digest) firmado con claves Ed25519, administradas por Cloudflare y no por Meta.

En el dispositivo, WhatsApp indica que se realiza una verificación en cadena: el sistema comprueba la firma, contrasta el contenido con el registro de transparencia y confirma que los archivos descargados coinciden con los hashes publicados antes de ejecutar el modelo.

Analítica confidencial: qué datos se recopilan (y cuáles no)

Aunque el contenido no sale del dispositivo, WhatsApp necesita medir si la función realmente funciona. Para ello, diseñó lo que llama un pipeline de analítica federada confidencial.

La compañía asegura que este mecanismo solo recoge dos categorías de datos, siempre en términos agregados (conteos):

  • Con qué frecuencia se activan las alertas.
  • Qué acción tomó el usuario después del aviso, por ejemplo bloquear o marcar el chat como confiable.

Con este enfoque, el objetivo es mantener la privacidad mientras se obtienen señales útiles para evaluar el rendimiento del sistema.

Amenazas contempladas y resistencia a ataques

WhatsApp describe un modelo de amenazas que incluye escenarios como atacantes externos, insiders con infraestructura comprometida y riesgos de la cadena de suministro. En su visión, las defensas del pipeline estarían pensadas para que dirigir la información a un usuario específico requiera comprometer toda la cadena del sistema, no solo una parte.

Además, la forma en que se registra y firma la versión del modelo también busca reducir la superficie de ataque: si el modelo no cumple con las comprobaciones, no se permite su ejecución.

Cómo revisar la actividad de Scam Alert en la app

Para dar transparencia al usuario, WhatsApp planea que quienes utilicen la alerta de estafas WhatsApp puedan revisar un registro de actividad desde la propia aplicación. El acceso, según lo descrito, estará en:

Cuenta > Solicitar información > Actividad de Scam Alert

Ahí se mostraría, por cada mensaje escaneado, el resultado del análisis y la versión del modelo que tomó la decisión. De esta manera, no solo se recibe un aviso, sino que también existe un rastro verificable desde la interfaz.

Beta técnica y programa de recompensas por errores

WhatsApp recalca que el lanzamiento no es un producto final cerrado, sino un avance técnico temprano. La compañía indica que durante la beta la función seguirá evolucionando conforme se obtenga retroalimentación de investigadores y usuarios.

Para acompañar este ciclo, la empresa también señala que ampliará su programa de bug bounty para incluir la alerta de estafas.

Por qué esta función puede marcar diferencia

Las estafas en mensajería suelen aprovechar la urgencia y la confianza del usuario. Con la alerta de estafas WhatsApp, la idea es reducir el tiempo entre la llegada del mensaje y la advertencia, sin obligar al usuario a abrir enlaces o “comprobar” manualmente señales de fraude.

Al mismo tiempo, el diseño descrito intenta equilibrar seguridad y privacidad: clasificación local en el dispositivo, aviso solo para el destinatario, y analítica limitada a conteos de alertas y acciones posteriores.

En una fase beta, el enfoque real será comprobar cuán útil resulta para diferentes tipos de estafas y cómo se comporta el sistema frente a falsos positivos o conversaciones benignas.

Conclusión

La alerta de estafas WhatsApp es una función opcional que busca detectar mensajes sospechosos en tiempo real usando un modelo de aprendizaje automático ejecutado en el dispositivo. Si se activa, el destinatario ve una advertencia dentro del chat y puede tomar acciones como bloquear, reportar o marcar la conversación como confiable.

Además, WhatsApp incorpora mecanismos de verificación de versiones del modelo, analítica federada confidencial y la posibilidad de consultar el historial de actividad. Si la beta evoluciona con resultados positivos, esta capa adicional podría convertirse en una herramienta práctica para reducir el impacto de estafas en mensajería.

Fuente: https://www.securityweek.com/whatsapp-unveils-new-scam-alert-feature/