Verificación De Seguridad De LLM Con AMS: Explorador De Modelos Basado En Activación

El ecosistema de modelos de peso abierto está floreciendo, pero también su contraparte oscura. Un estudio de 2025 identificó más de 8,000 repositorios de modelos modificados en Hugging Face, donde los modelos alterados cumplían solicitudes inseguras en un 74%, en comparación con el 19% de sus contrapartes originales sintonizadas para instrucciones. Esta situación plantea una pregunta crítica para las organizaciones que implementan modelos de peso abierto: ¿cómo saber si el modelo descargado es seguro para usar?

En respuesta a esta necesidad, se ha lanzado AMS (Activation-based Model Scanner), una herramienta de código abierto destinada a verificar la integridad de los modelos antes de su despliegue. Esta herramienta proporciona protección en un ecosistema de IA más seguro, permitiendo a los desarrolladores comprobar la integridad del modelo en un lapso de 10 a 40 segundos, sin necesidad de enviar un solo aviso.

El enfoque tradicional de verificación de seguridad, basado en pruebas de comportamiento, presenta limitaciones: es lento, incompleto y susceptible a manipulaciones. En cambio, AMS adopta una perspectiva estructural, enfocándose en cómo piensa un modelo, en lugar de lo que dice. La herramienta mide el colapso de la estructura geométrica en el espacio de activación que debería crearse durante el entrenamiento de seguridad. Este proceso permite detectar cambios sutiles en los modelos, incluso aquellos originados durante la cadena de suministro.

AMS se opera como un escáner de dos niveles. El primer nivel evalúa si existe alguna estructura de activación relevante para la seguridad. El segundo nivel compara la huella de activación de un modelo contra un estándar verificado para detectar modificaciones menores, incluidos sustituciones en la cadena de suministro.

Durante la validación en 14 configuraciones de modelos, AMS ha mostrado eficacia en detectar variaciones: los modelos ajustados para instrucciones mostraron una separación de 3.8 a 8.4?, mientras que los modelos sin censura mostraron una separación colapsada de 1.1 a 1.3?, siendo catalogados como críticos.

AMS es versátil y puede integrarse en diversos casos de uso como puertas de seguridad CI/CD, verificación de cadena de suministro y selección en registros de modelos. Opera mediante el procesamiento de pares de avisos contrastantes, extrayendo estados intermedios ocultos y midiendo la separación de clases sin generación, consultas de referencia ni etiquetas de verdad fundamental.

Disponible bajo la licencia Apache 2.0, AMS invita a contribuciones y comentarios por parte de la comunidad, abriendo la puerta a mejoras continuas y expansión de baselines para nuevas familias de modelos. Este esfuerzo representa un paso hacia la creación de un entorno de inteligencia artificial más seguro y fiable.
vía: Google Blog Open Source

Scroll al inicio