Una de las dificultades más incómodas de la seguridad en inteligencia artificial es que, para saber si un modelo puede producir contenido dañino, muchas veces hay que ponerlo a prueba y observar qué genera. Pero ese criterio deja de funcionar cuando el contenido en cuestión es ilegal. Un equipo de MIT y la organización Thorn propuso una alternativa: auditar el modelo sin pedirle nunca que produzca la salida prohibida.
El trabajo se enfocó en modelos generativos de código abierto que pueden ser reajustados para tareas específicas mediante adaptaciones livianas. Esa flexibilidad volvió más fácil personalizarlos para usos legítimos, pero también para fines dañinos. En este caso, los investigadores buscaron detectar si un modelo había sido ajustado para producir material de abuso sexual infantil, un terreno en el que la evaluación tradicional choca con límites legales y éticos evidentes.
En lugar de mirar imágenes generadas, la técnica examina cómo cambió el funcionamiento interno del modelo después del ajuste. El método, que los autores llaman Gaussian probing, introduce datos aleatorios y analiza cómo esas señales se transforman dentro de distintas capas del sistema. La idea es que esas huellas internas permiten inferir si el modelo fue especializado para una capacidad dañina, aunque nunca se lo lleve hasta la etapa final de generación. Según MIT News y el preprint enlazado por la propia nota, el procedimiento distinguió con precisión total, dentro de su conjunto de prueba, entre adaptaciones seguras y adaptaciones diseñadas para producir ese tipo de material ilegal.
La importancia del resultado no está solo en el caso concreto. También ofrece una salida a un problema más amplio: cómo auditar miles de variantes de modelos generativos sin depender siempre de pruebas manuales, costosas o psicológicamente riesgosas para quienes evalúan. Si un enfoque así funciona de manera robusta, plataformas que alojan modelos abiertos podrían detectar adaptaciones peligrosas antes de que se distribuyan con más amplitud, y sumar una capa extra de control en un punto donde hoy hay pocos instrumentos prácticos.
Al mismo tiempo, conviene leer el hallazgo con cautela. El trabajo fue presentado en un workshop asociado a ICML y circula como prepublicación en arXiv, no como un artículo ya consolidado en una revista revisada por pares. Además, la precisión reportada depende del conjunto de modelos y adaptaciones usados en la prueba. Queda por ver cómo responde el método frente a más arquitecturas, estrategias para esquivar la detección y escenarios reales de despliegue. Aún con esas limitaciones, el estudio plantea una idea con valor público claro: en ciertos riesgos de IA, la forma más útil de evaluar un sistema puede ser no dejarlo generar nunca aquello que se quiere impedir.
New method aims to keep kids safe from illegal AI-generated content · MIT News Research
MIT News | Massachusetts Institute of Technology · Imagen acompañante del artículo fuente; atribución preservada · Fuente de imagen
Suriyakumar, V. M., Sekhari, A., Stempfle, L., Wang, R., Simpson, M., Portnoff, R., Ghassemi, M., & Wilson, A. C. (2026). Evaluation without Generation: Non-Generative Assessment of Harmful Model Specialization with Applications to CSAM (Version 1). arXiv. https://doi.org/10.48550/arXiv.2604.25119
Relacionadas por categoría
Ver masUn sistema ayuda a anticipar cuándo puede fallar un vehículo autónomo
Un método del MIT traduce en conceptos comprensibles parte del razonamiento de un vehículo autónomo y ayuda a que humanos anticipen mejor sus errores.
Un análisis de 1.700 lenguas sugiere que la gramática no evoluciona al azar
Un estudio a gran escala encontró apoyo estadístico fuerte para parte de los llamados universales del lenguaje y sugiere que muchas lenguas tienden a converger en soluciones gramaticales parecidas.
Una nueva técnica logra esquivar defensas modernas en procesadores
Un estudio de MIT y USENIX Security 2026 muestra que una ventana de apenas unas instrucciones puede reabrir ataques contra procesadores Intel y AMD incluso después de las mitigaciones aplicadas tras Spectre.
Más de la misma fuente
Ver masRáfagas de ruido rosa reforzaron ondas de líquido cerebral durante el sueño
Un estudio en adultos sanos mostró que breves sonidos sincronizados con ondas lentas del sueño aumentaron el flujo de líquido cefalorraquídeo medido con resonancia magnética.
Nanoantenas activadas por campos magnéticos frenan glioblastoma en pruebas preclínicas
Un estudio en células de pacientes y ratones probó nanoantenas que convierten campos magnéticos externos en señales eléctricas localizadas contra glioblastoma.
Un método electroquímico obtiene hidrógeno puro a partir de amoníaco
Un equipo del MIT probó una celda con membrana de paladio que extrae hidrógeno de portadores químicos como el amoníaco a menor temperatura.
Más del mismo autor
Ver masCómo las moscas ayudan a desentrañar la adaptación a sustancias tóxicas
Un experimento con moscas y edición genética muestra que la resistencia a una toxina vegetal depende de varios genes y puede estudiarse combinando métodos complementarios.
Una batería cuántica de laboratorio convirtió luz en corriente con un efecto colectivo
Un prototipo de microcavidad mostró que la potencia de carga y descarga puede crecer más rápido que el número de moléculas activas. Aún está lejos de una batería para dispositivos.
Veinticuatro especies nuevas revelan cuánto falta conocer del fondo del Pacífico
Un equipo describió 24 especies nuevas de pequeños crustáceos en una región abisal del Pacífico. El hallazgo ayuda a medir la biodiversidad antes de cualquier intervención en el fondo marino.