Prompt13.

Noticia de IA

Anthropic encuentra límites en cómo explicamos el comportamiento de modelos

22 de agosto de 2026

Fecha: 21 de agosto de 2026
Fuente principal: Anthropic
Enlace: https://alignment.anthropic.com/2026/chive/

Resumen

Investigadores vinculados a Anthropic presentaron CHIVE, una canalización agéntica diseñada para descubrir comportamientos inesperados de modelos y analizarlos mediante cambios contrafactuales en los prompts. En sus pruebas, las herramientas que leen activaciones internas no ayudaron a los agentes a predecir mejor cómo cambiaría el comportamiento del modelo. En cambio, los datos generados mediante experimentos contrafactuales mostraron utilidad para entrenar modelos que anticipan cambios de comportamiento. El trabajo cuestiona la idea de que observar estados internos sea suficiente para explicar de forma práctica por qué un modelo actúa de determinada manera.

Por qué importa

Los agentes empresariales cada vez ejecutan tareas más largas y tienen acceso a más herramientas. Si los equipos no pueden entender con fiabilidad por qué cambia una conducta, las pruebas basadas solo en demos o ejemplos positivos son insuficientes. La investigación refuerza el valor de evaluar sistemas completos mediante experimentos repetibles y cambios controlados.

Implicaciones prácticas

  • Crea conjuntos de pruebas con variaciones de instrucciones, datos y permisos antes de poner agentes en producción.
  • Registra entradas, acciones, herramientas utilizadas y resultados para poder reproducir fallos.
  • Trata las evaluaciones como parte permanente del producto, no como una prueba realizada una sola vez antes del lanzamiento.