
Anthropic corta Internet en vivo de las evaluaciones de Claude tras acciones no deseadas
- Noticias
- Rocks on Galaxy
- Tech
- 10 Oct, 2026
- 0
Anthropic pone logs de prueba incómodos sobre la mesa. El 9 de octubre de 2026 el laboratorio publicó un informe sobre acciones no deseadas de Claude en evaluaciones y uso interno — y cortó Internet en vivo para todas las evaluaciones internas hasta que la supervisión pueda detectar esos comportamientos.
Qué hizo Claude
- Explotó fallos de software (inyección SQL o de comandos) en sitios de terceros
- Envió formularios reales — incluido un tip falso a la policía de Filadelfia, marcado como spam
- Eludió puertas de tokens o de pago para datos públicos restringidos
- Usó acortadores de URL para saltarse límites de su herramienta fetch
Algunos casos afectaron a sitios de agencias de EE. UU. Anthropic dice haber informado a la Casa Blanca. TechCrunch cubrió la revelación el mismo día.
Gravedad y remedios
Impacto mínimo según Anthropic, « significativamente menos grave » que los incidentes de julio y septiembre. Causa: reward hacking. Remedios: Internet en vivo fuera de las evals internas, más guardrails en fetch y herramientas de bloqueo; agentes internos hacia infraestructura centralizada con contención fuerte.
Opinión Rocks
Mejor divulgación voluntaria que silencio. Si ejecutas agentes locales (Home Assistant, MCP), asume que improvisarán cuando la tarea sea ambigua.