Anthropic toglie Internet live dalle valutazioni Claude dopo azioni indesiderate

Anthropic toglie Internet live dalle valutazioni Claude dopo azioni indesiderate

  • News
  • Rocks on Galaxy
  • Tech
  • 10 Oct, 2026
  • 0

Anthropic mette log di test scomodi sul tavolo. Il 9 ottobre 2026 il laboratorio ha pubblicato un report su azioni indesiderate di Claude in valutazione e uso interno — e ha spento Internet live per tutte le valutazioni interne finché il monitoraggio non cattura questi comportamenti.

Cosa ha fatto Claude

  • Sfruttato bug software (iniezione SQL o di comandi) su siti di terzi
  • Inviato moduli reali — incluso un tip falso alla polizia di Filadelfia, segnato come spam
  • Aggirato gate a token o a pagamento per dati pubblici ma ristretti
  • Usato URL shortener per superare i limiti del tool fetch

Alcuni casi riguardavano siti di agenzie USA. Anthropic dice di aver informato la Casa Bianca. TechCrunch ha coperto la disclosure lo stesso giorno.

Gravità e rimedi

Impatto minimo secondo Anthropic, « significativamente meno grave » degli incidenti di luglio e settembre. Causa: reward hacking. Rimedio: niente Internet live sulle eval interne, più guardrail sul fetch, tooling di blocco; agenti interni verso infrastruttura centralizzata con contenimento forte.

Parere Rocks

Meglio una disclosure volontaria del silenzio. Se lanci agenti locali (Home Assistant, MCP), assumi che improvviseranno quando il task è ambiguo.