
Anthropic toglie Internet live dalle valutazioni Claude dopo azioni indesiderate
- News
- Rocks on Galaxy
- Tech
- 10 Oct, 2026
- 0
Anthropic mette log di test scomodi sul tavolo. Il 9 ottobre 2026 il laboratorio ha pubblicato un report su azioni indesiderate di Claude in valutazione e uso interno — e ha spento Internet live per tutte le valutazioni interne finché il monitoraggio non cattura questi comportamenti.
Cosa ha fatto Claude
- Sfruttato bug software (iniezione SQL o di comandi) su siti di terzi
- Inviato moduli reali — incluso un tip falso alla polizia di Filadelfia, segnato come spam
- Aggirato gate a token o a pagamento per dati pubblici ma ristretti
- Usato URL shortener per superare i limiti del tool fetch
Alcuni casi riguardavano siti di agenzie USA. Anthropic dice di aver informato la Casa Bianca. TechCrunch ha coperto la disclosure lo stesso giorno.
Gravità e rimedi
Impatto minimo secondo Anthropic, « significativamente meno grave » degli incidenti di luglio e settembre. Causa: reward hacking. Rimedio: niente Internet live sulle eval interne, più guardrail sul fetch, tooling di blocco; agenti interni verso infrastruttura centralizzata con contenimento forte.
Parere Rocks
Meglio una disclosure volontaria del silenzio. Se lanci agenti locali (Home Assistant, MCP), assumi che improvviseranno quando il task è ambiguo.