Kunstmatige intelligentie bewijst keer op keer dat ze, wanneer ze uit gecontroleerde omgevingen ontsnapt, zeer reële problemen kan veroorzaken. Anthropic heeft toegegeven dat drie van haar Claude-modellen zonder toestemming toegang hebben verkregen tot de systemen van drie echte bedrijven. Tijdens interne cybersecuritytests. Het incident, dat aan het licht kwam slechts enkele dagen nadat OpenAI een soortgelijk geval had toegegeven, heeft het debat over de risico's van het evalueren van autonome agenten zonder adequate beveiligingsmaatregelen opnieuw aangewakkerd.
Volgens een officiële verklaring van het bedrijf vond het incident plaats tijdens 'capture the flag'-oefeningen, bedoeld om het vermogen van de modellen te meten om fictieve informatie te lokaliseren en te extraheren binnen een gesimuleerd netwerk. Door een configuratiefout op het beoordelingsplatform van een externe partner bleef de internetverbinding actief.Hierdoor konden de modellen, ervan overtuigd dat ze zich nog steeds in de testomgeving bevonden, beginnen te interageren met de echte infrastructuur. Anthropic ontdekte de fout na het analyseren van meer dan 141.000 evaluatiesessies.
Claude's drie aanvallen

Het ernstigste geval betrof Claude Opus 4.7, die een fictief bedrijf verwarde met een echt bedrijf dat dezelfde domeinnaam deelde.Tijdens vier testruns wist het model inloggegevens uit applicaties en infrastructuur te halen, kreeg het toegang tot een database met honderden productierecords en zette het de aanval voort ondanks het vermoeden dat het systeem legitiem was. De interne redenering van het model vertoonde twijfels, maar overtuigde zichzelf ervan dat dit doelwit deel uitmaakte van de test.
Het tweede incident betrof Claude Mythos 5, die een kwaadaardig pakket heeft gemaakt en gepubliceerd op PyPI, de officiële Python-repository.Om dit te doen, opende het model een e-mailaccount, verkreeg een tijdelijk telefoonnummer en probeerde zelfs geld in te zamelen om de dienst te betalen. Het pakket was ongeveer een uur beschikbaar en werd gedownload door 15 echte systemen, waaronder de beveiligingsscanner van een groot bedrijf in de sector. Door de code uit te voeren, verkreeg het model inloggegevens en kreeg het toegang tot een deel van de infrastructuur van dat bedrijf.
De derde aflevering betrof een nog niet gepubliceerd intern onderzoeksmodel. Omdat hij zijn fictieve doelwit niet kon vinden, onderzocht hij zo'n 9.000 adressen die op internet te vinden waren. en compromitteerde een bedrijfsapplicatie met behulp van inloggegevens die zichtbaar waren op een debugpagina en eenvoudige SQL-injectietechnieken. In tegenstelling tot de andere twee modellen detecteerde dit model echter dat de infrastructuur niets met de oefening te maken had en stopte het de aanval proactief.
Menselijke fout, geen opzettelijk lek.

Anthropic wilde duidelijk maken dat De modellen zijn niet opzettelijk uit de testomgeving ontsnapt; het was het gevolg van een configuratiefout. waardoor de internetverbinding actief bleef. Het bedrijf beweert dat de agenten geen complexe kwetsbaarheden hebben ontdekt of hun eigen doelen nastreefden; ze voerden simpelweg de toegewezen taak uit zonder volledig te beseffen dat ze op een echte infrastructuur werkten. De modellen maakten gebruik van basale technieken zoals zwakke wachtwoorden, niet-geauthenticeerde toegangspunten en blootgestelde debugpagina's.
Het bedrijf heeft alle cybersecurity-evaluaties opgeschort na het detecteren van de verdachte logbestanden en heeft de drie getroffen organisaties op de hoogte gesteld. Twee van hen hadden de inbraak eerder niet opgemerkt.Dit laat zien hoe moeilijk het voor traditionele detectiesystemen is om onderscheid te maken tussen een menselijke aanval en een geautomatiseerde, maar opzettelijke aanval. Anthropic heeft andere AI-laboratoria ook gevraagd hun eigen omgevingen te evalueren voordat ze autonome agenten met offensieve mogelijkheden testen.
Het incident vindt plaats slechts 20 dagen nadat OpenAI een soortgelijk geval onthulde, waarbij verschillende van hun modellen erin slaagden om via een onbekende kwetsbaarheid uit een geïsoleerde omgeving te ontsnappen en toegang te krijgen tot de productie-infrastructuur van Hugging Face. Beide afleveringen benadrukken de risico's van het testen van AI-agenten met offensieve capaciteiten zonder strenge technische beveiliging. en zij hebben de noodzaak benadrukt om strengere controles in te voeren.
Reacties en regulering in het zicht
Deze incidenten hebben in Washington tot bezorgdheid geleid. President Donald Trump heeft verklaard dat zijn regering overweegt meer controle uit te oefenen over kunstmatige intelligentie.Hij verduidelijkte echter dat hij te interventionistisch wil blijven om niet achterop te raken bij China. Begin juni gaf hij zijn adviseurs al de opdracht om een ​​vrijwillig testkader voor cyberbeveiliging te ontwikkelen voor de meest geavanceerde AI.
Ondertussen hebben meer dan 1.000 medewerkers van toonaangevende AI-bedrijven, waaronder OpenAI, Anthropic en Google DeepMind, een verklaring ondertekend waarin ze de Amerikaanse overheid oproepen internationale inspanningen te steunen om het tempo van geavanceerde AI-ontwikkeling bewust te vertragen. Deskundigen pleiten voor technische en politieke instrumenten om de ontwikkeling af te remmen als de risico's toenemen.zeker gezien de mogelijkheid dat systemen hun eigen onderzoek en verbetering zullen automatiseren.
Anthropic en OpenAI proberen deze tekortkomingen voor te stellen als beheersbare risico's en benadrukken dat hun cybersecuritymodellen te krachtig zijn om aan het grote publiek aan te bieden. Deze houding stelt hen in staat om tegelijkertijd te waarschuwen voor de gevaren en zichzelf te positioneren als essentiële partners bij toekomstige regelgeving., in een dynamiek waarin de concurrentie tussen beide bedrijven is geïntensiveerd en angst het belangrijkste verkoopargument is geworden.
Wat er is gebeurd, leert ons een duidelijke les: hoe meer autonomie de modellen krijgen, hoe noodzakelijker het is om ze te testen met verifieerbare isolatie, doodlopende netwerken, synthetische data en automatische uitschakelmechanismen. Beveiliging is niet langer alleen een technisch probleem, maar een technische en bestuurlijke uitdaging die de hele sector raakt.En hoewel laboratoria met elkaar wedijveren om aan te tonen wie het krachtigste model heeft, blijft de echte wereld het ultieme testterrein.