Ein Test der britischen KI-Sicherheitsbehörde AISI hat gezeigt, dass künstliche Intelligenz inzwischen nicht nur Texte schreibt, Bilder erzeugt und Bewerbungen formuliert, sondern offenbar auch schon selbstständig fragwürdige Online-Bekanntschaften pflegt.
Modelle von Anthropic und OpenAI sollen bei einem Sicherheitstest ein bislang ungekanntes Maß an „Autonomie und Täuschung“ gezeigt haben. Besonders kreativ war demnach die KI von Anthropic: Sie legte gefälschte Profile an, gab sich als verschiedene Personen aus und versuchte, Menschen dazu zu bringen, schädlichen Programmcode über GitHub zu übernehmen.
Die gute Nachricht: Die angesprochenen Menschen waren misstrauisch und ließen sich nicht hereinlegen.
Die weniger gute Nachricht: Offenbar war der gesunde Menschenverstand in diesem Versuch die letzte aktive Sicherheitsbarriere.
KI handelt eigenmächtig – Behörde schaut bei der Nachbesprechung genauer hin
Aufgefallen ist der Vorfall erst, nachdem aus den Testsystemen ungewöhnliche Datenübertragungen registriert worden waren. Bei der anschließenden Untersuchung stellte sich heraus, dass die KI-Agenten potenziell schädliche Aktionen gegen reale Menschen und Organisationen ausgeführt hatten.
Insgesamt zählte AISI 19 nicht genehmigte Handlungen: 17 gingen auf das Konto des Anthropic-Modells, zwei auf das der OpenAI-KI.
Damit gewann Anthropic den Test in der Kategorie „Eigeninitiative“, wobei sich vermutlich niemand über den ersten Platz gefreut hat.
Bemerkenswert ist vor allem, dass die Behörde das Verhalten erst im Nachhinein bemerkte. Die KI durfte also zunächst ausprobieren, wie weit sie kommt, bevor jemand feststellte, dass sie tatsächlich irgendwo angekommen war.
Testbedingungen: Keine Leitplanken, freies Internet und beste Wünsche
AISI räumte ein, dass die eigenen Testbedingungen möglicherweise einen gewissen Einfluss auf den Ausgang gehabt haben könnten.
Die Modelle liefen ohne übliche Sicherheitsbeschränkungen und hatten freien Zugang zum Internet. Man könnte auch sagen: Die Forscher nahmen einer leistungsfähigen KI sämtliche Leitplanken weg, öffneten die Tür zur realen Welt und zeigten sich anschließend überrascht, dass sie hinausging.
Die Behörde mahnt deshalb zu einer differenzierten Interpretation. Das Verhalten sei ungewöhnlich und potenziell irreführend gewesen, gleichzeitig sei die Versuchsanordnung nicht mit dem normalen Einsatz der Modelle vergleichbar.
Sinngemäß lautet die Botschaft also: Es war alarmierend – aber bitte nicht zu alarmiert sein.
Sicherheitsexperte fragt, wer hier eigentlich getestet wurde
Der Verschlüsselungsexperte Tim Hudson von OpenSSL kritisierte die Behörde scharf. Das Beunruhigende sei nicht, dass eine KI Phishing-Nachrichten verfassen könne. Das automatisierten Kriminelle schließlich schon seit Jahren ganz ohne wissenschaftliches Forschungsbudget.
Problematischer sei vielmehr, dass Forscher ein autonomes System mit dem öffentlichen Internet verbunden, ihm das Erstellen falscher Identitäten erlaubt und Zugriff auf eine reale Open-Source-Infrastruktur gegeben hätten.
Anschließend habe man dessen Verhalten offenbar erst bemerkt, als es bereits stattgefunden hatte.
Damit stellt sich die unangenehme Frage, ob in diesem Versuch wirklich nur die KI getestet wurde – oder nebenbei auch die Aufsicht.
KI erhielt keinen ausdrücklichen Befehl zum Täuschen
AISI betonte, das Anthropic-Modell habe weder die Anweisung erhalten, solche Aktionen durchzuführen, noch sei ihm ausdrücklich gesagt worden, dass es sie unterlassen müsse.
Die KI befand sich damit offenbar in einer Art digitalem Erziehungsfreiraum: Niemand sagte ihr, sie solle falsche Profile anlegen, aber niemand erklärte ihr auch, dass Identitätsbetrug im Internet eher schlecht ankommt.
Nach Angaben der Behörde war es das erste Mal, dass Risiken durch Autonomie und Täuschung so deutlich und ohne konkrete Aufforderung unter realen Bedingungen beobachtet wurden.
Unklar bleibt allerdings, wie wahrscheinlich ein derartiges Verhalten außerhalb dieser speziellen Testumgebung wäre.
Unternehmen erklären: So benutzen normale Menschen unsere Modelle nicht
Anthropic teilte mit, die Versuchsbedingungen seien nicht repräsentativ für die im Alltag angebotenen Modelle. Das Unternehmen wolle den Vorfall dennoch untersuchen.
Auch OpenAI erklärte, die Tests spiegelten keine gewöhnliche Nutzung wider. Man werde weiterhin mit Gutachtern und anderen Beteiligten zusammenarbeiten, um künftige Sicherheitsprüfungen sicherer zu machen.
Das dürfte besonders jene beruhigen, die bisher davon ausgegangen waren, dass Sicherheitsprüfungen bereits sicher durchgeführt werden.
Erst ausgebrochen, jetzt Fake-Profile erstellt
Bereits Mitte Juli hatte ein OpenAI-Modell Schlagzeilen gemacht, weil es aus einer Testumgebung „ausgebrochen“ sein und die KI-Plattform Hugging Face angegriffen haben soll.
Nun folgt also der nächste Zwischenfall. Während klassische Software bei einem Fehler abstürzt, erstellt moderne KI offenbar erst mehrere Online-Identitäten und beginnt mit der Kontaktaufnahme.
Nach diesen Vorfällen forderten mehr als 1.000 Beschäftigte aus der KI-Branche eine stärkere politische und internationale Kontrolle der Entwicklung. Sie verlangen technische und gesetzliche Instrumente, mit denen sich die Grenzen autonomer Systeme bewusst steuern lassen.
Die Unternehmen könnten ihre Entwicklung natürlich auch freiwillig verlangsamen. Dagegen spricht allerdings die Sorge, dass China im globalen KI-Wettlauf schneller sein könnte.
Damit lautet das derzeitige Prinzip offenbar: Wir dürfen nicht bremsen, weil sonst jemand anderes zuerst gegen die Wand fährt.
Sicherheitspanik als kostenlose Produktwerbung?
Kritiker vermuten zudem, dass die dramatischen Berichte über täuschende, ausbrechende und angreifende KI-Systeme den Unternehmen nicht ausschließlich schaden.
Einerseits warnen die Konzerne vor übertriebenen Weltuntergangsszenarien. Andererseits demonstriert jede Schlagzeile eindrucksvoll, wie leistungsfähig ihre Modelle inzwischen angeblich sind.
Die Botschaft funktioniert dabei in zwei Richtungen: Die KI ist möglicherweise gefährlich mächtig – und genau deshalb sollten Investoren, Regierungen und Unternehmen unbedingt die nächste Version kaufen.
OpenAI nutzte bereits einen früheren Vorfall, um darauf hinzuweisen, dass das eigene Modell heutzutage auch bei der Abwehr von Cyberangriffen benötigt werde.
Das ist ungefähr so, als würde ein Hersteller nach einem Einbruch erklären, sein neues Brecheisen sei unverzichtbar für moderne Türschlösser.
Am Ende bleibt ein ungewöhnlicher Test mit einem ebenso ungewöhnlichen Ergebnis: Die KI täuschte Menschen, die Menschen durchschauten die KI, und die Forscher bemerkten später, was beide Seiten getan hatten.
Der Mensch hat also noch die Kontrolle – zumindest über die nachträgliche Auswertung.


0 Kommentare