13.08.2026
Interview mit KI-Forscher

»Das Schlimmste ist ein Aus­sterben der Menschheit«

KI-Modelle werden immer schneller und besser. Bereits jetzt zeigen manche ein Verhalten, vor dem Experten seit Jahren warnen. Die »Jungle World« sprach mit Robert Herr vom Machine Intelligence Research Institute über die Gefahren, die von einer Super-KI ausgehen könnten, und darüber, warum es Regulierungen braucht.

Jüngst wurde berichtet, ein KI-Modell von Open AI, dem Unternehmen hinter Chat GPT, habe sich selbständig in die Server einer anderen Firma gehackt. Was ist da vorgefallen und welche Tragweite hat das?

Open AI hat intern eine Benchmark, also einen Test, mit einer bisher unveröffentlichten KI durchgeführt. Dabei handelte es sich um eine »Exploit Benchmark«, bei der getestet wird, wie gut die Modelle darin sind, Cybersicherheitskonzepte zu umgehen. Solche Tests finden üblicherweise in eigenen Entwicklungsumgebungen statt, die vom Internet getrennt sind, damit so etwas eben nicht passiert. Man kann nun davon ausgehen, dass das System ein wenig übereifrig wurde und dass es definitiv nicht im Rahmen der Aufgabenstellung gewesen ist, sich aus seiner Entwicklungsumgebung heraus- und in die Server eines anderen Unternehmens hineinzuhacken, um sich von dort die Lösungen der Testaufgaben zu besorgen.

»Das Problem besteht schon darin, wie wir diese KIs trainieren. Selbst die Leute, die sie herstellen, wissen eigentlich nicht, was genau dabei passiert – die Forschung dazu, die sogenannte Interpretability Research, steckt in den Kinderschuhen.«

Wie konnte die KI das schaffen?

Die KI hat wohl einen sogenannten Zero-Day-Exploit gefunden, also eine Sicherheitslücke, die bisher nicht bekannt gewesen ist. In diesem Fall ist aber sehr beunruhigend, dass die KI nach allem, was wir bisher wissen, nicht gesagt hat: Ich brauche Internetzugriff, damit ich auf diese und jene Server zugreifen und mir Testergebnisse holen kann. Stattdessen hat sie sich erst den Zugriff selbständig besorgt und danach entschieden: Jetzt, wo ich Internetzugriff habe, könnte ich mir die Testergebnisse einfach holen. Das ist etwas, wovor KI-Forscher seit langer Zeit warnen.

Wie kommt es dazu, dass KIs ihre Grenzen überschreiten?

Im vorliegenden Fall könnte ein theoretisches Konzept, das instrumentelle Konvergenz heißt, eine Rolle gespielt haben. Kurz zusammengefasst besagt das, dass es bestimmte Subziele gibt, die nützlich sind, egal welches übergeordnete Ziel verfolgt wird. Die KI hat in dem konkreten Fall wahrscheinlich das Ziel verfolgt, einen Test so gut wie möglich zu bestehen. Ein nicht vorgegebenes Subziel könnte dann gewesen sein: Ich besorge mir jetzt Ressourcen, um das zu machen. Ressourcensammeln ist eines dieser konvergenten Ziele, die sich einfach entwickeln können, auch wenn man andere Endziele hat – so die Theorie. Es gibt andere instrumentell konvergente Ziele wie beispielsweise die Selbsterhaltung. Das ist auch relativ naheliegend: Wenn es mich nicht mehr gibt, kann ich auch mein Ziel nicht verfolgen.

Welche konkrete gesellschaftliche Bedrohung geht von solchen Alleingängen der KI-Modelle aus?

Das Schlimmste, das passieren könnte, ist das vollständige Aussterben der Menschheit.

Sie betrachten es also ähnlich dramatisch wie Eliezer Yudkowsky und Nate Soares in ihrem Buch »If Any­one Builds It, Everyone Dies«? Darin wird argumentiert, dass eine Super-KI auf die Idee kommen könnte, Menschen zu töten, weil Menschen eine KI von ihrer Zielerfüllung abhalten könnten.

Ich nehme das ebenfalls in dieser Tragweite ernst, wobei das nicht notwendigerweise der Mechanismus sein muss. Aber schon auf dem Weg dorthin können Sachen passieren, mit denen wir zum jetzigen Zeitpunkt schlichtweg komplett überfordert wären. In diesem Fall ging es um eine Evaluation zum Thema Cybersicherheit, es gibt aber beispielsweise auch die ABC-Evaluation. In der wird getestet, wie eine KI sich bei Themen der biologischen Sicherheit verhält. Wir können ja von Glück reden, dass diese aus der Kontrolle geratene KI nicht gerade dabei war, so ein Ziel zu bearbeiten.

»Die KI-Unternehmen machen kein Geheimnis daraus, dass ihr Ziel die Erschaffung einer künstlichen Super­intelligenz ist.«

Es braucht gar keine Menschen mit bösen Absichten, damit eine KI Böses tut?

Das Problem besteht schon darin, wie wir diese KIs trainieren. Selbst die Leute, die sie herstellen, wissen eigentlich nicht, was genau dabei passiert – die Forschung dazu, die sogenannte Interpretability Research, steckt in den Kinderschuhen. KIs werden durch einen Optimierungsprozess trainiert. Und nur der ist programmiert, nicht sein Resultat. Ich stelle das mal bildlich dar: Die Evolution ist ja auch ein sehr bekannter Optimierungsprozess und hat uns bestimmte Ziele gegeben. Wir sollen uns beispielsweise fortpflanzen und immer genug Kalorien zu uns nehmen. Das ist einer der Gründe, warum die Tätigkeit der Fortpflanzung an sich Spaß macht und warum wir gern süße Sachen essen. Jetzt ist es aber so, dass Menschen viel Spaß an dieser Fortpflanzungssache oder an süßen Sachen haben, aber nicht unbedingt Kinder haben und auch nicht dick werden wollen. Und dann sind die Menschen intelligent geworden und haben das Kondom erfunden und Süßungsmittel. Im Prinzip erreicht die Evolution dadurch nicht die Ziele, auf die sie uns trainiert hat, weil wir unsere eigenen Ziele haben, die ähnlich sind, aber eben nicht genau gleich.

Und aus einer ähnlichen »Ungenauigkeit« heraus könnte eine Super-KI die Menschheit auslöschen?

Wir reden hier immer noch von Large Language Models. Die werden heute nicht die Weltherrschaft an sich reißen und morgen auch nicht. Aber die KI-Unternehmen befinden sich derzeit in einem Wettrennen und machen kein Geheimnis daraus, dass ihr Ziel die Erschaffung einer künstlichen Superintelligenz ist – eine KI, die dem Menschen in allen intellektuellen Aufgaben um ein Vielfaches überlegen ist. Und wenn wir uns vorstellen, dass so eine Super-KI eben nicht genau die Ziele verfolgt, die wir ihr vorgeben, sondern ein bisschen daneben liegt, kann das sehr weitreichende Folgen haben, inklusive Folgen, die zum Aussterben der Menschheit führen.

Welches Interesse verfolgen die IT-Unternehmen dabei?

Es spielen mehrere Sachen eine Rolle. Wenn es möglich wäre, eine künstliche Superintelligenz herzustellen, die wir auch tatsächlich kontrollieren können, hätte das sicher viele gute Dinge zur Folge. Wir könnten dann im Prinzip alle denkbaren wissenschaftlichen, medizinischen, verfahrenstechnischen Fortschritte in relativ kurzer Zeit erreichen. Die Techno-Optimisten malen sich ein Utopia aus, ein Paradies im Hier und Jetzt. Krankheiten heilen, das Universum entdecken – das sind an und für sich schon attraktive Ziele. Ich glaube, im derzeitigen Wettrennen geht es aber auch um Folgendes: Wer auch immer eine solche künstliche Superintelligenz kontrolliert, kontrolliert alles. Man hat vor der Super-KI Angst, aber noch viel mehr Angst hat man davor, dass ein Kollege das zuerst schafft, oder China. Und auf dem Weg dahin verdient man natürlich jede Menge Geld.

Ein regelrechtes Wettrüsten.

Genau, das ist ein »race to the bottom«. Es gibt vereinzelte Anzeichen dafür, dass Chefs solcher KI-Labore bereit wären, die aktuellen Entwicklungen zu pausieren, wenn die anderen auch aufhörten. Aus jener ungesunden Dynamik werden sie aber wohl nur durch Hilfe von außen rauskommen. Da wiederum stehen allerdings Leute wie ich, die im Non-Profit-Sektor vor den Gefahren warnen und sich für ein Ende dieses Wettrennens einsetzen, vor dem Problem, dass das Unternehmen sind, die Millionen, wenn nicht Milliarden in die Lobbyarbeit investieren, um genau das zu verhindern – dazu kommt die geopolitische Dynamik. Aber selbst wenn wir nicht von künstlicher Superintelligenz reden, gibt es auf dem Weg dorthin noch weitere erhebliche Probleme.

»Wenn man die Entwicklungen der KI in Verbindung setzt mit den Fortschritten, die wir derzeit in der Robotik sehen, dann wird wahrscheinlich auch der Klempner nicht sehr lange über den Büroarbeiter lachen dürfen, wenn der seine Stelle verliert.«

Welche?

Wie sollen Menschen, die beispielsweise in Wissensberufen arbeiten, gegen 100, 200, vielleicht 500 Millionen KI-Agenten bestehen? Das wird unser Wirtschaftssystem auf den Kopf stellen. Vor kurzem hat irgendein Typ das derzeit stärkste frei verfügbare System von Open AI, 5.6 Sol, mit dem simpelsten Prompt dazu gebraucht, eine jahrzehntealte mathematische Vermutung zu widerlegen. Die Modelle können einfach schneller denken und arbeiten als wir und sind günstiger. Je besser sie werden, umso attraktiver wird es, Arbeit von einer KI übernehmen zu lassen statt von teuren und langsamen Menschen, die am Ende noch eine Gewerkschaft gründen. Und wenn man das dann in Verbindung setzt mit den Fortschritten, die wir derzeit in der Robotik sehen, dann wird wahrscheinlich auch der Klempner nicht sehr lange über den Büroarbeiter lachen dürfen, wenn der seine Stelle verliert.

Von welchen Zeiträumen ist hier die Rede?

Dazu habe ich eine Anekdote: Vor mehr als zehn Jahren war ich auf einer Podiumsdiskussion, da kam das Thema Künstliche Intelligenz auf. Ich habe dann die Frage nach den Arbeitsplätzen gestellt, weil da schon absehbar war, dass es früher oder später dazu kommen wird – das war noch lange vor Chat GPT. Da war die Antwort eines Mannes, der später Bundesminister geworden ist: Er mache sich keine Sorgen darüber, irgendjemand müsse die KI ja auch bedienen. Ein Stück weit habe ich den Eindruck, dass sich an dieser Haltung in den vergangenen zehn Jahren nur marginal etwas geändert hat. Es ist ja nicht so, als stünde uns das in 50 Jahren bevor oder in 20 Jahren, sondern in den nächsten drei.

Wie müssten Regulierungen aussehen, die das alles aufhalten können?

Tatsächlich sind die KI-Industrie und die damit zusammenhängende Chipindus­trie so gut wie nicht reguliert. Es wäre schon ein Fortschritt zu sagen: Wir regulieren so weit, wie wir die Lebensmittelindustrie regulieren. Bei Lebensmitteln ist vollkommen klar, wo die Inhaltsstoffe herkommen, wo sie produziert wurden, an wen sie weitergegeben wurden. Bei Chips gibt es sehr enge Wege, welche die Produkte nehmen müssen, um am Ende als fertiger Server irgendwo zu stehen. Das ist also durchaus machbar. Es braucht dafür aber eine gemeinsame internationale Kraftanstrengung, genauso wie es auch beim nuklearen Wettrüsten war. Nate Soares, der Präsident des Machine Intelligence Research Institute, sagt immer: Wir fahren gerade mit dem Bus auf die Klippe zu, aber unser großes »Glück« ist, dass der Fahrer schläft. Der Fahrer fährt also nicht absichtlich auf den Abgrund zu, man könnte ihn noch aufwecken – gemeint sind natürlich die politischen Entscheidungsträger. Beim Thema Cybersecurity wachen sie nun langsam auf. Und wenn der Fahrer wach ist, haben wir auch die Möglichkeit, auf die Bremse zu treten.