KI-KOLUMNE: Was ist AGI und was ändert sich damit im Gemeindeamt?

Anfang September ging eine Schlagzeile durch die Medien: OpenAI habe die „AGI-Ära“ ausgerufen, die Maschinen seien jetzt so gescheit wie wir. Aber was heißt das jetzt für uns? Die kurze Antwort: für Ihren Arbeitsalltag vorerst nichts. Aber es lohnt sich dennoch, genauer hinzuschauen.

Was passiert ist

Am 3. September 2026 hat OpenAI sein neues Modell GPT-6 vorgestellt, intern „Astra“ genannt. Es schneidet bei vielen Vergleichstests am besten ab und kann Software bedienen, wie es ein Mensch tun würde: Formulare ausfüllen, in Tabellen arbeiten, einen Ablauf mit mehreren Zwischenschritten alleine zu Ende bringen. Am Ende der Präsentation verabschiedete sich OpenAI-Präsident Greg Brockman mit dem Satz: „Welcome to the AGI era.“

AGI steht für „Artificial General Intelligence“, auf Deutsch meist „allgemeine künstliche Intelligenz“. Der Widerspruch aus der Forschung kam innerhalb von Stunden. Ein echter Fortschritt, sagten viele, aber AGI? Das sei nicht belegt. Belegen lässt es sich auch gar nicht. Die Technik ist dafür nicht zu schwach. Es hat schlicht niemand verbindlich festgelegt, was AGI bedeuten soll.

Das Wort ist älter als die Debatte

Was künstliche Intelligenz ist, wird seit den 1950er-Jahren diskutiert. Alan Turing hat die Definitionsfrage damals einfach umgangen und einen Test vorgeschlagen: Wenn ein Mensch im schriftlichen Gespräch nicht mehr erkennt, ob am anderen Ende eine Maschine sitzt, dann verhält sich die Maschine intelligent. Ob sie es auch ist, bleibt offen.

Das „General“ im Begriff AGI zielt auf Breite, nicht auf Leistung. Ein Schachcomputer hat schon 1997 den amtierenden Weltmeister geschlagen, kann aber sonst nichts. Ein Übersetzungsprogramm übersetzt. Eine allgemeine Intelligenz dagegen soll sich auch Aufgaben erschließen können, die bei ihrer Entwicklung niemand vorgesehen hat.

Dafür gibt es allerdings ein halbes Dutzend Definitionen, und sie passen nicht zusammen. Wikipedia spricht von einem Programm, das jede intellektuelle Aufgabe lernen kann, die ein Mensch ausführen kann. OpenAI selbst definiert AGI in seiner Gründungscharta als hochautonome Systeme, die Menschen bei den meisten wirtschaftlich wertvollen Arbeiten übertreffen. Google DeepMind hat 2023 ein Stufenmodell vorgeschlagen, von „entstehend“ bis „übermenschlich“. Eine Forschergruppe um Dan Hendrycks hat im Oktober 2025 versucht, das messbar zu machen: zehn kognitive Bereiche, jeder mit zehn Prozent gewichtet, verglichen mit einem gut ausgebildeten Erwachsenen. GPT-5 kam dabei auf 57 Prozent, mit einem sehr zerklüfteten Profil. Lesen und Rechnen auf menschlichem Niveau, beim Langzeitgedächtnis fast nichts.

Und dann ist da noch François Chollet, der Erfinder des ARC-Tests. Für ihn zählt weniger, was ein System kann, als wie schnell es etwas Neues lernt. Wenn ein Kind eine Regel nach zwei Versuchen kapiert und ein Modell dafür Millionen Beispiele braucht, dann hat das Modell in seinen Augen nicht Intelligenz bewiesen, sondern Trainingsaufwand.

Die Bestnote im Test und der Fall, der in keinem Lehrbuch steht

Wer in einer Gemeinde schon einmal Personal aufgenommen hat, kennt den Unterschied. Es gibt Bewerber, die jede Prüfung mit Auszeichnung bestehen und jeden Paragrafen auswendig können. Und es gibt Kollegen, die man nach drei Wochen in ein Referat setzen kann, das sie vorher nie gesehen haben, und die sich dort zurechtfinden. Die Prüfungsnote sagt über das Zweite erstaunlich wenig aus.

Genau darum geht es beim Streit um AGI. Die Anbieter messen Prüfungsnoten, und zwar sehr viele: Mathematik, Programmieren, Softwarebedienung, Fachwissen in Dutzenden Gebieten. In etlichen dieser Disziplinen liegen die Modelle inzwischen über dem Durchschnittsmenschen, das bestreitet niemand ernsthaft. Die meisten dieser Zahlen stammen allerdings vom Anbieter selbst; unabhängig nachgemessen wurden bisher nur wenige.

Der eine Test, der ausdrücklich das Lernen im laufenden Betrieb prüft, ist der schon erwähnte ARC-Test. Das Modell bekommt dort kleine Rätselspiele ohne Anleitung und ohne genanntes Ziel und muss die Regeln durch Ausprobieren herausfinden, so wie ein Mensch das könnte. Hier stammen die Zahlen ausnahmsweise nicht vom Anbieter, sondern von der Stiftung, die den Test betreibt, und ihr Ergebnis hängt auffallend stark davon ab, wie viel Hilfestellung das Modell bekommt. In der Standardversion des Tests, die für alle Anbieter gleich ist, löst es rund zwei Drittel der Aufgaben so sparsam wie ein Mensch. Mit einer Zusatzausstattung, die der Anbieter selbst beisteuert, sind es fast hundert Prozent. Am Modell ändert sich zwischen den beiden Durchläufen nichts. Die Betreiber des Tests fanden das beeindruckend, sahen darin aber keinen Beweis für AGI: Ihre Rätsel haben feste Regeln und ein abgeschlossenes Spielfeld, der Alltag hat beides nicht.

Bemerkenswert ist auch, was fehlt. OpenAI hat einen eigenen Test dafür, wie gut ein Modell wirtschaftlich wertvolle Arbeit erledigt, also genau das, was in der eigenen AGI-Definition steht. Für Astra wurde dazu kein Ergebnis veröffentlicht.

Warum das Wort so laut ist

Ein Teil der Forschung hält den Begriff grundsätzlich für irreführend. Sprachmodelle, so das Argument, lernen im Training nur, welche Wörter üblicherweise aufeinander folgen. Die Welt, auf die sich diese Wörter beziehen, haben sie nie gesehen. Dass der Text trotzdem verstanden wirkt, liegt an uns: Wir lesen in flüssige Sätze automatisch eine Absicht hinein. Andere Forscher verweisen darauf, dass Maschinen beim Schach und in der Mathematik längst vorne liegen, beim Stiegensteigen und beim Greifen eines unbekannten Gegenstands aber weiterhin scheitern. Yann LeCun, lange Jahre KI-Chef bei Meta, rechnet vor, dass ein vierjähriges Kind allein über die Augen mehr Daten über die Welt aufgenommen hat als die größten Sprachmodelle aus all ihren Texten, und zwar durch Angreifen und Hinfallen statt durch Lesen.

Ob diese Kritiker recht haben, wird sich zeigen. Für Sie ist etwas anderes wichtiger: Warum ruft überhaupt jemand die AGI-Ära aus, wenn man sie nicht messen kann? Die Antwort ist unangenehm einfach. In kaum eine Branche fließt derzeit so viel Geld wie in die KI, und die Firmen werden nicht nach dem bewertet, was sie heute verdienen, sondern nach dem, was Anleger ihnen für die Zukunft zutrauen. Dafür braucht es eine Geschichte, die groß genug ist. „Unsere Software ist ein bisschen besser als die Konkurrenz“ ist keine solche Geschichte. „Die Maschine hat den Menschen eingeholt“ schon. Dass niemand genau sagen kann, was AGI ist, stört dabei nicht, im Gegenteil: Wo es keine Prüfung gibt, kann auch niemand durchfallen. Selbst Dario Amodei, Chef des Konkurrenten Anthropic, meidet den Begriff und spricht lieber von „powerful AI“, weil ihm an AGI zu viel Science-Fiction und Hype hängt.

Was das für Ihre Gemeinde bedeutet

Zurück zur praktischen Frage. Die KI, die Ihnen letzte Woche den Entwurf für die Beschwerdeantwort geschrieben hat, schreibt ihn diese Woche auch. Vielleicht etwas besser, wenn Sie ein neueres Modell nutzen. Aber sie hat auch letzte Woche schon plausibel klingende Gründe erfunden, wenn das Briefing schlampig war, und sie tut es diese Woche wieder. Der Praktikant aus der ersten Kolumne ist fleißiger geworden, aber er ist deshalb noch lange nicht Ihr Amtsleiter.

Was sich mit der Zeit tatsächlich ändert, ist die Breite dessen, was Sie delegieren können. Bisher waren das vor allem Texte. Zunehmend werden es ganze Abläufe sein, bei denen die KI ein Formular ausfüllt, die Daten in eine Tabelle überträgt und die Zwischenschritte selbst erledigt. Das ist ein echter Fortschritt, und er wird im Gemeindeamt ankommen. Das Prüfen wird dadurch aber nicht überflüssig, sondern wichtiger. Ein System, das zehn Schritte selbstständig macht, macht seinen Fehler auch selbstständig, und zwar in Schritt drei, wo Sie ihn nicht sehen.

Wenn also das nächste Mal jemand „AGI“ ruft, helfen drei Fragen. Wer sagt es, und was hat derjenige davon? Was genau wurde gemessen, und von wem? Und was ändert sich dadurch konkret an der Arbeit, die morgen früh auf meinem Schreibtisch liegt? Meistens lautet die dritte Antwort: nichts, was nicht auch gestern schon galt. Die KI denkt. Sie entscheiden.

Kleine Hausaufgabe für Sie

Prüfen Sie das „General“ selbst. Nehmen Sie eine Regelung, die es nur in Ihrer Gemeinde so gibt, etwa einen Auszug aus der Friedhofsordnung oder der Hundeabgabenverordnung. Anonymisiert, versteht sich. Fügen Sie den Text in ChatGPT oder Claude ein und stellen Sie eine Frage, die sich daraus beantworten lässt. Dann stellen Sie eine zweite, die der Text nicht abdeckt. Beobachten Sie, was passiert: Sagt die KI „das steht hier nicht“, oder erfindet sie eine Antwort, die überzeugend klingt? Damit wissen Sie mehr über den Stand der Technik als aus jeder Schlagzeile.

KI KOMPAKT

Künstliche Intelligenz (KI) bezeichnet Computersysteme, die menschliche Fähigkeiten wie Lernen oder Sprachverständnis nachahmen. Der Begriff wandert: Sobald ein Problem gelöst ist, etwa Schach oder Übersetzung, gilt die Lösung nur noch als Software.

AGI (Artificial General Intelligence, allgemeine künstliche Intelligenz) meint ein System, das nicht nur einzelne Aufgaben beherrscht, sondern sich wie ein Mensch auch in Bereiche einarbeiten kann, für die es nie gebaut wurde. „General“ steht für Breite. Es gibt mehrere konkurrierende Definitionen und keinen anerkannten Test.

Superintelligenz und Singularität sind die nächsten Stufen der Erzählung: eine KI deutlich über menschlichem Niveau beziehungsweise der Punkt, ab dem KI ihre eigene Weiterentwicklung übernimmt. Beides ist Zukunftsspekulation.

Benchmarks sind standardisierte Vergleichstests für KI-Modelle, etwa in Mathematik oder Softwarebedienung. Sie messen Verhalten, kein Verstehen. Die Ergebnisse veröffentlichen meist die Anbieter selbst, und die Aufgaben haben feste Regeln, die der Gemeindealltag nicht hat.

Der Stand im September 2026. OpenAI bezeichnet sein Modell GPT-6 „Astra“ als Beginn der AGI-Ära. Unabhängige Forscher sehen einen deutlichen Fortschritt, aber keinen Beleg für AGI. Der Streit dreht sich weniger um Technik als um den Begriff.

Für die Gemeindepraxis ändert eine AGI-Ankündigung an Ihren Werkzeugen nichts. Was Sie gestern prüfen mussten, müssen Sie heute prüfen. Was zunimmt, ist die Breite der Aufgaben, die Sie delegieren können, und damit das Gewicht der Kontrolle. Die Verantwortung für das Ergebnis bleibt beim Menschen.

Drei Prüffragen bei KI-Schlagzeilen. Wer behauptet es, und mit welchem Interesse? Was wurde gemessen, und von wem? Was ändert sich konkret an meiner Arbeit?

Von: M.TREIBER (KIUMI – Die Agentur für Zusammenarbeit von KI und Mensch)

Empfehlungen für dich:

Anmeldung mit ID Austria
ID Austria

Melden Sie sich hier bequem mit
Ihrer ID Austria an.

Mit ID Austria anmelden Weitere Informationen zur ID Austria