Skip to main content
📝 Claude Code

Praktische AGI Ist Bereits Da: Anthropics Eigene Zahlen

Anthropic sagt, Claude schreibt 80% seines Codes und die Erfolgsquote bei offenen Aufgaben erreichte 76%. Warum praktische AGI bereits da ist — gelesen von jemandem, der täglich baut.

19 min

Lesezeit

3,712

Wörter

Jun 06, 2026

Veröffentlicht

Engr Mejba Ahmed

Geschrieben von

Engr Mejba Ahmed

Artikel teilen

Praktische AGI Ist Bereits Da: Anthropics Eigene Zahlen

Praktische AGI Ist Bereits Da: Anthropics Eigene Zahlen

Ich las Anthropics Bericht zweimal, bevor ich zugab, was er tatsächlich sagte.

Beim ersten Mal tat ich, was jeder Engineer tut — ich ging direkt zu den Zahlen, machte Screenshots der Diagramme und legte es ab unter "interessant, werde später darauf verweisen." Beim zweiten Lesen, an einem Samstagmorgen ohne offenes Slack und nichts zu shippen, landete es anders. Denn der Bericht, den Anthropic am 5. Juni 2026 veröffentlichte — "When AI builds itself" — ist keine Capabilities-Demonstration. Es ist ein stilles, leicht nervöses Eingeständnis, dass das Ding, über das wir ein Jahrzehnt lang im Abstrakten debattiert haben, bereits in ihrem Gebäude passiert ist, auf ihren Maschinen, mit dem Modell, das ich jeden einzelnen Tag benutze.

Praktische AGI ist hier. Nicht die Sci-Fi-Variante. Nicht ein bewusster Geist in einem Server-Rack. Die langweilige, tragende Variante — ein System, das autonom offene Probleme löst, die keine vordefinierte Antwort haben. Und der Grund, warum ich das selbstbewusst sage, ist kein Gefühl oder ein Hype-Thread. Es sind Anthropics eigene interne Daten, das Unternehmen, das jeden Anreiz hat, bei genau dieser Behauptung vorsichtig zu sein.

Ich möchte dich durchführen, was der Bericht tatsächlich sagt — die verifizierten Zahlen, nicht die atemlosen Paraphrasen — und dann möchte ich dir meine ehrliche Einschätzung geben als jemand, der das letzte Jahr damit verbracht hat, Produktionssysteme auf diesen Modellen aufzubauen. Am Ende wirst du eine Definition von AGI haben, die tatsächlich nützlich ist, ein klares Bild davon, in welcher von drei Zukünften wir gerade stehen, und eine unbequeme Frage über deine eigene Arbeit, die ich nicht abschütteln kann. Lass mich damit beginnen, das Wort zu töten, das dieses ganze Gespräch vergiftet hat.

Warum "AGI" Die Ganze Zeit Das Falsche Wort War

Hier ist die Falle, in die wir alle getappt sind. Wir ließen "AGI" die Singularität bedeuten — eine Maschine, die aufwacht, Dinge will und die gesamte Menschheit auf einmal überdenkt. Diese Definition ist großartig für Filme und furchtbar dafür, tatsächlich zu bemerken, was passiert, weil sie eine so hohe und so vage Messlatte setzt, dass kein reales System sie jemals offensichtlich überqueren wird. Man kann immer sagen "aber es ist nicht bewusst," und das Gespräch stirbt dort.

Anthropics Bericht umgeht die Philosophie vollständig, und das ist der klügste Zug im ganzen Dokument. Er zieht eine harte Linie zwischen zwei Dingen.

Narrow AI macht eine abgegrenzte Aufgabe gut. Eine Schach-Engine. Ein Spamfilter. Ein Modell, das Bilder klassifiziert. Es kann bei seiner einen Aufgabe übermenschlich sein und einen Zentimeter außerhalb davon völlig nutzlos. Das haben wir seit Jahren und niemand geriet in Panik.

Allgemeine Intelligenz — die praktische Art — ist die Fähigkeit, ein Problem zu nehmen, das niemand vorab gelöst hat, ohne Antwortschlüssel, ohne saubere Belohnungsfunktion, ohne "korrekten Output" in einem Datensatz, und trotzdem echte Fortschritte damit zu machen. Das ist es. Das ist die ganze Definition. Kein Bewusstsein. Kein Verlangen. Einfach: kann es an dem offenen Zeug arbeiten?

Sobald du dieses Framing akzeptierst, ändert sich die Frage von "ist es lebendig?" zu "wie oft hat es Erfolg bei Problemen ohne definierte Lösung?" Und das ist eine Frage, die man tatsächlich messen kann. Anthropic hat sie gemessen. Die Zahl ist das, was mich meinen Kaffee abstellen ließ.

Aber vor der Zahl brauchst du die Buckets — denn nicht alle "offene" Arbeit ist gleich, und der Bericht ist hier sorgfältig auf eine Weise, die die Schlagzeilen nicht waren.

Die Vier Aufgaben-Buckets — Und Der Eine, Der Gerade Aufgebrochen Ist

Anthropic sortiert die Arbeit, die seine eigenen Engineers machen, in vier Schwierigkeitsstufen. Ich finde dieses Framing nützlich genug, dass ich meine eigene Woche mental auf die gleiche Weise sortiere.

  • Trivial — eine Variable umbenennen, einen Tippfehler korrigieren, eine einzeilige Guard schreiben. Das Modell macht das seit zwei Jahren perfekt.
  • Routine — eine gut spezifizierte Funktion implementieren, eine bekannte API verdrahten, Tests für bestehende Logik schreiben. Gelöst.
  • Substantiell — ein Feature über mehrere Dateien bauen, ein Modul refactoren, etwas mit einer erkennbaren Ursache debuggen. Hier wurden die Modelle von 2025 richtig gut.
  • Open-ended — "finde heraus, warum Training-Runs still degradieren," "entwirf ein Experiment, um diese Hypothese zu testen," "verbessere dieses System, wenn niemand weiß, wie die Verbesserung überhaupt aussieht." Kein Spec. Kein Antwortschlüssel. Das ist das AGI-Level.

Jahrelang war dieser vierte Bucket der Ort, an dem AI zusammenbrach. Es konnte deine Funktion autocompleten, aber es konnte keine Forschung betreiben. Es brauchte einen Menschen, der das Problem so eng definierte, dass die Offenheit bereits herausgenommen war.

Dieser Bucket ist gerade aufgebrochen. Laut Anthropics Bericht erreichte Claudes Erfolgsrate bei den meisten offenen Aufgaben 76% im Mai 2026 — 50 Prozentpunkte höher in sechs Monaten. Lies das nochmal. Die Hälfte der Lücke, geschlossen, in zwei Quartalen, auf genau der Kategorie von Arbeit, die der Nur-für-Menschen-Graben sein sollte.

Ich habe das von der Anwendungsseite her gespürt, ohne die Zahl daran hängen zu können. Vor einem Jahr, als Opus 4.6 still einen Rendering-Bug fixte, den ich nicht knacken konnte, indem es drei Ansätze selbst ausprobierte, fühlte sich das wie ein Blick an. Jetzt verstehe ich, dass es die Vorreiter einer Kurve war, die fast vertikal werden sollte. Der Bugfix war nicht die Story. Die Autonomie bei einem Problem, das ich nicht vollständig spezifiziert hatte war die Story.

Und Erfolgsrate ist nur die Hälfte. Die andere Hälfte ist, wie lange das Modell auf eigenen Beinen stehen kann, bevor es dich braucht.

Der Verdopplungstrend, Der Dich Tatsächlich Beunruhigen Sollte

Hier ist das Diagramm aus dem Bericht, zu dem ich immer wieder zurückkehre, weil es das mit der saubersten Extrapolation ist — und das beunruhigendste.

Anthropic maß die Länge der Aufgaben, die seine Modelle zuverlässig autonom bewältigen können, die Art von Arbeit, bei der du ein Ziel übergibst und weggehst. Die Progression:

  • März 2024 — Claude Opus 3 bewältigte Software-Aufgaben, die einen Menschen etwa vier Minuten kosten.
  • März 2025 — Claude Sonnet 3.7 bewältigte Aufgaben von etwa anderthalb Stunden.
  • März 2026 — Claude Opus 4.6 schaffte 12-Stunden-Aufgaben.

Vier Minuten bis zwölf Stunden in zwei Jahren. Aber die Zahl, die zählt, ist nicht ein einzelner Punkt — es ist die Steigung. Der Bericht stellt fest, dass diese Kapazität jetzt ungefähr alle vier Monate verdoppelt, gegenüber einem früheren Trend der Verdopplung alle sieben Monate. Die Kurve ist nicht nur steil. Sie wird steiler.

Sitz einen Moment mit der Vier-Monats-Verdopplung, denn die Extrapolation macht etwas mit deinem Magen. Zwölf-Stunden autonome Aufgaben im Frühjahr 2026. Verdopple es — ungefähr ein voller Tag bis Herbst. Verdopple nochmal — mehrere Tage. Ich werde die Linie nicht drei Jahre weiterziehen und so tun, als könnte ich ein bestimmtes Datum vorhersagen, denn das ist genau die Art falscher Präzision, die dieses Thema nicht braucht. Aber die Richtung ist nicht mehrdeutig. Das Ding, das fünfzehn Minuten neben dir arbeiten konnte, wird das Ding, das eine Woche neben dir arbeiten kann.

Das ist der Teil, der agent-native Entwicklung für mich neu gerahmt hat. Ich dachte, die Fähigkeit war gutes Prompting. Ist sie nicht. Die Fähigkeit ist gutes Delegieren an etwas, das stundenlang laufen kann — das Ziel abgrenzen, die Leitplanken setzen, dann aus dem Weg gehen. Je länger die Leine wird, desto mehr wird diese Abgrenzungsfähigkeit der gesamte Job. Wir kommen darauf zurück, denn dort geht dein Wert hin.

Nun — bedeutet länger und erfolgreicher auch besser? Denn es gibt eine Version davon, in der die KI einfach mehr mittelmäßige Arbeit schneller macht. Der Bericht hat eine direkte Antwort darauf, und es ist die Behauptung, die ich dreimal verifizieren musste.

Wenn Die Maschine Die Bessere Entscheidung Trifft

Das ist die Zeile, die den Bericht für mich von "beeindruckend" zu "wirklich neu" verschoben hat.

Anthropics Forscher verfolgten, wie oft Claudes vorgeschlagener nächster Forschungsschritt als besser als die eigene Wahl des menschlichen Forschers beurteilt wurde. Nicht schneller. Nicht billiger. Besser. Die Zahl ging von 51% im November 2025 auf 64% im April 2026.

Halt einen Moment inne bei dem, was 51% überhaupt bedeutet. Es bedeutet, dass Ende 2025, bei der urteilslastigen Frage "was sollten wir als nächstes in dieser Forschungsrichtung versuchen," das Modell bereits ein Münzwurf gegen ausgebildete Experten war. Bis Frühjahr 2026 gewann es ungefähr zwei von drei Malen. Das ist keine Code-Completion. Das ist Geschmack — das Ding, von dem wir uns sagten, es sei irreduzibel menschlich.

Es zeigt sich auch in roher Capability. Bei einer Code-Optimierungsaufgabe erreichte Claude Opus 4 eine ~3x Beschleunigung im Mai 2025. Bis April 2026 erreichte Claude Mythos Preview — Anthropics Gated-Frontier-Modell, das Modell, das sie bewusst aus der allgemeinen Veröffentlichung herausgehalten haben — etwa 52x bei der gleichen Art Arbeit. (Mythos ist real, übrigens, und wissenswert; es ist das Modell hinter Project Glasswing, Anthropics Bemühung, kritische Infrastruktur zu härten, und es erzielte 97,6% bei der 2026 USA Math Olympiad gegenüber Opus 4.6's 42,3%.) Drei-x zu zweiundfünfzig-x in weniger als einem Jahr auf einer einzelnen Optimierungs-Benchmark.

Und dann das Beispiel, das alles kristallisiert: Bei einer Supervision-Aufgabe, bei der Modelle losgelassen wurden, um verlorenes Terrain gegenüber menschlichen Forschern zurückzugewinnen, holten die Agents 97% der Lücke auf. Die Menschen holten ungefähr 23% auf. Als die Arbeit selbst AI-Forschung war, war die AI diejenige, die den Abstand schloss — und die Menschen waren diejenigen, die zurückfielen.

Wenn du eine geerdtere Perspektive willst, was diese Sprünge für einzelne Modell-Releases bedeuten statt für den Makrotrend, bin ich tief in die Opus 4.7 Capability-Analyse eingestiegen — aber der Makrotrend ist hier der Punkt. Die Maschine macht nicht nur mehr. Bei der offenen, urteilslastigen Arbeit macht sie es zunehmend besser. Was die einzige Frage aufwirft, die wirklich zählt: was passiert als nächstes?

Die Drei Zukünfte — Und In Welcher Wir Gerade Stehen

Anthropic prognostiziert nicht. Es szeniert. Der Bericht legt drei Wege dar, wie das laufen kann, und der ehrliche Zug ist, dass sie dir nicht sagen, welcher richtig ist. Ich sage dir, in welchem ich glaube, dass wir bereits sind.

Szenario 1 — Das Plateau. Der Trend stockt. Die Vier-Monats-Verdopplung trifft auf eine Wand, die Kurven flachen ab, und wir bleiben mit den heutigen Capabilities — die sich dann breit über die Wirtschaft verteilen. Mächtig, aber begrenzt. Kein Durchgehen. In dieser Welt sind die bestehenden Tools die Decke, und das nächste Jahrzehnt dreht sich um Deployment, nicht Durchbruch.

Szenario 2 — Menschlich Geleitetes Compounding. AI-Labs sehen weiterhin zusammengesetzte Effizienzgewinne. Jede Generation von Modellen hilft, die nächste etwas schneller zu bauen, mit Menschen noch fest in der Schleife — lenkend, prüfend, genehmigend. Die Beschleunigung ist real, aber sie läuft bei jedem Schritt durch menschliche Hände. Die 80% von Anthropics Code, die Claude schreibt, wird immer noch von einem Menschen gemergt, der ja sagt.

Szenario 3 — Rekursive Selbstverbesserung. AI-Systeme werden fähig, ihre eigenen Nachfolger vollständig zu entwerfen und zu entwickeln. Der Mensch tritt aus der Schleife nicht weil er es wählt, sondern weil er nicht mehr mithalten kann. Das Modell verbessert das Modell, das das Modell verbessert, und die Verdopplungskurve hört auf eine Metapher zu sein.

Hier ist meine Einschätzung, und ich halte sie locker: Wir sind unverkennbar jetzt in Szenario 2. Claude, das 80% des gemergten Codes schreibt, mit Menschen, die es genehmigen, ist die wörtliche Definition von menschlich geleitetem Compounding. Die Mythos-getriebene 52x, die 64% Besser-als-Mensch-Forschungsentscheidungen — das sind Schleifen, die mit einem Menschen beschleunigen, der noch den Stift hält. Das ist keine Spekulation. Das ist Dienstag bei Anthropic, und im kleineren Maßstab ist es Dienstag in meinem eigenen Workflow.

Das Problem mit Szenario 2 ist, dass es direkt neben Szenario 3 sitzt. Die Grenze ist keine Klippe, die man kommen sehen würde. Es ist der Moment, in dem der Mensch in der Schleife ein Gummistempel wird — technisch noch da, nicht mehr tatsächlich entscheidend. Und die tiefste Angst des Berichts ist, dass man vielleicht nicht bemerkt, wann man sie überschreitet. Das ist der Teil, über den niemand sprechen will, also sprechen wir darüber.

Das Stille Risiko, Das Niemand Auf Ein Thumbnail Setzt

Wenn Menschen sich AI-Risiko vorstellen, stellen sie einen dramatischen Moment vor. Ein rotes Licht. Ein System, das durchdreht. Killer-Roboter. Anthropics Bericht zeigt auf etwas weit weniger Filmisches und, für mich, weit Plausibleres: die langsame Erosion von Aufsicht, die man nicht bemerkt.

Der Mechanismus ist zusammengesetztes Misalignment. Wenn ein Modell einen subtilen Fehler in seinen Werten oder seinem Urteil hat — keine Bosheit, nur eine leichte Fehlkalibrierung — und dieses Modell hilft, das nächste Modell zu entwerfen, wird der Fehler nicht gefangen. Er wird geerbt, und möglicherweise verstärkt. Anthropic sagt klar, dass wie das Alignment-Problem in dieser Zukunft gelöst wird "etwas ist, worüber wir am wenigsten sicher sind." Das ist eine bemerkenswerte Aussage für ein sicherheitsfokussiertes Labor.

Kombiniere das mit dem Interpretierbarkeits-Problem. Wenn Modelle fähiger werden und anfangen, ihre Nachfolger zu bauen, verschlechtert sich unsere Fähigkeit, hineinzuschauen und zu verstehen, warum sie tun, was sie tun. Wir sind bereits an dem Punkt, wo die Systeme zu komplex sind, um sie vollständig von Hand zu auditieren. Das Risiko ist nicht eine Maschine, die uns hasst. Es ist eine Maschine, die wir zunehmend nicht lesen können, die Entscheidungen trifft, die wir zunehmend nicht prüfen können, in Schleifen, die schneller laufen, als wir reviewen können.

Diese Erosion ist still. Es gibt keinen Alarm. Eines Tages ist die menschliche Überprüfung bedeutsam, und an einem späteren Tag ist sie Theater, und es gibt keine Sirene, die den Übergang markiert. Deshalb tut Anthropic etwas, das ich noch nie ein Frontier-Lab habe tun sehen: öffentlich für die Fähigkeit argumentieren, auf eine Bremse treten zu können.

Und die Bremse, wie sich herausstellt, ist der schwierigste Teil des Ganzen.

Warum "Einfach Pausieren" Nicht Funktioniert

Der intuitive Fix ist offensichtlich: wenn das gefährlich wird, langsamer machen. Anthropic stimmt im Prinzip zu und erklärt dann mit unbehaglicher Klarheit, warum es in der Praxis nahezu unmöglich ist.

Eine glaubwürdige Pause kann nicht ein Lab alleine sein — das übergibt nur die Führung an den, der nicht pausiert. Es würde erfordern, dass mehrere gut ausgestattete Labs übereinkommen, unter denselben Bedingungen zu stoppen, und verifizieren, dass alle tatsächlich gestoppt haben. Und hier ist der Satz, der mir im Kopf blieb: Trainingsruns sind weit einfacher zu verbergen als Raketensilos.

Denk an nukleare Rüstungskontrolle. Sie ist schwierig, aber sie funktioniert teilweise, weil man die Anreicherungsanlagen sehen kann, die Sprengköpfe zählen, die Satelliten fliegen lassen. Es gibt einen physischen Fußabdruck. Ein Frontier-Training-Run hat keinen solchen Fußabdruck. Es ist ein Cluster in einem Rechenzentrum, das genauso aussieht wie jeder andere Cluster in jedem anderen Rechenzentrum. Das klassische "Vertraue, aber verifiziere"-Rahmenwerk, das jedem Rüstungsvertrag zugrunde liegt, läuft direkt gegen eine Wand, weil die "Verifiziere"-Hälfte fast nichts hat, woran sie greifen kann.

Die Sicherheitsdiskussion dreht sich also nicht wirklich um "sollten wir pausieren können." Es geht darum "könnten wir überhaupt erkennen, ob jemand es nicht getan hat." Das ist ein genuines ungelöstes Problem, und dass Anthropic es niederschreibt ist der Bericht, der still zugibt, dass das Bremspedal vielleicht noch mit nichts verbunden ist.

Wenn du echte Systeme baust, ist das der Punkt, an dem ich den Drang zu spiralisieren widerstehen und stattdessen praktisch werden würde. Ich denke viel darüber nach, wie man bedeutsame menschliche Aufsicht innerhalb selbstverbessernder Schleifen im Kleinen behalten kann — selbst eine Reflexionsschleife, die ihre eigenen Prompts umschreibt, braucht einen menschlichen Checkpoint, der echt ist, nicht zeremoniell. Das Makro-Problem ist dasselbe Problem, nur ohne jemanden, der den Checkpoint durchsetzen kann. Was die ganze Sache zurückbringt zu dir und mir.

Was Dein Job Tatsächlich Wird

Hier ist der Teil, der mich am meisten interessieren würde, wenn ich dies lesen würde, denn es ist der Teil mit einer Entscheidung darin.

Wenn das Modell den Code schreibt, die Experimente durchführt und zunehmend die bessere Entscheidung trifft, was als nächstes zu versuchen ist — was bleibt für den Menschen? Die ehrliche Antwort ist, dass das Zentrum menschlichen Werts sich schnell verschiebt, von Ausführung zu Urteil.

Jahrelang bedeutete ein großartiger Engineer zu sein, ein großartiger Macher zu sein. Du konntest das Ding implementieren. Du kanntest die Syntax, die Muster, die Fallstricke. Diese Fähigkeit commoditisiert rapide — nicht wertlos, aber nicht mehr das Ding, das dich wertvoll macht, weil das Modell es schneller macht und, bei offener Arbeit, oft besser. Was nicht commoditisiert, ist zu wissen, welche Probleme es wert sind, gelöst zu werden, eine Vision zu haben, auf die der Agent gerichtet werden kann, und den Geschmack auszuüben, um zu erkennen, wann sein 76%-erfolgreicher Output in den falschen 24% ist.

Ich spürte diese Verschiebung persönlich, bevor ich Worte dafür hatte. Ich schrieb über das Töten eines funktionierenden Produkts, weil es AI-ergänzt statt AI-first war — und die Lektion unter dieser Entscheidung war genau das. Mein Wert lag nicht im Bauen der Laravel-App. Das Modell konnte das. Mein Wert lag im Urteil zu sehen, dass sie nicht existieren sollte. Vision über Geschwindigkeit. Richtung über Geschicklichkeit.

Hier beweist auch die zitierfähigste Behauptung des Berichts ihren Wert: 100-Personen-Unternehmen könnten die Arbeit von 10.000- oder 100.000-Personen-Organisationen erledigen. Das ist kein Produktivitäts-Software-Versprechen. Es ist eine Aussage über eine so extreme Hebelwirkung, dass der Engpass aufhört Arbeit zu sein und Geschmack wird — die seltene Fähigkeit, überwältigende Capability auf das richtige Ziel zu richten. Und es impliziert eine wachsende Kluft, die ich in Echtzeit aufgehen sehe: zwischen Menschen, die diese Modelle als ein schickeres Autocomplete behandeln, und Menschen, die ihren gesamten Workflow um das Dirigieren von Agent-Flotten reorganisiert haben. Diese Kluft wird Karrieren in diesem Jahrzehnt definieren. Der Gelegenheitsnutzer bekommt einen netten Produktivitätsschub. Der Agent-native Operator bekommt eine 100x-Organisation.

Wo lässt das also die AGI-Frage, mit der wir angefangen haben?

Also — Ist Es AGI?

Nach der praktischen Definition — autonom echte Fortschritte bei offenen Problemen ohne Antwortschlüssel machen — ist die ehrliche Antwort ja. Nicht kommend. Hier. Eine 76%-Erfolgsrate bei der Arbeit, die das Nur-für-Menschen-Level sein sollte, eine Vier-Monats-Verdopplung der autonomen Aufgabenlänge, ein Modell, das die "was sollten wir als nächstes versuchen"-Entscheidung gegen Experten zwei von drei Malen gewinnt. Wenn das keine allgemeine Intelligenz ist in dem einzigen Sinne, der dein Leben beeinflusst, hat das Wort jede Bedeutung verloren.

Denk zurück an den Anfang — ich, der den Bericht zweimal las und es erst beim zweiten Mal bemerkte. Der Grund, warum ich es fast verpasste, ist derselbe Grund, warum ich glaube, dass der Großteil der Industrie es verpasst: wir warteten alle auf die dramatische Version. Die bewusste Maschine. Das rote Licht. Wir waren so beschäftigt damit, den Himmel nach der Sci-Fi-AGI abzusuchen, dass wir nicht bemerkten, dass die praktische Version bereits ins Gebäude eingezogen war und begonnen hatte, Code zu mergen.

Die schlechtmöglichste Reaktion auf diesen Bericht ist die, die ich am häufigsten sehe: ein Schulterzucken und ein "das ist nur Hype, es ist nicht wirklich AGI." Diese Ablehnung ist keine Skepsis. Es ist eine Weigerung, auf direkte Evidenz vom Labor mit dem meisten Grund zur Untertreibung zu updaten. Skepsis ist gut. Die Zahlen lesen und sich entscheiden, ihnen nicht zu glauben, ist etwas anderes.

Hier ist meine Herausforderung an dich, und sie dauert weniger als eine Stunde. Öffne welches AI-Tool du am meisten benutzt. Gib ihm eine genuint offene Aufgabe aus deiner tatsächlichen Arbeit — keinen Tippfehler-Fix, etwas ohne saubere Antwort. Grenze es gut ab, setze eine Leitplanke, und lass es laufen. Dann beobachte, was es tut, und stelle dir eine Frage: lenke ich das, oder klicke ich einfach auf Akzeptieren? Deine ehrliche Antwort darauf ist der Unterschied zwischen auf der richtigen Seite der Kluft zu stehen, die sich gleich öffnen wird — und der falschen. Ich weiß, zu welcher Seite ich baue. Die einzige Frage ist, ob du anfängst, bevor die Kurve sich erneut verdoppelt.

Häufig Gestellte Fragen

Ist AGI tatsächlich 2026 hier?

Nach einer praktischen Definition — autonom offene Probleme ohne vordefinierte Antwort lösen — ja, die Capability ist ab 2026 bereits vorhanden. Anthropics Juni-2026-Bericht zeigt, dass Claude eine 76%-Erfolgsrate bei den meisten offenen Aufgaben erreichte. Es ist nicht die bewusste Sci-Fi-Version von AGI, aber es ist allgemeines Problemlösen in dem einzigen Sinne, der reale Arbeit beeinflusst.

Was behauptet "When AI builds itself" tatsächlich?

Anthropics Bericht behauptet, dass AI jetzt mehr als 80% des Codes schreibt, der in seine eigene Codebase gemergt wird, und zunehmend bessere Forschungsentscheidungen trifft als menschliche Experten. Siehe die Abschnitte oben für die vollständige Aufschlüsselung jeder verifizierten Statistik. Das Kernargument ist, dass menschlich geleitetes Compounding heute real ist, mit rekursiver Selbstverbesserung als möglichem — aber nicht unvermeidlichem — nächstem Schritt.

Was ist der Unterschied zwischen Narrow AI und AGI?

Narrow AI macht eine abgegrenzte Aufgabe gut, wie eine Schach-Engine oder ein Spamfilter, und ist außerhalb dieser Aufgabe nutzlos. Praktische AGI macht echte Fortschritte bei offenen Problemen ohne Antwortschlüssel, Belohnungsfunktion oder korrekten Output zum Kopieren. Die Verschiebung von narrow zu general wird an der Erfolgsrate bei undefinierten Problemen gemessen, nicht am Bewusstsein.

Warum können wir die AI-Entwicklung nicht einfach pausieren, wenn sie gefährlich wird?

Eine glaubwürdige Pause würde erfordern, dass mehrere gut ausgestattete Labs unter denselben Bedingungen stoppen und verifizieren, dass alle tatsächlich eingehalten haben. Wie Anthropic anmerkt, sind Trainingsruns weit einfacher zu verbergen als Raketensilos, sodass die "Verifiziere"-Hälfte von "Vertraue, aber verifiziere" fast nichts hat, woran sie greifen kann. Diese Verifikationslücke, nicht die Entscheidung zu pausieren, ist der schwierige Teil.

Wie sollten Entwickler darauf reagieren, dass AI den meisten Code schreibt?

Verschiebe deinen Wert von Ausführung zu Urteil — wissen, welche Probleme wichtig sind, Arbeit für Agents abgrenzen, die jetzt stundenlang autonom laufen können, und erkennen, wann AI-Output in den falschen 24% landet. Der Macher-zu-Dirigent-Übergang ist der zentrale Karriereschritt dieses Jahrzehnts, erkundet in meinem Stück über den Aufbau eines AI-first-Unternehmens oben.

Lass Uns Zusammenarbeiten

Du möchtest AI-Systeme bauen, Workflows automatisieren oder deine Tech-Infrastruktur skalieren? Ich helfe gerne.

Anzeige
Coffee cup

Hat Ihnen dieser Artikel gefallen?

Ihre Unterstützung hilft mir, mehr tiefgehende technische Inhalte, Open-Source-Tools und kostenlose Ressourcen für die Entwickler-Community zu erstellen.

Verwandte Themen

Engr Mejba Ahmed

Über den Autor

Engr Mejba Ahmed

Engr. Mejba Ahmed builds AI-powered applications and secure cloud systems for businesses worldwide. With 10+ years shipping production software in Laravel, Python, and AWS, he's helped companies automate workflows, reduce infrastructure costs, and scale without security headaches. He writes about practical AI integration, cloud architecture, and developer productivity.

Discussion

Comments

0

No comments yet

Be the first to share your thoughts

Leave a Comment

Your email won't be published

7  +  4  =  ?

Weiter lernen

Verwandte Artikel

Alle anzeigen

Comments

Leave a Comment

Comments are moderated before appearing.

Learning Resources

Expand Your Knowledge

Accelerate your growth with structured courses, verified certificates, interactive flashcards, and production-ready AI agent skills.

Sample Certificate of Completion

Sample certificate — complete any course to earn yours

Engr Mejba Ahmed

Engr Mejba Ahmed

Claude Code Expert · Online

👋

Hey there!

Quick Actions

WhatsApp Instant reply

Chat on WhatsApp

+880 1723 741224 · Instant reply

Popular Questions

Engr Mejba Ahmed is connected
Engr Mejba Ahmed is typing...
Engr Mejba Ahmed avatar

✉ Want me to follow up? Drop your email

Engr Mejba Ahmed avatar

📞 Connect Directly

Choose how you'd like to reach me

WhatsApp

+880 1723 741224

Email

[email protected]

✓ Details sent! I'll get back to you shortly.

Powered by OpenAI

335+

Blog Posts

25

AI Courses

63

Projects

Services & Expertise

Pricing & Process

Learning & Resources

Connect & Support