Der Spielautomat war der Moment, der mein Gehirn zum Stillstand brachte.
Ich hatte MiniMax M2.7 zu diesem Zeitpunkt bereits rund drei Stunden getestet — es durch meinen Standard-Parcours aus Frontend-Herausforderungen, Game-Builds und kreativen Coding-Aufgaben gejagt. Das meiste davon war gut. Einiges davon war sehr gut. Aber der Spielautomat überschritt eine Grenze, die ich von einem Modell in dieser Preisklasse nicht erwartet hatte. Vollständiges State Management. Flüssige Walzenanimationen mit unabhängigem Timing. Zufallslogik, die sich tatsächlich zufällig anfühlte. Visuelles Feedback bei Gewinnen mit Partikeleffekten und Bildschirmerschütterung. Die Art von polierter Interaktivität, die ich von einem Senior Frontend-Entwickler erwarten würde — nicht von einem Modell, das fünfzigmal weniger als Opus kostet.
Ich saß dort und klickte gute zwei Minuten lang auf den Spin-Button, bevor mir einfiel, dass ich das Ding bewerten sollte, nicht damit spielen.
MiniMax M2.7 erschien am 18. März 2026, und das Hauptfeature sind nicht die Benchmarks oder der Preis — obwohl beides beeindruckend ist. Die Hauptnachricht ist, dass dieses Modell sich selbst verbessert hat. Über 100 autonome Runden, in denen es eigene Fehler analysierte, eigenen Code modifizierte, Evaluierungen durchführte und entschied, ob Änderungen beibehalten oder rückgängig gemacht werden sollten. Kein Mensch an der Tastatur. Das Ergebnis war eine 30%ige Leistungssteigerung, die das Modell sich im Wesentlichen selbst verschafft hat.
Das ist die Behauptung. Ich wollte sehen, was diese Selbstevolution in der Praxis tatsächlich hervorgebracht hat — also verbrachte ich den Großteil von vier Tagen damit, alles auf das Modell zu werfen, was mir einfiel. Hier ist genau, was ich herausgefunden habe, was mich beeindruckt hat, was mich enttäuscht hat, und ob dieses Modell einen Platz in deinem Workflow neben den Modellen verdient, denen du bereits vertraust.
Was MiniMax tatsächlich behauptet — Und warum der Selbstevolutions-Aspekt wichtig ist
Bevor ich auf meine Testergebnisse eingehe, musst du verstehen, was M2.7 von jedem anderen Modell-Release dieses Monats unterscheidet. Denn es gab viele Modell-Releases diesen Monat.
MiniMax ist ein chinesisches KI-Unternehmen, das seit dem Launch seiner M2-Serie stetig gewachsen ist. Die M2.7 wurde speziell mit einer sogenannten „rekursiven Selbstverbesserungs"-Pipeline trainiert. So funktioniert das in einfachen Worten: Das Modell führte seinen eigenen Reinforcement Learning-Workflow durch. Es versuchte eine Aufgabe, analysierte warum es scheiterte, modifizierte seinen Ansatz, führte die Evaluierung erneut durch, verglich die Ergebnisse und behielt die Änderung bei oder verwarf sie. Dann tat es das noch einmal. Und noch einmal. Über 100 Mal — wobei es 30 bis 50 Prozent seines eigenen Entwicklungsworkflows ohne Eingriff eines menschlichen Ingenieurs abwickelte.
Laut der Berichterstattung von VentureBeat handelt es sich hier nicht nur um die Automatisierung einfacher Aufgaben. Das Modell optimierte seine eigene Programmierleistung, indem es Fehlverläufe analysierte und Codemodifikationen über diese iterativen Schleifen hinweg plante. MiniMax' eigener technischer Blog beschreibt die Vision als KI-Selbstevolution, die „schrittweise in Richtung voller Autonomie übergehen wird, wobei Datenkonstruktion, Modelltraining, Inferenzarchitektur, Evaluierung und andere Phasen ohne menschliche Beteiligung koordiniert werden."
Das ist eine kühne Behauptung. Aber hier ist, warum ich sie nicht einfach abtue: Die Benchmark-Ergebnisse untermauern sie tatsächlich.
| Benchmark | MiniMax M2.7 | Kontext |
|---|---|---|
| SWE-Bench Pro | 56,22% | Nähert sich Opus-Niveau; übertrifft Gemini 3.1 Pro |
| VIBE-Pro | 55,6% | End-to-End-Projektabwicklungsfähigkeit |
| TerminalBench 2 | 57,0% | Tiefes Verständnis auf Systemebene |
| MLE Bench Lite | 66,6% Medaillenrate | Gleichauf mit Gemini 3.1 in 22 ML-Wettbewerben |
| GDPval-AA | 1495 Elo | Höchster Wert unter open-source-zugänglichen Modellen |
| Hallucination Rate | 34% | Niedriger als Sonnet 4.6 (46%) und Gemini 3.1 Pro (50%) |
Diese Hallucination Rate fiel mir auf. 34% gegenüber Sonnet 4.6's 46%? Ich war skeptisch. Aber während meiner Tests bemerkte ich tatsächlich, dass M2.7 weniger dazu neigte, Funktionsnamen zu erfinden oder API-Parameter zu halluzinieren, die nicht existieren. Es ist nicht frei von Halluzinationen — kein Modell ist das — aber die Reduzierung ist real und spürbar während längerer Coding-Sessions.
Das Modell unterstützt 50+ Fähigkeiten und 100+ Features mit dem, was MiniMax als „stabile Instruktionsbefolgung und zuverlässige Toolnutzung" beschreibt. Es wird mit einem context window von 24.000 Tokens ausgeliefert — kleiner als das, was ich von Claudes 200K oder Geminis Millionen-Token-Kontexten gewohnt bin, aber mehr als ausreichend für die Art fokussierter Aufgabenausführung, für die M2.7 konzipiert ist.
Und dann ist da der Preis. Hier wurde ich hellhörig. Die vollständige Kostenaufschlüsselung kommt später, aber die Kurzversion: $0,30 pro Million Input-Tokens und $1,20 pro Million Output-Tokens. Um das in Perspektive zu setzen: Opus 4.6 läuft bei ungefähr $6 pro Million Input-Tokens. M2.7 liefert Benchmark-Ergebnisse, die an Opus-Territorium heranreichen, zu einem Bruchteil — manchmal 1/50stel — der Kosten.
Die Frage ist nicht, ob die Benchmarks gut sind. Das sind sie eindeutig. Die Frage ist, ob sich diese Zahlen in echte Ergebnisse übersetzen, die ich tatsächlich verwenden möchte. Also führte ich sieben Tests durch. Lass mich dich durch jeden einzelnen führen.
Test 1: Der macOS-Browser-Desktop — Wo M2.7 brillierte
Mein erster Test ist immer ambitioniert. Ich bitte das Modell, ein macOS-ähnliches Browser-Betriebssystem zu bauen — eine vollständige Desktop-Umgebung im Browser mit dynamischen Hintergründen, funktionierenden Anwendungen, einem Dock, Fensterverwaltung, allem Drum und Dran. Dieser Test trennt die ernsthaften Modelle von den Mitläufern, weil er gleichzeitige Kompetenz in Layout-Architektur, State Management, Animation und kreativem Design erfordert.
M2.7 lieferte etwas ab, das ich mit 9 von 10 bewerten würde.
Der Desktop-Hintergrund hatte einen dynamischen Farbverlauf, der sich subtil über die Zeit veränderte — nicht die billige CSS-Animation, die man von den meisten Modellen bekommt, sondern ein flüssiger, GPU-beschleunigter Übergang, der wirklich poliert aussah. Das Dock am unteren Rand war funktional mit Hover-Vergrößerungseffekten. Fensterverwaltung funktionierte: Man konnte Fenster ziehen, ins Dock minimieren und ihre Größe mit korrektem Einrast-Verhalten ändern.
Die einzelnen Anwendungen überraschten mich am meisten. Ein Taschenrechner, der tatsächlich mit Tastatureingabe funktionierte. Eine Notiz-App mit persistentem State während der Sitzung. Ein Einstellungspanel, mit dem man Hintergrundbild und Akzentfarben ändern konnte — und diese Änderungen propagierten sofort durch die gesamte Oberfläche. Die Liebe zum Detail war die Art, die einen vergessen lässt, dass man auf generierten Code schaut.
Wo es zu kurz kam: Der Dateimanager war größtenteils kosmetisch. Man konnte Ordnersymbole sehen und durch einen Verzeichnisbaum navigieren, aber es gab keine tatsächliche Dateierstellung oder Persistenz. Und die „Terminal"-App war eine Attrappe — sie akzeptierte Eingaben, verarbeitete aber keine Befehle. Rein dekorativ.
Dennoch. Für eine Single-Prompt-Generierung in dieser Preisklasse sind 9/10 fair. Ich habe Opus vergleichbare Qualität produzieren sehen, aber ich habe Opus auch am State Management für etwas so Komplexes scheitern sehen. M2.7 meisterte es sauber.
Test 2: Landingpages mit Shader-Rendering — Die Frontend-Muskelkraft
Mein zweiter Test fordert speziell die Frontend-Fähigkeiten heraus. Ich bat M2.7, eine dynamische Landingpage für ein fiktives KI-Produkt zu generieren — Hero-Sektion mit animiertem Shader-Hintergrund, Feature-Karten mit Mikro-Interaktionen, eine Preistabelle mit Jahres-/Monatsumschalter, und eine Testimonial-Sektion mit Karussell.
Der Shader-Hintergrund war das Highlight. M2.7 produzierte ein WebGL-betriebenes Verlaufsgitter, das auf Mausbewegungen reagierte — subtil genug, um sich premium anzufühlen statt spielerisch. Die Performance war ebenfalls solide. Keine Frame-Drops auf meinem M3 MacBook Pro, selbst mit laufenden Animationen.
Die Feature-Karten hatten Hover-States mit sanften Höhenübergängen und Farbverschiebungen der Icons. Der Preisumschalter funktionierte korrekt mit Cross-Fade-Animationen zwischen monatlichen und jährlichen Tarifen. Das Testimonials-Karussell rotierte automatisch und pausierte beim Hovern.
Was wirklich meine Aufmerksamkeit erregte, waren die Typografie-Entscheidungen. M2.7 wählte Schriftkombinationen, die tatsächlich durchdacht aussahen — eine geometrische Sans-Serif für Überschriften gepaart mit einer humanistischen Sans für den Fließtext. Die meisten Modelle klatschen einfach Inter auf alles und nennen es fertig. M2.7 traf eine Design-Entscheidung, und es war eine gute.
Die Codestruktur war ebenfalls sauber. Ordentliche Komponententrennung, semantisches HTML, CSS Custom Properties für das Farbsystem, und keine überall verstreuten Inline-Styles. Wenn ein Junior-Entwickler das als Pull Request eingereicht hätte, würde ich es mit kleinen Anmerkungen genehmigen.
Ich führte ein Lighthouse-Audit am Output durch: 94 Performance, 100 Accessibility, 92 Best Practices. Diese Zahlen sind echt. Das ist besser als das, was ich von manchen handgebauten Produktionsseiten bekomme.
Test 3: Der Minecraft-Klon — Unendliches Terrain, fehlende Blöcke
Hier wurde es interessant — und hier zeigte M2.7 seine erste echte Limitation.
Ich bat um eine Minecraft-artige Voxelwelt mit unendlicher Terrain-Generierung, Texturen, einer Inventarleiste und einfacher Block-Interaktion. Die Terrain-Generierung war beeindruckend: Perlin-Noise-basierte Heightmaps, die überzeugende sanfte Hügel, Täler und gelegentlich Steilwände erzeugten. Verschiedene Biome gingen fließend ineinander über. Gras-, Erde-, Stein- und Sandtexturen wurden korrekt basierend auf Höhe und Biom-Typ angewendet.
Die Inventarleiste am unteren Bildschirmrand sah richtig aus. Auswählbare Slots mit hervorgehobenen Rändern. Verschiedene Blocktypen mit passenden Icons dargestellt.
Aber Blockabbau — die Kernmechanik von Minecraft — fehlte. Man konnte Blöcke anschauen, man konnte das Fadenkreuz sehen, man konnte verschiedene Blocktypen im Inventar auswählen. Man konnte nur nicht mit der Welt interagieren. Kein Abbauen. Kein Platzieren. Das Modell baute einen wunderschönen Voxel-Landschaftsbetrachter, kein Spiel.
Ich versuchte, M2.7 in einer Folgeanfrage die Interaktionsebene hinzufügen zu lassen. Es fügte ein Raycasting-System für die Blockauswahl hinzu (korrekter Ansatz), aber die tatsächliche Entfernungs- und Platzierungslogik war fehlerhaft. Blöcke verschwanden von der falschen Position, oder die Platzierung war um eine Einheit auf der Y-Achse versetzt. Nach drei Iterationen funktionierte der Blockabbau, aber die Platzierung war immer noch inkonsistent.
Das ist die Art von Aufgabe, bei der Opus 4.6's Beharrlichkeit — drei oder vier unabhängige Lösungsansätze ausprobieren, bevor es aufgibt — das Problem letztendlich geknackt hätte. M2.7 kreiste immer wieder um denselben Ansatz mit kleinen Variationen, anstatt das Raycast-zu-Voxel-Koordinaten-Mapping grundlegend zu überdenken.
Terrain-Generierung: 9/10. Block-Interaktion: 4/10. Wenn du einen Voxel-Renderer brauchst, ist das großartig. Wenn du einen spielbaren Minecraft-Klon brauchst, musst du mehr iterieren als ich erwartet hatte.
Test 4: Der Casino-Spielautomat — Wo M2.7 Opus schlug
Das war der Test, der mich innehalten ließ. Und ich muss genau erklären warum, denn „es hat einen guten Spielautomaten gebaut" erfasst nicht, was tatsächlich passiert ist.
Ich gab M2.7 einen einzigen Prompt: Baue einen interaktiven Casino-Spielautomaten mit Animationen, Zufallslogik, visuellem Feedback und einem Credit-System. Kein zusätzlicher Kontext. Keine Referenzbilder. Ein Versuch.
Die Walzen drehten sich unabhängig voneinander mit realistischen Verzögerungskurven — jede Walze stoppte etwas nach der vorherigen, was diesen befriedigenden Kaskadeneffekt erzeugte, den man von echten Spielautomaten kennt. Die Symbole waren distinkt und gut gestaltet (als SVG gerendert, keine Emoji). Die Zufälligkeit war nicht einfach Math.random() — M2.7 implementierte ein gewichtetes Wahrscheinlichkeitssystem, bei dem bestimmte Symbolkombinationen seltener waren als andere.
Die Gewinnerkennung war der Teil, der mich am meisten beeindruckte. Sie prüfte horizontale Linien, diagonale Linien und hatte sogar eine spezielle Animation für Drilling- vs. Zwei-Paar-Kombinationen. Gewinnbeträge wurden korrekt basierend auf der Seltenheit der Kombination berechnet. Credits wurden mit einer flüssigen Zählanimation aktualisiert statt eines sofortigen Nummernwechsels.
Und das visuelle Feedback. Bildschirmerschütterung bei großen Gewinnen. Konfetti-Partikel bei Jackpots. Ein subtiler Leuchteffekt auf den Gewinnsymbolen. Sound-ready Event-Hooks (kein tatsächliches Audio, aber der Code hatte korrekt platzierte Callbacks, in die Soundeffekte eingefügt werden könnten).
Ich ließ denselben Prompt zum Vergleich durch Opus 4.6 laufen. Opus produzierte einen funktionalen Spielautomaten — korrekte Logik, sauberer Code, funktionierendes State Management. Aber die Animationen waren einfacher. Kein unabhängiges Walzen-Timing. Keine gewichteten Wahrscheinlichkeiten. Keine Partikeleffekte. Die Opus-Version war ein solides B+. Die Version von M2.7 war ein A.
Bei einem Modell, das 1/50stel der Kosten ausmacht und objektiv besseren Output bei einer kreativ-interaktiven Aufgabe produziert? Das ist keine inkrementelle Verbesserung. Das ist ein völlig anderes Gespräch.
Test 5: Der 360-Grad-Produktbetrachter — Best-in-Class-Output
Ich bat M2.7, einen 360-Grad-Produktbetrachter für ein Paar Kopfhörer zu bauen — die Art interaktives Widget, das man auf Premium-E-Commerce-Seiten sieht, wo man das Produkt drehen, zoomen und auf Features für Annotations-Popups klicken kann.
Das Ergebnis war eine der besten Single-Prompt-Generierungen, die ich dieses Jahr von irgendeinem Modell erhalten habe.
Flüssige Rotation beim Ziehen mit Momentum und Trägheit — lässt man die Maus los, dreht sich das Produkt weiter und wird allmählich langsamer bis zum Stillstand. Pinch-to-Zoom auf dem Trackpad mit korrekten Grenzen, sodass man weder unendlich hinein- noch zu einem Punkt herauszoomen konnte. Feature-Annotationspunkte an Schlüsselstellen des Produkts (Ohrmuscheln, Kopfbandverstellung, Bedienfeld), die sich beim Klicken zu Infokarten entfalteten.
Die Infokarten hatten saubere Typografie, korrektes Z-Index-Management, sodass sie nie hinter dem Produkt verschwanden, und eine schöne Fade-in-Animation. Schließen-Buttons funktionierten. Das Klicken auf eine neue Annotation schloss automatisch die vorherige.
Der Code verwendete CSS Transforms für die Rotation — keine schwere 3D-Bibliothek erforderlich. Das bedeutet, es würde auf Mobilgeräten ohne jede Optimierungsarbeit flüssig laufen. Ich testete es auf meinem Handy über einen schnellen lokalen Server, und die Touch-Interaktionen fühlten sich nativ an.
Wenn du eine E-Commerce-Seite baust und eine Produkt-Showcase-Komponente brauchst, würde dir der Output dieses einzelnen Prompts einen vollen Entwicklungstag sparen. Vielleicht zwei.
Test 6: Der animierte Schmetterling und das Gold Miner-Spiel
Zwei kleinere Tests, die verschiedene Aspekte von M2.7's Fähigkeiten offenbaren.
Der animierte Schmetterlings-Prompt — mein Standard-SVG-Generierungstest — produzierte ein 8/10-Ergebnis. Geschichtete Flügelgeometrie mit Verlaufsfüllungen, CSS-Keyframe-Animation mit natürlichem Easing und ein überzeugendes Flugmuster. Verglichen mit dem, was ich von GLM5 beim selben Test bekam, war M2.7's Schmetterling bei den Verlaufsübergängen etwas weniger raffiniert, hatte aber besseres Animations-Timing. Die Flügel bewegten sich mit einer subtilen Asymmetrie, die den Flug organisch wirken ließ statt mechanisch.
Das Casual-Cartoon-Gold Miner-Spiel war eine größere Überraschung. Ich erwartete eine Basismechanik mit herabfallender Greifklaue. Was ich bekam, war ein vollständiges Spiel mit wählbaren Modi: Story, Arcade, Versus und Co-op (die letzten beiden als Split-Screen in einem einzelnen Browserfenster). Ein Audio-Einstellungsmenü mit Schiebereglern für Musik, SFX und Umgebungslautstärke. Ein Shop-System, in dem man verdientes Gold für Upgrades ausgeben konnte — stärkere Klaue, schnelleres Einziehen, Magnetaufsatz. Und ein Upgrade-Baum, der zwischen den Runden persistent war.
Die Spiellogik war solide. Die Klaue schwang mit korrekter Pendelphysik. Verschiedene Objekte (Goldklumpen, Steine, Diamanten, Dynamit) hatten unterschiedliche Gewichte, die die Einzugsgeschwindigkeit beeinflussten. Das Punktesystem war ausbalanciert genug, dass sich frühe Runden erreichbar anfühlten, während spätere Runden strategische Upgrades erforderten.
War es bereit für den App Store? Nein. Die Kollisionserkennung hatte Randfälle, bei denen die Klaue in bestimmten Winkeln durch Objekte hindurchglitt. Der Versus-Modus hatte ein Timing-Synchronisationsproblem, bei dem die Klaue von Spieler 2 gelegentlich einen leichten Geschwindigkeitsvorteil bekam. Aber als Prototyp, der aus einem einzigen Prompt generiert wurde? Der Umfang und die Vollständigkeit waren bemerkenswert.
Die Kostenrechnung, die alles verändert
Hier muss ich über Zahlen sprechen, denn die Benchmarks und die Demo-Qualität spielen nur eine Rolle, wenn du es dir leisten kannst, das Modell in der Produktion einzusetzen.
MiniMax M2.7 Preise auf OpenRouter:
| Metrik | MiniMax M2.7 | Opus 4.6 | Verhältnis |
|---|---|---|---|
| Input-Tokens (pro 1M) | $0,30 | ~$6,00 | 20x günstiger |
| Output-Tokens (pro 1M) | $1,20 | ~$12,00 | 10x günstiger |
| Context window | 24.000 Tokens | 200.000 Tokens | Opus: 8x größer |
Es gibt auch einen „Fast Mode", der die Kosten für niedrigere Latenz verdoppelt — $0,60 Input und $2,40 Output. Selbst zu Fast-Mode-Preisen arbeitest du immer noch zu einem Bruchteil dessen, was Opus oder GPT-5.3-Codex kosten würden.
Um das in die Praxis zu übersetzen: Eine typische Coding-Session, bei der ich 50.000 Input-Tokens sende und 30.000 Output-Tokens empfange, würde mich mit M2.7 ungefähr $0,051 kosten. Dieselbe Session mit Opus 4.6 käme auf rund $0,66. Über einen Monat intensiver täglicher Nutzung ist das der Unterschied zwischen einer $15-Rechnung und einer $200-Rechnung.
Das context window von 24.000 Tokens ist der klare Kompromiss. Wenn du mit riesigen Codebases arbeitest oder lange Dokumente zur Analyse einspeist, stößt du schnell an diese Grenze. Für fokussierte Einzelaufgaben — generiere diese Komponente, baue dieses Spiel, erstelle diese Landingpage — sind 24K völlig ausreichend. Aber für die Art erweiterter Agent-Workflows, bei denen das Modell den Kontext über Dutzende von Dateien und Hunderte von Funktionssignaturen halten muss, würde ich immer noch zu Opus oder Sonnet 4.6 mit seinem Millionen-Token-Beta-Fenster greifen.
Das Modell ist über mehrere Kanäle zugänglich. OpenRouters API ist für Entwickler am unkompliziertesten. Kilo Code — ein Open-Source-CLI-Tool — bietet Integration mit kostenlosen Credits inklusive, was eine hervorragende Möglichkeit zum Testen ohne finanzielle Verpflichtung darstellt. MiniMax bietet auch ihre eigene Chatbot-Oberfläche für kostenlosen Zugang, und es gibt Pay-as-you-go-Token-Pakete, wenn du direkt über ihre Plattform gehen möchtest. Das MiniMax-Team bietet neuen Nutzern 12% Rabatt auf Token-Pakete, was die ohnehin günstigen Preise noch zugänglicher macht.
Wenn du lieber jemanden hättest, der produktionsreife KI-Integrationen für dich baut — Agent-Systeme, API-Pipelines oder Multi-Modell-Architekturen — nehme ich solche Projekte an. Du kannst sehen, was ich gebaut habe auf fiverr.com/s/EgxYmWD.
Wo M2.7 zu kurz kommt — Die ehrliche Bewertung
Ich war bisher enthusiastisch. Zeit, auf die Bremse zu treten.
Das context window ist eine echte Einschränkung. 24.000 Tokens klingen nach viel, bis du eine React-Komponente debuggst, die aus fünfzehn anderen Dateien importiert. Ich stieß bei einer Multi-Datei-Refactoring-Aufgabe an die Wand, bei der M2.7 schlicht nicht genug Kontext halten konnte, um die vollständige Abhängigkeitskette zu verstehen. Opus bewältigt das mühelos. M2.7 erfordert, dass du chirurgischer mit dem bist, was du einspeist.
Iteratives Debugging erreicht eine Grenze. Der Minecraft-Test legte das offen. Wenn M2.7's erster Ansatz für ein Problem nicht funktioniert, tendieren der zweite und dritte Versuch zu kleinen Variationen derselben Strategie. Opus und GPT-5.3-Codex probieren grundlegend andere Ansätze. M2.7 neigt dazu, sich auf seine anfängliche Hypothese einzuschießen. Bei einfachen Bugs ist das in Ordnung — der erste Ansatz liegt meistens nah dran. Bei komplexen architektonischen Problemen wirst du mehr Runden damit verbringen, das Modell in Richtung alternativer Lösungen zu lenken.
Die Selbstevolution ist beeindruckend, aber undurchsichtig. MiniMax behauptet 100+ Runden autonomer Verbesserung mit einer 30%igen Leistungssteigerung. Ich glaube an die Ergebnisse — die Benchmark-Zahlen und meine eigenen Tests bestätigen das. Aber der Prozess selbst ist eine Black Box. Wir wissen nicht, welche spezifischen Fähigkeiten verbessert wurden, welche Kompromisse während der Selbstoptimierung eingegangen wurden, oder ob das Modell Leistung in Bereichen geopfert hat, die von den internen Evaluierungs-Sets nicht gemessen wurden. Die Selbstevolutions-Story ist überzeugend, aber sie erfordert ein gewisses Maß an Vertrauen in MiniMax' Evaluierungsmethodik.
Keine visuellen oder multimodalen Fähigkeiten. Dies ist ein Text-rein-Text-raus-Modell. Du kannst ihm keine Screenshots eines Designs zeigen und bitten, das Layout nachzubauen. Du kannst ihm kein Bild einer Fehlermeldung zeigen und bitten, daraus zu debuggen. Für Entwickler, die sich an multimodale Workflows mit Claude oder GPT gewöhnt haben, ist das ein Rückschritt in der Flexibilität.
Chinesisches Unternehmen, geopolitische Erwägungen. Ich werde hier direkt sein, weil ich denke, dass es für bestimmte Anwendungsfälle relevant ist. MiniMax hat seinen Sitz in China. Für persönliche Projekte, Open-Source-Arbeit und allgemeine Entwicklung ist das irrelevant — der generierte Code läuft lokal, und die API-Aufrufe enthalten deine Prompts, genau wie bei jedem anderen Modellanbieter. Aber für Enterprise-Deployments mit sensitivem geistigem Eigentum oder staatsnaher Arbeit werden manche Organisationen Compliance-Anforderungen haben, die die Jurisdiktion des Anbieters berücksichtigen. Kenne deine Einschränkungen.
Die Multi-Agent-Architektur — M2.7's verborgene Stärke
Hier ist etwas, das in keinem meiner einzelnen Tests zum Vorschein kam, aber offensichtlich wurde, als ich herauszoomte und das Muster betrachtete.
M2.7 wurde speziell für Multi-Agent-Orchestrierung trainiert. Das bedeutet, es ist nicht nur gut darin, Aufgaben auszuführen — es ist gut darin, Aufgaben zu planen, komplexe Workflows in Schritte aufzuteilen und zwischen verschiedenen Ausführungsphasen zu koordinieren. MiniMax nennt diese „Agent Teams" — Cluster von KI-Agenten, die mit unterschiedlichen Rollen zusammenarbeiten.
In der Praxis bedeutet das für Entwickler, die M2.7 über Tools wie Kilo Code oder OpenRouter nutzen, dass das Modell bei strukturierten Mehrstufen-Workflows glänzt. Recherche → Analyse → Generierung → Review. Es zerlegt Probleme natürlicherweise in Phasen und bewahrt Konsistenz über die Schritte hinweg.
Ich testete dies, indem ich M2.7 einen komplexen Prompt gab: „Recherchiere die Top 5 Projektmanagement-Tools, erstelle eine Vergleichsmatrix, generiere einen Empfehlungsbericht und baue ein Slide-Deck, das die Ergebnisse zusammenfasst." Das Modell gab nicht alles in einer einzigen Antwort aus. Es unterteilte die Aufgabe in klare Phasen, bezog sich auf seine eigenen früheren Outputs beim Aufbau nachfolgender Phasen und wahrte ein konsistentes analytisches Framework durchgehend.
Die Recherche-Qualität war angemessen — nicht so tiefgehend oder aktuell wie das, was man von einem Modell mit Internetzugang bekäme, aber das strukturelle Denken war stark. Die Vergleichsmatrix war gut organisiert mit konsistenten Kriterien. Der Bericht zitierte spezifische Erkenntnisse aus der Matrix. Das Slide-Deck (als HTML/CSS gerendert) griff die wichtigsten Visualisierungen und Datenpunkte aus dem Bericht auf.
MiniMax nahm über MLE Bench Lite an 22 ML-Wettbewerben teil und erreichte eine Medaillenrate von 66,6% — gleichauf mit Gemini 3.1. Das ist kein Coding-Benchmark. Das ist ein Maß für End-to-End-Problemlösung: die Aufgabe verstehen, einen Ansatz entwerfen, ihn implementieren und iterieren, bis die Ergebnisse wettbewerbsfähig sind. Die Tatsache, dass M2.7 Gemini bei dieser Metrik ebenbürtig ist, sagt mir, dass das Multi-Agent-Training echte Arbeit leistet.
Wer dieses Modell tatsächlich nutzen sollte
Nach vier Tagen Tests habe ich ein klares mentales Modell dafür entwickelt, wo M2.7 hingehört.
Verwende M2.7, wenn:
- Du hochwertige Frontend-Generierung brauchst und die Aufgabe in 24K Kontext passt
- Du Prototypen, Demos oder MVPs baust, bei denen Geschwindigkeit und Kosten wichtiger sind als architektonische Perfektion
- Du kreativ-interaktive Outputs willst (Spiele, Visualisierungen, Produktbetrachter) — hier hat mich M2.7 wirklich überrascht
- Du Hochvolumen-Batch-Operationen durchführst, bei denen die Pro-Token-Kosten direkt dein Budget beeinflussen
- Du mehrstufige Aufgabenplanung und Workflow-Zerlegung brauchst
- Du Modelle für agentische Anwendungen evaluierst und Opus-Niveau-Reasoning zu einem radikal anderen Preis willst
Bleibe bei Opus/Sonnet, wenn:
- Du große Context Windows brauchst (24K vs 200K ist eine echte Kluft bei komplexen Codebases)
- Du iterativ an architektonisch komplexen Problemen debuggst, bei denen das Modell grundlegend andere Ansätze versuchen muss
- Du multimodale Eingabe brauchst (Screenshots, Bilder, Diagramme)
- Du die tiefstmögliche Instruktionsbefolgung über 60+ Austausch-Konversationen brauchst
- Enterprise-Compliance einen in den USA ansässigen Modellanbieter erfordert
Der Sweet Spot ist, M2.7 neben deinem Hauptmodell zu nutzen, nicht anstelle davon. Ich habe angefangen, meine schnellen Generierungsaufgaben — Landingpages, UI-Komponenten, kreative Demos, Spielprototypen — über M2.7 zu routen und Opus für komplexes Debugging, Long-Context-Architekturarbeit und Multi-Datei-Refactoring-Sessions aufzusparen. Die Kosteneinsparungen sind signifikant genug, dass sich dieser hybride Ansatz innerhalb einer Woche rechnet.
Was die Selbstevolution für die Zukunft bedeutet
Ich möchte mit dem Thema schließen, das mich tatsächlich wach hält, seit ich M2.7 teste. Nicht die Benchmarks. Nicht der Preis. Die Selbstverbesserungsschleife.
Ein Modell, das 100+ Runden autonomer Optimierung durchlief und 30% besser herauskam, ist nicht einfach ein Produktupdate. Es ist ein Proof of Concept für ein grundlegend anderes Entwicklungsparadigma. Traditionelle KI-Entwicklung läuft so: Menschen sammeln Daten, Menschen entwerfen Trainingsläufe, Menschen evaluieren Ergebnisse, Menschen entscheiden, was geändert werden soll. M2.7's Pipeline ersetzte den Menschen bei 30-50% dieser Phasen — und die Ergebnisse waren wettbewerbsfähig mit Modellen, die vollständig von menschengeführten Teams entwickelt wurden.
Laut MiniMax' technischem Blog ist ihre Vision, „schrittweise in Richtung voller Autonomie" in der Modellentwicklungspipeline überzugehen. Was passiert, wenn die nächste Version 70% abdeckt? 90%? Wenn die Iterationszahl von 100 Runden auf 10.000 steigt?
Ich baue seit einer Weile selbstverbessernde KI-Systeme, und ich kann dir aus Erfahrung sagen — das erste Mal, wenn du ein System siehst, das sich wirklich ohne deinen Input verbessert, verändert es die Art, wie du über KI-Entwicklung denkst. M2.7 ist das erste kommerziell verfügbare Modell, bei dem das Modell selbst ein bedeutender Teilnehmer an seiner eigenen Erschaffung war.
Das ist kein Gimmick. Das ist eine Entwicklungsrichtung.
Im Moment, heute, ist MiniMax M2.7 ein extrem kosteneffizientes Modell, das bei kreativem Coding, Frontend-Generierung und mehrstufiger Aufgabenausführung weit über seiner Gewichtsklasse spielt. Es hat klare Einschränkungen — das context window, die Decke beim iterativen Debugging, das Fehlen multimodaler Eingabe. Ich würde meinen Opus-Workflow nicht damit ersetzen.
Aber ich füge es meinem Werkzeugkasten hinzu. Der Spielautomat-Test, der 360-Grad-Produktbetrachter, das Gold Miner-Spiel — das waren keine Outputs eines Budget-Modells, das versucht mitzuhalten. Das waren Outputs eines Modells, das in bestimmten Bereichen bereits führend ist.
Die Frage, die mir nicht aus dem Kopf geht: Wenn ein sich selbst weiterentwickelndes Modell für $0,30 pro Million Input-Tokens heute diese Qualität produziert, wie sieht dann Version M2.8 aus? Und wer baut es — das MiniMax-Team oder M2.7 selbst?
Häufig gestellte Fragen
Ist MiniMax M2.7 kostenlos nutzbar?
Ja, du kannst M2.7 kostenlos über den MiniMax Agent Web-Chatbot, OpenRouters kostenlosen Tarif und Kilo Code CLI mit enthaltenen Credits nutzen. Bezahlter API-Zugang beginnt bei $0,30 pro Million Input-Tokens über OpenRouter oder MiniMax' eigene Plattform.
Wie schneidet MiniMax M2.7 im Vergleich zu Claude Opus 4.6 ab?
M2.7 nähert sich bei Coding-Benchmarks der Opus-Leistung (56,22% SWE-Bench Pro vs. Opus' Spitzenwert) zu ungefähr 1/20stel der Input-Kosten. Opus gewinnt beim context window (200K vs. 24K Tokens), bei der Beharrlichkeit beim iterativen Debugging, bei multimodaler Eingabe und bei der Instruktionsbefolgung in langen Konversationen. Für eine detaillierte Opus-Analyse siehe mein Opus 4.6 Hands-on Review.
Was bedeutet „selbstevoluierende KI" bei MiniMax M2.7?
MiniMax M2.7 führte autonom 100+ Runden der Selbstverbesserung durch — analysierte eigene Fehler, modifizierte seinen Code, evaluierte Ergebnisse und behielt oder verwarf Änderungen — ohne menschliches Eingreifen. Dieser Prozess brachte eine 30%ige Leistungssteigerung und stellt einen frühen Proof of Concept für KI-Systeme dar, die an ihrer eigenen Entwicklung teilnehmen.
Wie groß ist das context window von MiniMax M2.7?
M2.7 hat ein context window von 24.000 Tokens. Das reicht für fokussierte Einzelaufgaben-Generierung (Komponenten, Spiele, Landingpages) aus, ist aber einschränkend für große Codebase-Analysen oder erweiterte Multi-Datei-Refactoring-Sessions, die das gleichzeitige Halten von Kontext über viele Dateien erfordern.
Kann ich MiniMax M2.7 mit Coding-Tools wie Kilo Code nutzen?
Ja. MiniMax hat offizielle Integrationsdokumentation für Kilo Code (VS Code-Erweiterung und CLI), Claude Code, Cursor und andere große Entwicklertools bereitgestellt. Kilo Code bietet kostenlose Credits für die M2.7-Nutzung, was es zu einer der einfachsten Möglichkeiten macht, das Modell in einem echten Entwicklungsworkflow zu testen.
Lass uns zusammenarbeiten
Du möchtest KI-Systeme aufbauen, Workflows automatisieren oder deine technische Infrastruktur skalieren? Ich helfe dir gerne.
- Fiverr (individuelle Builds & Integrationen): fiverr.com/s/EgxYmWD
- Portfolio: mejba.me
- Ramlit Limited (Enterprise-Lösungen): ramlit.com
- ColorPark (Design & Branding): colorpark.io
- xCyberSecurity (Sicherheitsdienste): xcybersecurity.io