İçeriğe geç / Skip to content / Zum Inhalt

KI-Wochenrückblick: Wissenschaft, Roboter, offene Modelle

Ahmet Balaman

10 Min. Lesezeit

Vibe CodingKI-NachrichtenGPT-6 AstraHumanoider RoboterOffene ModelleOlmo Core 3IQuest Q1
KI-Wochenrückblick: Wissenschaft, Roboter, offene Modelle

Diese Woche machte KI nicht nur mit neuen Modellen Schlagzeilen, sondern auch mit auffälligen Ergebnissen in Wissenschaft, Robotik und Open Source. Ein Gegenbeispiel in der Plasmaphysik, die Entschlüsselung eines 217 Jahre alten Geheimbriefs, ein humanoider Roboter beim Badminton und mehrere neue offene Modelle stehen oben auf der Liste.

Dieser Artikel fasst die Abschnitte des wöchentlichen KI-News-Videos des YouTube-Kanals AI Search zusammen, die ich in anderen Artikeln nicht behandelt habe, und erweitert sie um Projektseiten und Ankündigungstexte; der Link zum Video steht am Ende. Das ist eine Nachrichtenzusammenstellung, ich habe die Arbeiten weder getestet noch verifiziert. Die Zahlen stammen von den eigenen Seiten der Autorinnen und Autoren.

Die großen Modell- und Produktmeldungen der Woche stehen in eigenen Artikeln: Claude Sonnet 5.5, GPT-6.1 Sol, OpenAI Dots und Gemini 4 Argon.

KI in der Wissenschaft: eine Plasmavermutung und Napoleons Chiffre

Ein Gegenbeispiel zur Grad-Vermutung in der Plasmaphysik

Fusionsreaktoren müssen Plasma, ein extrem heißes Gas aus geladenen Teilchen, mit Magnetfeldern an Ort und Stelle halten. Ein Reaktortyp namens Stellarator nutzt dafür sehr komplizierte dreidimensionale Magnetfelder. In der Plasmaphysik war lange eine Frage offen: Kann Plasma in einem dreidimensionalen Magnetfeld in einem stabilen, glatten Gleichgewicht liegen, auch wenn der Druck von Ort zu Ort variiert? Lange galt: Das sei vielleicht nur möglich, wenn das Feld bestimmte Symmetrien hat (Grad-Vermutung).

Diese Woche boten zwei Arbeiten Gegenbeispiele zu dieser Sicht. Die erste ist die Arbeit „Counterexamples to Grad's conjecture" von Javier Gómez-Serrano, Lukas Liehr und Mitchell A. Taylor; ihr GitHub-Repository enthält eine formale Verifikation des Hauptergebnisses in Lean 4. Das Theorem besagt, dass es eine glatte Familie magnetohydrostatischer Gleichgewichte mit nur N-zähliger Drehsymmetrie gibt; die inneren Mitglieder der Familie sind nicht isoliert, es ist also eine kontinuierliche Familie. Die zweite Arbeit ist Landremans Repository „analytic 3D MHD equilibria". Laut Video nutzten Forschende GPT-6 Astra, um zwei verschiedene ungewöhnliche Konfigurationen zu finden, in denen Plasma stabil und glatt bleiben kann.

Die Rolle der KI liegt hier im Finden von Gegenbeispielen; ein Ergebnis zu erzeugen und seinen Beweis zu prüfen, sind getrennte Aufgaben. Formale Verifikation in Lean heißt, dass eine Maschine Letzteres prüfen kann. Der Moderator im Video erwartet bei Problemen nahe der reinen Mathematik mehr solcher Lösungen: Eine Lösung ist schwer zu finden und leicht zu prüfen. Das ist eine Meinung. Repositories: Grad-Conjecture, analytic_3d_equilibria.

Napoleons 217 Jahre alter Geheimbrief

Carter Church veröffentlichte einen Bericht (18. September 2026) über die Entschlüsselung eines chiffrierten Briefs, der 1809 an General Marmont ging. Der Brief war nur von einer einzelnen Tafel in einer französischen Armeezeitschrift von 1969 bekannt und stand auf der Liste ungelöster historischer Chiffren. Die Befunde des Autors:

  • Datum: Entgegen dem falschen Datum der Zeitschrift wird der Brief auf März 1809 gelegt, in die zwei Wochen vor Österreichs Einmarsch in Bayern. Am 16. März 1809 hatte Napoleon seinen Stiefsohn Eugène angewiesen, Marmont einen chiffrierten Brief zu schicken.
  • Aufbau: 1.300 Chiffreeinheiten und 155 verschiedene Zeichen. Es ist eine homophone Chiffre: Häufige Buchstaben bekommen mehrere Zeichen, Buchstabenzählen hilft also nicht. 29 der Zeichen stehen für ganze Wörter, nicht für Buchstaben („de", „que", „les", „vous", „général" und so weiter).
  • Vorher bekannt: Die Tabelle des französischen Kryptologiehistorikers Daniel Tant nennt nur 33 Buchstabenwerte; das deckt 435 der 1.300 Einheiten ab, etwa ein Drittel.
  • Vorgehen: GPT-6 Astra zerschnitt die Tafel in Zeilen, entschied, welche von 175 handgezeichneten Zeichen dasselbe Zeichen waren, und brach dann die Chiffre. Ein Löser ordnete den übrigen Zeichen per Simulated Annealing Buchstaben zu und bewertete jeden Kandidaten anhand französischer Buchstabenstatistik (3-, 4- und 5-Gramme). Der vorgeschlagene Wert jedes Zeichens wurde mit jedem Vorkommen auf der Tafel abgeglichen.
  • Zeit: Etwa sechs Stunden Modell-Laufzeit. Alles stammte aus einem einzigen Bild.
  • Verifikation: Der Löser wurde von Grund auf neu gestartet, wobei Marmonts Memoiren und alle Texte der napoleonischen Zeit aus seinem Sprachmodell entfernt waren, und fand dieselbe Lesung; der Schlüssel hängt also nicht davon ab, dass das Modell diese Geschichte vorher kannte.

Das Ergebnis ist ein militärisches Briefing mit den Stellungen der französischen und verbündeten Armeen kurz vor Österreichs Kriegseintritt. Der Autor stellt auch das Skript, das die Lösung neu erzeugt, als Download-Paket bereit. Ausführlicher Bericht: Breaking the Marmont Cipher, 1809.

Robotik: Tastsinn und Badminton

TactileStep: Tastsinn in den Füßen

Parkour-Strategien humanoider Roboter können Gelände überqueren, aber das Erfüllen der Aufgabe kann Probleme wie harte Landungen, Kantenkontakt und unsicheren Stand verdecken. Menschen regeln über Druckrückmeldung in den Füßen, wie sanft sie den Boden berühren; den meisten humanoiden Robotern fehlt dieser Sinn. TactileStep (CoRL 2026 Spotlight, Tsinghua-Universität) gibt dem Roboter über Sohlendruckmessung einen Tastsinn. Ein leichter Tastsimulator verwandelt starren Fuß-Gelände-Kontakt in ein Druckfeld; die Strategie nutzt diese Kontaktmerkmale im Training und auf dem echten Roboter, die Gangphasen werden online geschätzt.

Auf einem Unitree G1 berichtete Ergebnisse:

  • Bis zu 48,8 % weniger Spitzenkraft beim Aufsetzen.
  • Bis zu 30,1 dB weniger A-bewerteter Spitzen-Aufprallschall (gegenüber einer starken wahrnehmenden Basislinie).
  • Bis zu 23,8 % mehr Kontaktfläche im Stand.

In den Demos läuft der Roboter sanft Treppen hinauf und hinunter, über Schrägen, Plattformen und ebenen Boden. Der Code kommt „bald". Seite: tactilestep.github.io.

Ein humanoider Roboter spielt Badminton

Die Arbeit „Humanoid Badminton" von Forschenden der Tsinghua, der Chinese University of Hong Kong und weiterer Einrichtungen (bei der CoRL 2026 angenommen) brachte laut Video einem Unitree G1 das Badmintonspielen bei. Die Autoren sagen, es sei das erste reale humanoide Schlägersport-System, das anhaltende Ballwechsel mit Menschen mit mehreren Fertigkeiten zeigt, einschließlich hochdynamischer Sprungrückschläge. In der Demo spielt der Roboter Vorhand, Rückhand und Sprungrückschläge.

Die Herausforderung ist groß: Der Federball ist schnell, das Schlagfenster schmal, der Roboter muss Beine, Rumpf, Arm und Schläger binnen weniger Sekunden koordinieren, und brauchbare menschliche Bewegungsdaten sind knapp und unvollkommen. Die Lösung ist ein dreistufiges hierarchisches Reinforcement-Learning-Verfahren: (1) spärlich annotierte Schlagereignisse durch aufgabenrandomisierte Bewegungsaugmentierung zu variierten Schlagvarianten erweitern und so einen kontinuierlichen Fertigkeitsraum bilden, (2) ein übergeordneter Planer, der Fertigkeiten je nach Zustand des Federballs online kombiniert, und (3) ein kontextbedingter adversarialer Regularisierer, der natürliche Fertigkeitsnutzung fördert. Seite: humanoid-badminton.

3D und Objektinteraktion: PAMI und Point2Part

PAMI (Tübingen AI Center und Max-Planck-Institut für Informatik): Aus einem Text-Prompt und einem Objekt erzeugt es eine 3D-Ganzkörperbewegung eines Menschen, der mit dem Objekt interagiert. Die Idee, angelehnt an die Hough-Transformation: Körperteil-Anker „stimmen" über die Bewegung des Objekts ab. Zuerst erzeugt PamiGen in einem latenten Raum eine grobe Interaktion; dann verfeinert PamiRefiner die Kontaktgeometrie mit Oberflächensensoren für weite und kurze Reichweite. Ziel ist, Objektdrift, verpasste Kontakte und Durchdringung zu verringern. Getestet auf dem Datensatz InterAct. Laut Video ist der Code online, die Modelle sind geplant, die Lizenz ist MIT. Seite: coral79.github.io/pami.

Point2Part (Carnegie Mellon University): Sie setzen je gewünschtem Teil einen Punkt, und das Modell zerlegt das Objekt als vollständige Partition des Ganzen. Teile überlappen nicht, und ihre Vereinigung deckt das gesamte Objekt ab. Der Vergleich auf der Seite für das Erzeugen geschlossener Teile aus einem einzelnen Bild:

Methode Teil-CD (niedriger ist besser) [email protected] Durchdringung % Wasserdicht %
Point2Part 0,0534 0,686 0,01 100
OmniPart 0,0643 0,610 0,96 94,7
PartPacker 0,0811 0,540 1,25 86,0
PartCrafter 0,1275 0,300 2,45 70,5

Laut Video ist der Code online, Modell und Trainingscode sind geplant. Seite: Point2Part.

Neue offene Modelle

AstaBrief (Ai2)

Ai2 hat am 2. Oktober AstaBrief 8B als Open Source veröffentlicht. Es basiert auf Qwen3-8B; es verwandelt eine Forschungsfrage und abgerufene Literaturauszüge in einen Bericht mit Quellenangaben und schreibt den Bericht in einem Durchgang statt Abschnitt für Abschnitt. Trainiert wurde mit überwachtem Feintuning und Direct Preference Optimization (SFT + DPO) statt mit Reinforcement Learning; das Team wollte ein günstigeres Rezept als Reinforcement Learning ausprobieren, das instabil und teuer sein kann. Es wird in Astas Funktion „Bericht erstellen" als „Schnell"-Modus neben dem Claude-gestützten „Denken"-Modus angeboten: im Schnitt 51,1 Sekunden pro Bericht in der Asta-Pipeline gegenüber 178,5 Sekunden im Denken-Modus (etwa 3,5-mal schneller). Gewichte, Trainingsdaten und ein Beispiel-Workflow für Berichte aus Ihren eigenen PDFs sind offen. Ai2 weist auch darauf hin, dass der größte Teil von Training und Bewertung 2025 stattfand und die Vergleichsmodelle damals die Spitzenmodelle waren. Das volle 8B-Modell ist etwa 32 GB groß; Sie brauchen eine starke Grafikkarte. AstaBrief.

Olmo-core 3 (Ai2)

Kein neuer Chatbot, sondern eine offene Trainingsinfrastruktur, am 1. Oktober veröffentlicht, um große „Mixture-of-Experts"-Modelle (MoE) zu trainieren. Bei einem MoE läuft für jede Eingabe nur ein Teil des Modells; das ganze Modell muss aber dennoch im GPU-Speicher liegen, und das Weiterleiten der Eingaben an den richtigen Experten verursacht im Cluster Kommunikationskosten. Olmo-core 3 wechselt von der früheren Implementierung mit vollständig geshardetem Datenparallelismus (FSDP) zu verteiltem Datenparallelismus (DDP) und hält Experten dauerhaft auf den GPUs und leitet die passenden Daten zu ihnen. Messwerte auf der Seite:

  • Auf acht NVIDIA-B300-GPUs verarbeitete ein MoE mit 47 Milliarden Parametern 52.000 Tokens pro Sekunde und GPU; die frühere Implementierung schaffte 19.400 (etwa 2,7-fach).
  • Der Expertenpool wurde von 8 auf 128 erhöht, bei weiterhin vier gewählten Experten pro Token (etwa 3,2 Milliarden aktive Parameter); die Gesamtparameter stiegen von 4,6 auf 47 Milliarden, während der Trainingsdurchsatz um weniger als 5 % sank.
  • Dieselbe Infrastruktur wurde auch bei über einer Billion Gesamtparametern gemessen.

Technischer Bericht, Code und eine interaktive Demo sind offen. Olmo-core 3.

IQuest-Q1

Ein MoE-Modell für agentisches Programmieren, Schlussfolgern und mehrstufige Werkzeugnutzung, abgestimmt auf Kommandozeilenwerkzeuge wie Claude Code und Codex. Etwa 320 Milliarden Gesamtparameter und etwa 15 Milliarden aktive pro Token; 88 Schichten, 8 von 256 Experten aktiv, 524.288 Tokens Kontext. Nur Text; nicht multimodal. Die Entwickler empfehlen die vorgeschlagenen Einstellungen (Temperatur 1,0, Top-p 0,95, Top-k 20) und die Nutzung mit Claude Code 2.1.140 oder Codex 0.142. Für die Produktion SGLang oder vLLM mit OpenAI-kompatibler API. IQuest-Q1.

AREX-2 (BAAI)

Das dichte Langzeit-Agentenmodell der Beijing Academy of Artificial Intelligence mit 27 Milliarden Parametern; Apache-2.0-lizenziert, 262.144 Tokens Kontext. Es lernt, eine Lösung über mehrere Runden zu verbessern: vorschlagen, messen, reflektieren, überarbeiten. Es liest Werte, Logs, Fehler und Laufzeiten, um zu entscheiden, was es ändert. Trainiert wurde es auf Aufgaben des maschinellen Lernens und der algorithmischen Programmierung, bei denen sich das Ergebnis überprüfen lässt; das Verhalten übertrage sich auch auf Deep Research. Das Modell ist etwa 55 GB groß. AREX 2.

Was haben wir gelernt?

Für einzelne Entwickler sind die offenen Modelle am praktischsten: IQuest-Q1 und AREX-2 brauchen schwere Hardware, Modelle mit 8 Milliarden Parametern wie AstaBrief sind zugänglicher. Die Wissenschaftsmeldungen zeigen, dass KI dort am schnellsten vorankommt, wo Ergebnisse überprüfbar sind (formale Mathematik, Codeknacken); die Lean-Verifikation und der Test „liest sich der Schlüssel wie Französisch" sind zwei Beispiele. In der Robotik folgen die beiden Arbeiten demselben Muster: knappe, unvollkommene menschliche Daten in der Simulation vervielfachen und auf einen echten Roboter übertragen.

Häufig gestellte Fragen

Hat KI die Plasma-Vermutung widerlegt?

Zwei Arbeiten boten Gegenbeispiele zu dieser Vermutung. Laut Video fanden Forschende mit GPT-6 Astra zwei verschiedene Konfigurationen. Das Ergebnis von Gómez-Serrano, Liehr und Taylor wurde in Lean 4 formal verifiziert.

Wie lange dauerte die Entschlüsselung von Napoleons Brief?

Etwa sechs Stunden Modell-Laufzeit, aus einem einzigen Tafelbild. Der Brief war ein militärisches Briefing an General Marmont vom März 1809.

Was bringt TactileStep?

Durch Training mit Daten druckempfindlicher Einlegesohlen an den Roboterfüßen senkt es die Spitzenkraft beim Aufsetzen um bis zu 48,8 % und den Aufprallschall um bis zu 30,1 dB und erhöht die Kontaktfläche um bis zu 23,8 %.

Ist Olmo-core 3 ein Modell?

Nein, es ist eine Trainingsinfrastruktur, um MoE-Modelle effizienter zu trainieren. In Ai2s Messung brachte es bei einem MoE mit 47 Milliarden Parametern etwa den 2,7-fachen Durchsatz der früheren Implementierung.

Quelle

Kommentare