Figure Helix 2.5: 30 fremde Wohnungen, kein Training vor Ort — Erfolgsquote steigt von 9 auf 56 Prozent

- Helix 2.5 ist am 17. September 2026 erschienen, vortrainiert auf Figures Index-Datensatz menschlichen Verhaltens.
- Bewertung in 30 Wohnungen im Großraum San Francisco — in keiner wurde vorher trainiert.
- Vortraining hob die Erfolgsquote ohne Anpassung von 9 auf 56 Prozent.
- Drei Aufgaben: Wohnzimmer aufräumen, Handtücher falten, Betten machen.
Figure hat am 17. September Helix 2.5 vorgestellt. Das neuronale Netz wurde auf dem firmeneigenen Index-Datensatz menschlichen Verhaltens vortrainiert und anschließend in 30 Wohnungen im Großraum San Francisco getestet — in keiner dieser Wohnungen hatte der Roboter vorher Daten gesammelt. Der Erfolg ohne Anpassung stieg dadurch von 9 auf 56 Prozent.
Was neu ist. Figure bezeichnet Helix 2.5 als sein bisher leistungsfähigstes Netz. Aus einem einzigen vortrainierten Grundmodell entstanden drei Ganzkörper-Fähigkeiten: Wohnzimmer aufräumen, Handtücher falten und Betten machen. Ein Vergleichslauf mit identischer Steuerung, aber ohne Vortraining, kam auf 9 Prozent Erfolg — mit Vortraining auf 56 Prozent.
Was "Zero-Shot" in diesem Test heißt. Zero-Shot bedeutet hier: Der Roboter bekommt die Aufgabe in einer Wohnung, die er nie gesehen hat, mit Gegenständen, die er nie gesehen hat. Er darf sich nicht anpassen. Das heißt konkret: Es gibt keine Nachjustierung am Einsatzort, keine Einweisung, kein Nachtraining im Haus des Kunden.
Wie streng gemessen wurde. Die Testspielzeuge und Textilien wurden vorher weggelegt und von einem KI-Modell plus menschlicher Kontrolle geprüft, dass sie nicht in den Trainingsdaten vorkommen. Alle 30 Wohnungen liefen mit demselben gespeicherten Stand des Netzes. Erfolg gab es nur für die vollständig erledigte Aufgabe, ohne Teilpunkte — 13 bis 15 Spielzeuge im Wohnzimmer, 60 Sekunden Zeit pro Teil, Handtücher mit Eckenabstand unter etwa 2,5 Zentimetern, drei Minuten pro Handtuch. Griff ein Mensch zur Sicherheit ein, galt der Durchlauf als gescheitert.
Der Vorgänger und der Unterschied. Helix 02 konnte bereits eine Spülmaschine ausräumen und eine Logistikaufgabe 200 Stunden autonom fahren — allerdings in Umgebungen, in denen vorher Daten gesammelt wurden. Helix 2.5 überträgt das Gelernte erstmals auf fremde Haushalte, und genau dort liegt der Unterschied für einen späteren Verkauf.
Was das wirtschaftlich bedeutet. Dienstleister in Gebäudereinigung, Facility-Management und Pflege sollten die Zahl richtig lesen: Rund jede zweite Aufgabe gelang vollständig. Das ist ein großer Fortschritt in der Forschung und zugleich weit entfernt von einer Zusage an Kunden. Figure baut parallel die eigene Fabrik BotQ aus und hat den Index-Datensatz als Grundlage veröffentlicht.
| Getestete Wohnungen | 30 im Großraum San Francisco |
| Erfolgsquote ohne Anpassung | 56 Prozent (Vergleichslauf: 9 Prozent) |
| Aufgaben | Aufräumen, Handtücher falten, Betten machen |
| Trainingsgrundlage | Index-Datensatz menschlichen Verhaltens |
| Bewertung | ganze Aufgabe oder Durchfall, keine Teilpunkte |
| Vorgänger | Helix 02 (Spülmaschine, 200-Stunden-Logistiklauf) |
56 Prozent heißt: Fast jeder zweite Versuch scheiterte, und jeder Eingriff eines Menschen zählte als Fehler. Der Test sagt nichts über Dauerbetrieb, Preis oder Wartung aus.
Einordnung
Figure arbeitet am schwierigsten Teil der Haushaltsrobotik: der Übertragung auf unbekannte Räume. Wer im Facility-Management plant, sollte solche Modelle weiter beobachten — aber Verträge erst auf Basis von Feldtests im eigenen Objekt schließen, nicht auf Basis von Laborvideos.
Was würde ein Roboter in Ihrem Betrieb kosten?
Rechnen Sie Break-even und Monatsrate in 60 Sekunden aus — kostenlos, ohne Anmeldung.
Zum ROI-Rechner →