XPENG beskriver modellen bag robotten IRON i en ny rapport

XPENG Robotics lagde den 15. september 2026 en rapport på arXiv med titlen XPACE: Joint World and Action Modeling from Heterogeneous Experience. Seksten forfattere står på den. Rapporten er selskabets egen beskrivelse af den model, der styrer den humanoide robot IRON.

XPENG IRON humanoid robot i et teststativ foran tre skåle på et hvidt bord

Modellen har to funktioner, og de deler den samme videomodel. I den ene ser den, hvad kameraet viser, læser en instruktion i tekst og forudsiger både robottens næste bevægelser og den video, bevægelserne fører til. I den anden får den bevægelserne udefra og forudsiger kun videoen: hvad vil der ske, hvis armene gør sådan her? Den anden funktion er simulatoren, og uden den kan modellen ikke træne på materiale, den selv laver.

Materialet

5.000 timers video, ordnet i fire lag. Nederst almindelige optagelser filmet fra personens egen synsvinkel, uden oplysninger om, hvordan hænderne bevæger sig. Derover menneskeoptagelser, hvor hånd- og håndledsbevægelser er målt. Så optagelser fra omgivelser, der ligner robottens arbejdsplads. Øverst IRON selv, fjernstyret af et menneske.

Et femte sæt består af forsøg, der gik galt. Det træner kun simulatoren, og robotten lærer ikke at gøre dem efter. Uden det ville simulatoren fremstille vellykkede forløb, også når den fik forkerte bevægelser ind.

Simulatoren laver fejlene selv

Det nye i rapporten er, hvad simulatoren bruges til. XPENG tager en korrekt udført bevægelse, skubber robottens ene hånd væk fra udgangsstillingen og beder simulatoren fremstille både afvigelsen og vejen tilbage. Ender forløbet ikke tæt nok på udgangsstillingen, ryger det ud; målestokken er, hvor meget slutbilledet ligner den. Resten sætter selskabet sammen med den optagelse, bevægelsen oprindelig kom fra, og træner en kopi af modellen videre på det. Blandingen er 8 procent syntetisk materiale og 92 procent af det materiale, modellen i forvejen blev trænet på.

Målingerne er lavet på IRON-R01-1.11 med 20 forsøg pr. opgave. Efter den ekstra træning går succesraten fra 61,7 til 86,7 procent i gennemsnit over tre opgaver: at lægge en banan i en kurv, hælde vand op og række en cola til en person. Størst er forskellen på hældeopgaven, fra 50 til 95 procent.

Menneskematerialet er målt for sig. En model, der kun er trænet på robotoptagelser, klarer 50 procent af forsøgene, når bananen flyttes rundt på fem placeringer; med hele materialet 80 procent. Står der genstande i billedet, som robotten aldrig har set, er de samme to tal 30 og 50 procent.

Forsøgets grænser

Rapporten tager selv et forbehold: sammenligningen er før og efter finjusteringen, og den skiller ikke virkningen af det syntetiske materiale fra den ekstra træningstid. Robotten står i et laboratorium, hængt op i et stativ, og opgaverne foregår på et bord. Der er ikke målt noget om en robot, der arbejder i en butik.

XPENG har tidligere sagt, at IRON skal i masseproduktion ved udgangen af 2026 og stå i selskabets egne butikker fra første kvartal 2027. Det kom på CVPR i juni. Rapporten siger intet om nogen af delene.

Forbindelsen til bilerne

Ved G9L-lanceringen den 17. september sagde XPENG, at IRON-robottens flersprogede dialog senere kommer i bilerne, og at VLA og VLM fra bilerne skal bruges i robotten. Samme AI-grundlag, to produkter, er selskabets egen formulering. Selskabet har ikke sat dato på noget af det, og intet er meldt ud for Europa.

Billeder: XPENG

Kilder

XPENG Robotics: XPACE, teknisk rapport på arXiv (15. september 2026)

XPENG Robotics: XPACE-projektside med demonstrationsfilm

XPENG på Weibo, 17. september 2026 kl. 19.11 Beijing-tid - produktionslinjen til robotter, og at VLA og VLM fra bilerne skal bruges i robotten

XPENG på Weibo, 17. september 2026 kl. 20.36 Beijing-tid - Master Agent, og IRON-robottens flersprogede dialog i bilerne