På en konference i Denver skrev XPENG ned, hvordan assistentsystemet er bygget

XPENG var i juni 2026 inviteret til CVPR for tredje gang. Dr. Xianming Liu, chef for selskabets center for generel intelligens, holdt oplæg på den første workshop om udrulning af grundmodeller til embodied AI, sammen med Tesla, Nvidia og Waymo og forskere fra University of California og University of Toronto. Oplægget hed Building the World Model for Autonomous Driving, og en XPENG-artikel om generering af kørselsscener blev antaget til konferencen.

Sammensat billede af en hvid humanoid robot, der går ved siden af en mørk XPENG X9, med et lille luftfartøj svævende og en skyline bagved

Det er sjældent, at XPENG forklarer sin egen teknik på engelsk uden for en pressemeddelelse, og det er grunden til at læse den her.

Arbejdsdelingen

XPENG beskriver det sådan: VLA 2.0 lærer af, hvordan mennesker kører, mens verdensmodellen lærer fysikkens love ved at forudsige, hvad der sker som det næste. VLA 2.0 lærer modellen, hvordan den skal handle, og verdensmodellen giver den forståelse af, hvordan omgivelserne udvikler sig efter hver handling.

Verdensmodellens tre evner hedder ræsonnement, styret generering og forudsigelse over lange forløb. Tre artikler er offentliggjort med links i meddelelsen: X-World, som laver fysisk plausibel fremtidig video ud fra bestemte bevægelsesinput og bruges i lukket simulering og til at generere træningsdata; X-Foresight, som er bygget ind i VLA 2.0 og forudsiger både fremtidige billeder fra flere vinkler og bilens egne handlinger; og X-Cache, som ifølge XPENG skærer omkring 70 procent af den overflødige beregning væk og gør motoren op til cirka 2,7 gange hurtigere. En fjerde, X-Mind, er varslet, men ikke udgivet.

Tallene

VLA 2.0 er i formel masseproduktion, og XPENG opgiver, at systemet i sin første måned efter udrulningen stod for over 50 procent af de kilometer, der blev kørt med assistentsystemet slået til. Over hvilken flåde, på hvilke markeder og hvordan andelen er målt, står der ikke.

Modellen har milliarder af parametre, er trænet på hundredvis af millioner videoklip og bruger over fire billioner tokens pr. modelgennemløb. I de tolv måneder frem til marts 2026 steg træningseffektiviteten pr. GPU med 1.010 procent og for et enkelt job med 4.360 procent, og udnyttelsen af hardwaren gik fra 40 til 90 procent. Der er ingen absolutte udgangspunkter bag procenterne.

Robotaxien, bygget på GX-platformen, er rullet af båndet med 3.000 TOPS om bord.

Datoen for robotten

IRON skal ifølge meddelelsen ind i den fase, hvor hardware og software sættes sammen, med formel masseproduktion ved udgangen af 2026. Og robotterne skal begynde at arbejde som indkøbsvejledere i XPENGs egne butikker fra første kvartal 2027.

Den dato står ikke i historien om robotternes produktionslinje fra september 2026. Det er denne meddelelse, der har den.

Der er intet europæisk i teksten. Udrulningen af VLA 2.0, robotaxien og dækningen er kinesisk, og meddelelsen siger ikke, hvad af det der når en europæisk bil. Turing og agenten er det spor, der er kommet nærmest.

Billeder: XPENG

Kilder

XPENG: verdensmodellen præsenteret på CVPR i Denver · 3. juni 2026