VLA: modellen bag NGP

VLA 2.0 er en samlet model, der tager kamerabillederne og en instruktion og afgør, hvad bilen gør. Hvad anden generation tilføjer, og hvad XPENG har oplyst om Europa.

Antallet af Turing-chips afgør, hvilken VLA-udgave bilens hardware kan håndtere. I Europa skal systemet også godkendes, før det kan aktiveres.

NGP er navnet på det, du slår til på skærmen. VLA er modellen under det. De to navne beskriver derfor ikke samme lag i systemet.

Her får du forklaret, hvad de tre bogstaver betyder, hvad anden generation tilføjer, hvilken forskning XPENG har offentliggjort, og hvilke biler der er annonceret med modellen. Hvilke chips der sidder i hvilken bil, står i assistenthardware-guiden.

XPENG G9L set bagfra i et bylandskab tegnet som printkort

Billeder: XPENG

Spring til: Hvad VLA er · Anden generation · Forskningen bag · VLA i Kina og Europa · XPACE-modellen i IRON · Godkendelse i Europa · Hvad XPENG ikke har sagt · Q&A · Kilder

Ingen europæisk XPENG kører anden generations VLA i dag. Udstyrslisten for L03 Ultra angiver VLA 2.0 NGP fra første kvartal 2027. G9L får europapremiere i oktober 2026, men XPENG har endnu ikke oplyst, hvilke kinesiske chiptrin Europa får. Datoerne står under Godkendelse i Europa.

Hvad VLA er, og hvad det afløste

VLA står for vision-language-action. Én model tager billederne fra kameraerne og en instruktion i tekst og afgør, hvad bilen gør. Den erstatter en kæde af adskilte dele, hvor den ene registrerede omgivelserne, den næste forudsagde, hvad de ville gøre, den tredje lagde en bane, og den fjerde styrede bilen. Hvorfor kæden blev opgivet, har XPENG ikke gjort rede for offentligt.

VLA 2.0 omsætter kameraernes signaler direkte til bilens handlinger uden først at formulere en tekstlig forklaring. Det er forskellen fra den tidligere V-L-A-opbygning, som brugte sprog som mellemtrin. Sprog indgår stadig, når føreren giver en instruktion, og i de data, modellen er trænet med.

På XPENGs EU-website står XPILOT ASSIST 2.5 stadig som navnet på assistentsystemet. Det dækker assistentpakken, ikke modellen.

Om selve modellen bruger XPENG tre navne. VLA 2.0 er modellen fra 2025. Anden generations VLA fremlagde selskabet den 27. august 2026. I det engelske materiale kaldes den den første store opgradering af VLA 2.0, mens den kinesiske webshop bruger navnet anden generation. På plancherne forkortes den til 630-versionen efter XOS 6.3.0, som den følger med. Udrulningen i Kina begyndte i september 2026.

Hvad anden generation tilføjer

Infini-VLA lader op til 30 sekunders historik indgå i beslutningen. Modellen kan derfor fortsat tage højde for en cyklist, der forsvandt bag en varevogn for ti sekunder siden. XPENGs Xianming Liu har skrevet, at de 30 sekunder er det vindue, de valgte til bilen, ikke en grænse i modellen. Når bilen modtager et nyt billede, genbruger en cache tidligere beregninger. Modellen behøver derfor ikke behandle hele historikken igen, og en længere historik kræver kun lidt ekstra regnekraft.

Tidslinje over 30 sekunders omgivelser bag en kørende XPENG

X-Foresight skitserer, hvor de andre trafikanter er på vej hen, omkring seks sekunder frem. Navnet står på XPENGs kinesiske G9L-materiale, men ikke på udstyrslisten, og det er ikke oplyst, om det er noget, en ejer kan slå til og fra.

Forudsagte baner for trafikanter omkring en XPENG i et kryds

Streaming inference lader registrering, ræsonnement og handling køre samtidig i stedet for efter hinanden. XPENG opgiver 300 procent hurtigere svartid fra sensor til handling. Det er selskabets egen måling.

Master Agent samler køremodellen med kabinens model til sprog og billeder, en såkaldt VLM. Når føreren beder bilen om at trække ind til siden, fordeler modellen kommandoen mellem systemerne til kørsel, undervogn, kabine og karrosseri. XPENG kalder metoden Mixture of Tasks. Den bygger på Omni, selskabets multimodale grundmodel.

Master Agent fordeler én stemmekommando til bilens systemer

VLA 2.0 Lite er udviklet til én Turing-chip. P7+ og X9 har hver én. HybridViT er Lite-udgavens synsencoder og løser samme opgave som TuringViT, der forklares under Forskningen bag. Den sender 67 procent færre billed-tokens videre til sprogmodellen, så modellen kræver mindre regnekraft. He Xiaopeng forklarede valget i en video på Weibo den 29. august 2026. En halvering af parametrene ville ifølge ham også reducere modellens evner.

Tyvedoblingen af sikkerheden, som står på alle plancherne, er ikke én måling. En fodnote i materialet fra G9L-lanceringen viser, at tallet sammenfatter resultater på syv områder: risikogenkendelse, baneplanlægning, vejarbejde, forsinket reaktion, fremtidsræsonnement, generalisering og robusthed.

Udtrykket “Robotaxi-agtig L4-oplevelse” står også på plancherne. Det er markedsføring. Pr. september 2026 har ingen af de her biler en L4-godkendelse noget sted.

Forskningen bag

TuringViT er den del af modellen, der omsætter kamerabillederne til data, som resten af systemet kan behandle. Et almindeligt attention-lag sammenligner alle dele af billedet med hinanden. Fordobles opløsningen, bliver regnearbejdet omtrent firedoblet. TuringViT bruger derfor fem beregningslette lag til at sortere den vigtigste information, før et almindeligt lag undersøger detaljerne. XPENG kalder de fem første lag lineær attention. Kombinationen gør det muligt at behandle billeder i høj opløsning, uden at regnearbejdet vokser på samme måde.

Arkitekturdiagram for TuringViT med fem lineære attention-lag og ét almindeligt attention-lag
TuringViT - arkitekturen findes med 18 eller 24 lag.

X-World genererer nye træningssituationer. Ud fra én kameraoptagelse og en tekstbeskrivelse laver den syv kameravinkler af et simuleret forløb, som modellen kan trænes og afprøves på. Ved udgangen af april 2026 havde XPENG kørt over 500.000 simulerede scenarier mod 30.000 året før. Selskabet opgiver den daglige simulation til, hvad der svarer til 30 millioner kørte kilometer.

X-Mind reducerer forsinkelsen mellem en verdensmodel og VLA. Hvis modellerne kører efter hinanden, skal bilen først vente på verdensmodellens forudsigelse og derefter på VLAs beslutning. I X-Mind udfører køremodellen begge beregninger i samme proces. Forudsigelsen består af en oversigt set ovenfra med tolv fremtidige trin, kodet som 96 tokens, ikke af fotorealistiske billeder. XPENG oplyser ikke, hvor lang tid de tolv trin dækker.

Arkitekturdiagram for X-Mind med forudsigelse og kørebeslutning i samme model

X-Cache sparer regnekraft. XPENG opgiver, at den skærer omkring 70 procent af det overflødige arbejde væk og gør afviklingen af modellen op til cirka 2,7 gange hurtigere.

På CVPR 2026, en AI-forskningskonference om billedanalyse og mønstergenkendelse, beskrev XPENG forskellen mellem VLA og verdensmodeller. En VLA-model lærer af, hvad mennesker gjorde bag rattet. Det giver færre eksempler, men hvert af dem er en hel beslutning. En verdensmodel lærer af optagelsen selv, billede for billede, hvordan biler, cyklister og lyskryds faktisk bevægede sig.

VLA i Kina og Europa

I Kina er G9L den første bil, der leveres med anden generations VLA. Den fulde model kører på Ultra SE, Ultra og Ultra-flagskibet, den destillerede Lite-udgave på Max, og kabinens VLM er kun med på Ultra og Ultra-flagskibet. Hvad det kræver af hardware, står i assistenthardware-guiden.

I Kina vælger kunden antallet af Turing-chips som en del af bilens udstyrstrin. Den kinesiske G9L tilbydes derfor med én, to eller tre chips og med forskellige udgaver af VLA. I Europa har hver XPENG-model hidtil haft én fast chipkonfiguration. XPENG ændrer nu mønstret med L03, som tilbydes som L03 og L03 Ultra med forskellig chipkonfiguration. Det kan være første tegn på, at dele af den kinesiske opdeling også kommer til internationale markeder, men XPENG har ikke meldt en generel strategi ud.

Tre XPENG Turing AI-chips på en plakat fra G9L-lanceringen

På det europæiske marked er L03 Ultra foreløbig den eneste model med to Turing-chips afsat til kørslen. Den har tre Turing-chips i alt; den tredje er til kabinen. Hardwarekonfigurationen kan køre den fulde VLA-model, men udstyrslisten angiver først VLA 2.0 NGP fra første kvartal 2027. XPENG har samtidig oplyst, at de nuværende biler med Orin-X ikke kan opgraderes til Turing-hardware.

G9L får europapremiere på Paris Motor Show i oktober 2026. XPENG har endnu ikke oplyst, hvilke kinesiske udstyrstrin Europa får. For L03 har selskabet valgt færre internationale varianter end i Kina. Det samme kan ske med G9L.

Uden for XPENG er Volkswagen selskabets første eksterne kunde til VLA 2.0 og har samtidig valgt Turing-chippen til sine egne biler. Hvilken model, hvilket marked og hvornår har XPENG ikke oplyst.

XPENG har ikke sagt, om P7+ og X9 får NGP eller VLA 2.0 Lite. Begge har én Turing-chip, som Lite er udviklet til, men hardwareoplysningen er ikke en bekræftelse på en kommende softwareudrulning.

XPACE-modellen i IRON

XPENG bygger den humanoide robot IRON med tre Turing-chips. Den 15. september 2026 offentliggjorde XPENG Robotics en rapport på arXiv om XPACE, modellen der styrer robotten. Den vælger robottens bevægelser og forudsiger den video, bevægelserne fører til. En del af træningsmaterialet bliver fremstillet i en simulator.

XPENG IRON humanoid robot i et teststativ foran tre skåle på et hvidt bord

XPACE er ikke bilens VLA. Begge modeller kobler videodata til handlinger, men XPACE styrer en robot, mens VLA styrer en bil.

Ved G9L-lanceringen sagde XPENG, at bilernes VLA og VLM skal bruges i IRON. Selskabet sagde også, at IRONs flersprogede dialog senere skal bruges i bilerne. XPENG havde dog allerede vist flersproget VLM-dialog i en bilvideo fra AI Day i november 2025. Septemberudmeldingen kan derfor ikke læses som første introduktion af flersprogede samtaler i kabinen. Hvad der konkret skal overføres fra IRON til bilerne, oplyste XPENG ikke.

Tallene i XPACE-rapporten er laboratorietal. Efter ekstra træning gik robottens succesrate fra 61,7 til 86,7 procent over tre bordopgaver, målt med 20 forsøg pr. opgave på ét eksemplar. Hele historien står i nyheden om XPACE.

Godkendelse i Europa

Første kvartal 2027 står på L03 Ultras udstyrsliste ud for VLA 2.0 NGP. En liste er ikke en godkendelse.

Første halvår 2027 er det, XPENG sigter efter for europæisk godkendelse. Godkendelsen søges efter FN-regulativ 171 om Driver Control Assistance Systems, og selskabet har allerede kørt lokal accepttest i Tyskland. Lokal test er ikke typegodkendelse.

Om en model trænet i Kina kan køre i Europa, er stadig uafklaret. XPENG oplyste på Brand Day i München, at VLA 2.0 stod for 50,44 procent af de kilometer, de udstyrede biler i Kina kørte. Det er XPENGs eget tal, uden oplyst metode, og det dækker en kinesisk flåde. Den kinesisk trænede model klarede sig efter XPENGs eget udsagn tæt på hjemmemarkedsniveau på tyske byveje med næsten ingen lokale træningsdata. XPENG har ikke oplyst, hvor stor en del af træningen der kommer fra simulation.

Resten af forskellene mellem en kinesisk og en europæisk XPENG, fra chips til kortdata, står i assistenthardware-guiden.

Hvad XPENG ikke har sagt

XPENGs egne materialer afgrænser ikke Turing-chippen og TuringViT til de samme produkter. Selskabet oplyser, at Turing-chippen bruges i biler, IRON og flyvende fartøjer. TuringViT-rapporten nævner kun kørsel, kabineinteraktion og humanoid robotteknik. Den fastslår derfor ikke, om synsmodellen også bruges i luften.

Hvor stor modellen i bilen er, har XPENG aldrig oplyst. Kun skymodellens 72 milliarder parametre er navngivet, og for bilen findes kun et forholdstal: 3,5 gange den udgave, der kører i dag.

Hvor lang tid X-Minds tolv skridt dækker, står ikke i rapporten.

Hvornår Lite kommer til europæiske biler, har XPENG ikke sagt noget om. I Kina tester selskabet internt en destilleret udgave på biler med to Orin-X-chips. Tilpasningen går ifølge Liu på tværs af chip- og modelarkitektur. Den kræver optimering helt ned på de enkelte beregningsoperationer.

Q&A

Nej. Ingen europæisk XPENG kører anden generations VLA. L03 Ultra har tre Turing-chips i alt, hvoraf to er afsat til kørslen, og dens udstyrsliste angiver VLA 2.0 NGP fra første kvartal 2027. XPENG har ikke bekræftet VLA 2.0 til andre europæiske modeller.

NGP er produktet, du slår til. VLA er modellen, der kører under det. Samme system, to niveauer: det ene er navnet på skærmen, det andet er det, der beslutter.

VLA 2.0 Lite bruger den samme grundmodel med en mindre synsencoder. XPENG siger, at Lite bevarer størstedelen af evnerne og kan måle sig med førende kinesiske L2-systemer. Det er selskabets egen vurdering. Der kendes ikke til nogen uafhængig måling.

Fordi selskabet selv siger, at bilernes VLA og VLM skal bruges i robotten IRON. XPENG har også talt om at overføre flersproget dialog fra IRON til bilerne, men viste allerede flersproget VLM-dialog i en bilvideo i november 2025. Hvad der konkret skal overføres, og hvornår det sker, er ikke oplyst.

Kilder

  • XPENG AI Day, 5. november 2025 - VLA 2.0; skymodellen på 72 milliarder parametre; Volkswagen som første eksterne kunde
  • XPENG Foundation Model Team: TuringViT, 23. juni 2026 - synsencoderen
  • XPENGs forskning fremlagt på CVPR, Denver, juni 2026 - opdelingen mellem VLA og verdensmodel; X-World, X-Foresight og X-Cache
  • X-Mind, 29. juni 2026 - forudsigelsen foldet ind i køremodellen
  • Brand Day, München, 16. juli 2026 - de 50,44 procent i Kina
  • XPENGs selskabsmeddelelse om anden generations VLA, 27. august 2026 - Infini-VLA, X-Foresight, streaming inference, Master Agent, Lite på G9L Max, accepttest i Tyskland
  • Xianming Liu om arkitekturen i XOS 6.3.0, 15. september 2026 - cachen i Infini-VLA og tilpasningen til biler med to Orin-X-chips
  • He Xiaopeng på Weibo, 29. august 2026 - HybridViT og de 67 procent færre billed-tokens
  • XPENGs egne Weibo-opslag fra G9L-lanceringen, 17. september 2026 - varianter og modeller, tyvedoblingen med sin fodnote, Master Agent, brugen af VLA og VLM i IRON
  • XPENG Robotics: XPACE, arXiv 2609.17372, 15. september 2026 - modellen bag IRON

Supplerende video: XPENG Future Intelligent Cabin, november 2025 - demonstration af flersproget VLM-dialog i bilen.

Relateret: Assistenthardware · Software · XPACE-nyheden

Ændringer på denne side (1)

Alle ændringer på sitet