Dyna Robotics onthult DYNA-2, een robotfundamentmodel getraind op één miljoen uur menselijke video
Belangrijkste punten
- •DYNA-2 is uitsluitend getraind op egocentrische menselijke video, wat volgens Dyna overeenkomt met ongeveer 170 jaar aan doorlopende ervaring.
- •Dyna rapporteert dat DYNA-2 het slagingspercentage op hoogprecieze productietaken verhoogde van 20% tot wel 80% tot 90%.
- •Het model gebruikt een World-Action-architectuur die tijdens de pre-training het volgende videobeeld en de volgende actie voorspelt.
- •Dyna stelt dat het model in slechts enkele uren kan worden aangepast aan nieuwe robotplatforms, waaronder een gemeld voorbeeld van 13 minuten voor het draaien van een flessendop.
- •Dyna heeft zijn eerdere DYNA-1-robots al ingezet in commerciële omgevingen zoals hotels, restaurants, wasserettes en sportscholen.

Dyna Robotics introduceerde op maandag DYNA-2, een nieuw robotfundamentmodel dat volgens het bedrijf is getraind op meer dan één miljoen uur menselijke video en nul robotdata. De in de VS gevestigde onderneming gelooft dat deze aanpak de kosten- en schaalbaarheidsuitdagingen kan aanpakken die algemene robotica hebben beperkt — een obstakel dat fysieke AI achter andere domeinen heeft gehouden waar grootschalige datapre-training al snelle capaciteitsstijgingen heeft opgeleverd.
De trainingsdatabottleneck in robotica
Een aanhoudend obstakel bij de ontwikkeling van algemene robots is het verkrijgen van voldoende trainingsdata. De meeste robots leren tegenwoordig via teleoperatie, een proces waarbij een menselijke operator de machine gedurende vele uren handmatig door taken leidt. Deze methode is traag, duur en moeilijk schaalbaar, wat uiteindelijk een plafond zet aan hoe capabel dergelijke systemen kunnen worden. Het probleem wordt breed erkend in de branche, met spelers waaronder Google DeepMind, Tesla en Physical Intelligence die allemaal zwaar investeren in alternatieve datastrategieën voor hun eigen robotfundamentmodellen.
DYNA-2 gaat een andere weg door robotdata volledig uit de trainingsfase te halen. In plaats daarvan is het model uitsluitend getraind op egocentrische menselijke video — beeldmateriaal dat is opgenomen vanuit het perspectief van een persoon terwijl deze met objecten en de omgeving interageert. Volgens het bedrijf komt deze dataset neer op ongeveer 170 jaar aan doorlopende ervaring.
Today we are introducing Dyna-2, a world-action model pre-trained on one million hours of human video. At this scale, for the first time, we discovered several new scaling laws:
• world-action models exhibit scaling law on human data across four orders of magnitude, from 1000… pic.twitter.com/wZamR0axzS — Dyna Robotics (@DynaRobotics) August 10, 2026
Medeoprichter Jason Ma legde de reden uit: "Action data is scarce, but video is everywhere." Hij betoogde dat fysieke intuitie "can be learned directly from human video" in plaats van dat er miljoenen uren aan data verzameld hoeven te worden met een robotarm.
Bij hoogprecieze productietaken verhoogde DYNA-2 het slagingspercentage van 20% naar tussen de 80% en 90%. Dyna schrijft deze verbetering toe aan de enorme schaal van de videopre-training. Over 15 benchmarks heen presteerden modellen die waren getraind op grotere hoeveelheden menselijke video consequent beter dan die getraind op kleinere hoeveelheden. Deze bevinding weerspiegelt de schaalingswetten die natuurlijke taalverwerking transformeerden, waar modelprestaties voorspelbaar verbeterden met toenames in trainingsdata en rekenkracht — hoewel de vraag of die principes volledig van toepassing zijn op taken in de fysieke wereld open blijft.
Hoe de architectuur van DYNA-2 verschilt
Dyna onderscheidt zich door een nieuwe architectuur. In plaats van te vertrouwen op een visie-taalmodel — de aanpak die wordt gebruikt door systemen zoals Google's RT-2 — is DYNA-2 een World-Action Model gebouwd op videogeneratie. Tijdens de pre-training voorspelt het model tegelijkertijd zowel het volgende videobeeld als de volgende actie. Dyna stelt dat dit dubbele doel het model een intern begrip geeft van contactfysica en ruimtelijk redeneren.
Het bedrijf verwacht dat kennis die is overgedragen vanuit menselijke video's zal generaliseren naar verschillende robotplatforms — waaronder stationaire armen, humanoïde prototypen en behendige handen — ook al waren deze apparaten niet betrokken bij de pre-training. Het aanpassen van DYNA-2 aan een nieuw platform vereistnaar verluidt slechts enkele uren finetuning in plaats van wekenlang nieuwe data verzamelen. Dyna rapporteert bijvoorbeeld dat slechts 13 minuten aan finetuning-data voldoende was om robotische handen een dop van een fles te laten draaien. Als deze cross-platformoverdracht standhoudt bij onafhankelijke evaluatie, kan dat de drempel om capabele robots in te zetten op diverse hardwareconfiguraties aanzienlijk verlagen.
Implementatie in de praktijk en toekomstplannen
Dyna heeft al robots operationeel in commerciële omgevingen, een factor die het bedrijf onderscheidt van veel concurrenten in het robotveld. De DYNA-1-robots van het bedrijf zijn momenteel ingezet in hotels, restaurants, wasserettes en sportscholen, volgens berichten. Deze operationele ervaring biedt Dyna implementatiefeedback die veel op onderzoek gerichte robotica-bedrijven missen.
Dyna werd opgericht door Lindon Gao, York Yang en Jason Ma, die voorheen bij DeepMind werkten. De door het bedrijf uitgesproken roadmap is om dezelfde trainingsmethodologie op te schalen naar 10 miljoen uur video, wat het karakteriseert als een uitdaging op het gebied van dataverzameling in plaats van vlootopbouw. Terwijl de sector toekijkt of op video gebaseerde pre-training zijn belofte kan waarmaken, behoren de belangrijkste vragen tot of de aangetoonde winsten van DYNA-2 algemeen toepasbaar zijn buiten benchmarktaken in onvoorspelbare praktijkomgevingen, en hoe snel concurrenten met alternatieve architecturen een eventuele achterstand kunnen inhalen.