AktualnościAkcjeDyna Robotics prezentuje DYNA-2 — model bazowy robota trenowany na milionie godzin ludzkich wideo

Dyna Robotics prezentuje DYNA-2 — model bazowy robota trenowany na milionie godzin ludzkich wideo

Autor: Cryptopolitan·

Najważniejsze informacje

  • DYNA-2 został wytrenowany wyłącznie na ego-centricznym wideo ludzkim, co — według Dyny — odpowiada około 170 latom ciągłego doświadczenia.
  • Dyna raportuje, że DYNA-2 poprawił wskaźniki sukcesu w zadaniach produkcyjnych wymagających wysokiej precyzji z 20% do nawet 80–90%.
  • Model wykorzystuje architekturę World-Action, która podczas wstępnego trenowania przewiduje następną klatkę wideo i następną akcję.
  • Dyna twierdzi, że model można dostosować do nowych platform robotycznych za pomocą zaledwie kilku godzin dostrajania, w tym raportowany przykład 13 minut dla odkręcania nakrętki butelki.
  • Dyna już wdrożyła swoje wcześniejsze roboty DYNA-1 w środowiskach komercyjnych, takich jak hotele, restauracje, pralnie i siłownie.
Dyna Robotics prezentuje DYNA-2 — model bazowy robota trenowany na milionie godzin ludzkich wideo

Dyna Robotics w poniedziałek zaprezentowała DYNA-2 — nowy model bazowy robota, który — jak twierdzi firma — został wytrenowany na ponad milionie godzin ludzkich wideo i zerowych danych z robotów. Amerykańska firma uważa, że to podejście może rozwiązać wyzwania kosztowe i ograniczenia skalowalności, które hamowały rozwój robotyki ogólnego przeznaczenia — przeszkodę, dzięki której fizyczna sztuczna inteligencja pozostaje w tyle za innymi dziedzinami, gdzie wstępne trenowanie na dużych zbiorach danych już doprowadziło do szybkich wzrostów możliwości.

Wąskie gardło danych treningowych w robotyce

Trwałą przeszkodą w tworzeniu robotów ogólnego przeznaczenia jest pozyskiwanie wystarczających danych treningowych. Większość dzisiejszych robotów uczy się poprzez teleoperację — proces, w którym operator ludzki ręcznie prowadzi maszynę przez zadania przez wiele godzin. Ta metoda jest powolna, kosztowna i trudna do skalowania, co ostatecznie ogranicza potencjalne możliwości takich systemów. Problem jest powszechnie rozpoznawany w branży, a gracze tacy jak Google DeepMind, Tesla i Physical Intelligence intensywnie inwestują w alternatywne strategie pozyskiwania danych dla własnych modeli bazowych robotów.

DYNA-2 idzie inną drogą, całkowicie eliminując dane z robotów z fazy treningu. Model został zamiast tego wytrenowany wyłącznie na ego-centricznym wideo ludzkim — nagraniach z perspektywy pierwszej osoby rejestrujących interakcje z obiektami i otoczeniem. Według firmy ten zbiór danych odpowiada około 170 latom ciągłego doświadczenia.

Today we are introducing Dyna-2, a world-action model pre-trained on one million hours of human video. At this scale, for the first time, we discovered several new scaling laws:

• world-action models exhibit scaling law on human data across four orders of magnitude, from 1000… pic.twitter.com/wZamR0axzS — Dyna Robotics (@DynaRobotics) August 10, 2026

Współzałożyciel Jason Ma wyjaśnił motywację: „Action data is scarce, but video is everywhere." Argumentował, że fizyczna intuicja „can be learned directly from human video", zamiast wymagać milionów godzin danych zebranych za pomocą ramienia robota.

W zadaniach produkcyjnych wymagających wysokiej precyzji DYNA-2 podniósł wskaźniki sukcesu z 20% do 80–90%. Dyna przypisuje tę poprawę samej skali wstępnego trenowania na wideo. W 15 zadaniach testowych modele trenowane na większych ilościach ludzkiego wideo konsekwentnie przewyższały te trenowane na mniejszych ilościach. Odkrycie to nawiązuje do praw skalowania, które zrewolucjonizowały przetwarzanie języka naturalnego, gdzie wydajność modeli poprawiała się przewidywalnie wraz ze wzrostem ilości danych treningowych i mocy obliczeniowej — choć to, czy zasady te w pełni przenoszą się na zadania w świecie fizycznym, pozostaje otwartym pytaniem.

Czym różni się architektura DYNA-2

Dyna wyróżnia się nowatorską architekturą. Zamiast opierać się na modelu wizyjno-językowym — podejściu stosowanym przez systemy takie jak Google RT-2 — DYNA-2 jest modelem World-Action opartym na generacji wideo. Podczas wstępnego trenowania model jednocześnie przewiduje następną klatkę wideo i następną akcję. Dyna twierdzi, że ten podwójny cel zapewnia modelowi wewnętrzne rozumienie fizyki kontaktu i rozumowania przestrzennego.

Firma oczekuje, że wiedza przeniesiona z ludzkich wideo będzie się uogólniać na różne platformy robotyczne — w tym nieruchome ramiona, prototypy humanoidów i zręczne dłonie — mimo że żadne z tych urządzeń nie uczestniczyło we wstępnym treningu. Adaptacja DYNA-2 do nowej platformy rzekomo wymaga zaledwie kilku godzin dostrajania zamiast tygodni zbierania nowych danych. Na przykład Dyna raportuje, że zaledwie 13 minut danych dostrajających wystarczyło, aby ręce robotyczne nauczyły się odkręcać nakrętkę butelki. Jeśli transfer międzyplatformowy potwierdzi się w niezależnych ocenach, może to znacznie obniżyć barierę wdrażania sprawnych robotów w różnych konfiguracjach sprzętowych.

Wdrożenia w świecie rzeczywistym i plany na przyszłość

Dyna już operuje robotami w środowiskach komercyjnych, co odróżnia ją od wielu podmiotów w dziedzinie robotyki. Roboty DYNA-1 firmy są obecnie wdrażane w hotelach, restauracjach, pralniach i siłowniach, zgodnie z doniesieniami. To doświadczenie operacyjne dostarcza Dynie informacji zwrotnych z wdrożeń, których brakuje wielu firmom robotycznym skupionym na badaniach.

Dyna została założona przez Lindona Gao, Yorka Yanga i Jasona Ma, którzy wcześniej pracowali w DeepMind. Deklarowana mapa drogowa firmy obejmuje skalowanie tej samej metodologii treningowej do 10 milionów godzin wideo, co firma określa jako wyzwanie w zakresie zbierania danych, a nie budowy floty. Gdy branża obserwuje, czy wstępne trenowanie oparte na wideo spełni swoje obietnice, kluczowe pytania obejmują to, czy wykazane osiągnięcia DYNA-2 będą się uogólniać poza zadaniami testowymi na nieprzewidywalne środowiska rzeczywiste oraz jak szybko konkurenci stosujący alternatywne architektury zniwelują ewentualną lukę.