Pegasus 1.6 prináša porozumenie videu do fyzickej AI, tvrdí TwelveLabs

Zdroj: The Robot Report - Eugene Demaitre | 6. 10. 2026
Spoločnosť TwelveLabs uviedla, že jej model Pegasus 1.6 rozumie videu z prvej osoby a podporuje pracovné toky vrátane označovania pre vývojárov robotiky.
S rýchlou digitalizáciou fyzického sveta zbierajú tímy umelej inteligencie obrovské množstvá komplexného videa, avšak pretransformovanie surového materiálu na akčné modely zostáva kritickou výzvou, uvádza spoločnosť TwelveLabs Inc. Dnes predstavila svoj model Pegasus 1.6, ktorý obsahuje nové schopnosti na porozumenie a navigáciu v zložitých reálnych prostrediach.
„Našou misiou vždy bolo pomôcť strojom pochopiť, ako svet funguje prostredníctvom videa,“ uviedol Jae Lee, spoluzakladateľ a generálny riaditeľ TwelveLabs. „Fyzická AI je ďalším vyjadrením tejto misie. Väčšina toho, čo ľudia vedia o vykonávaní fyzickej práce, ako je zmena úchopu alebo obnova po tom, čo niečo sklzne, nikdy nebola zachytená v podobe, z ktorej by sa mohol stroj učiť.“
„S naším najnovším modelom môžeme teraz premeniť tento materiál na štruktúrované, prehľadné poznatky, takže tímy robotiky a fyzickej AI môžu trénovať na reálnych ľudských skúsenostiach namiesto toho, aby začínali od nuly,“ dodal.
Spoločnosť TwelveLabs, založená v roku 2021, uviedla, že vytvorila „plnohodnotnú platformu video inteligencie“ pomocou svojich modelov Marengo a Pegasus, ktoré navrhla tak, aby videli a rozumeli videu spôsobom, akým to robia ľudia, a to v zlomku času. Vývojári môžu využiť tento jediný systém, ktorý sa časom zlepšuje, na prístup a manipuláciu so všetkým svojím video obsahom, uviedla spoločnosť so sídlom v Soule.
Pegasus 1.6 sa zameriava na egocentrické video
TwelveLabs uviedla, že jej najnovšia verzia Pegasus znamená expanziu do oblasti fyzickej AI, pričom generuje bohaté poznatky z pohľadov reálneho sveta. Rieši špecifické výzvy pracovných tokov, aby stroje ako roboty, drony a autonómne vozidlá mohli vnímať, uvažovať a bezpečne konať vo fyzickom svete ako nikdy predtým, tvrdí spoločnosť.
„Zameriavame sa na vrstvu porozumenia videu,“ povedal Jae Lee pre The Robot Report. „Nemôžete len tak vziať milióny hodín videa a vložiť ich do modelu robotiky a očakávať, že z toho vyjde užitočný tréningový materiál. Najprv musíte pochopiť, čo sa vo videu deje, aká akcia prebieha, kedy sa to deje, s čím osoba interaguje, ako sa správanie mení v priebehu času a kedy sa v zornom poli objavia iní ľudia alebo okoloidúci.“
„Pegasus 1.6 poskytuje presnejšie porozumenie, takže tímy robotiky a dát môžu následne premeniť tieto informácie na tréningové dáta, ktoré potrebujú,“ dodal.
TwelveLabs poznamenala, že Pegasus 1.6 je jej prvý model AI navrhnutý na porozumenie egocentrickému videu, ktoré je snímané z pohľadu osoby vykonávajúcej prácu. Môže to byť niekto, kto varí jedlo, montuje súčiastky na výrobnej linke alebo ovláda robota na diaľku. Model nevyžaduje špecifické kamery, uviedol Lee.
„Nevyžadujeme od tímov robotiky, aby používali konkrétnu kameru alebo proprietárny hardvér na zachytenie tohto materiálu,“ povedal. „Dôležité je byť schopný zachytiť akcie a interakcie, ktoré sa dejú z pohľadu operátora.“
Okrem toho Pegasus 1.6 dokáže pracovať s existujúcimi video dátami a umožňuje analýzu statických obrázkov okrem videa.
Tento článok bol pôvodne publikovaný na The Robot Report. Preklad a úprava: Martin Kováč, robotika24.
O autorovi

Martin Kováč
Martin je technologický novinár so zameraním na robotiku, umelú inteligenciu a automatizáciu. Po štúdiu informatiky na STU v Bratislave pracoval v niekoľkých technologických firmách, odkiaľ prináša praktický pohľad na najnovšie inovácie. Pre robotika24 pokrýva témy od priemyselných robotov až po spotrebiteľskú elektroniku a autonómne vozidlá.





