BostonDynamics

Robots gebruiken AI om sociaal gedrag te leren – soms beter, soms slechter dan wij
Onderzoekers bekijken nu hoe we robots beter kunnen laten integreren in onze samenleving door ze te trainen op sociale interacties. De vraag is: kunnen ze op basis van visuele context en micro-expressies voorspellen of een risicovolle situatie, zoals een peuter met een hete mok koffie, goed of slecht afloopt?
De onderzoekers gebruiken hiervoor zes zogenaamde vision language model (vlm’s), waaronder GPT-4o, Gemini 2.0 Flash en DeepSeek. Wanneer ze actievideo’s analyseren, presteren ze best goed. Het beste opensourcemodel behaalt een nauwkeurigheid van zeventig procent, waarmee het de grotere closedsourcemodellen (63 procent) en de gemiddelde mens overtreft.
Begrip en intuïtie
Dat onderscheid tussen open en closed is belangrijk, omdat de eerste groep werkt zonder de cloud, waardoor het data lokaal verwerkt. Dat is beter voor de privacy. De prestaties storten echter in zodra ze gezichtsuitdrukkingen van menselijke toeschouwers voorgeschoteld krijgen; de accuraatheid in de voorspellingen zakte daardoor naar 44,5 tot 53,8 procent.
Het onderzoek toont mooi aan wat nou precies het verschil is tussen contextueel begrip en sociale intuïtie. En dat vlm’s momenteel blind zijn voor non-verbale menselijke signalen. Maar als we ze gaan integreren in ons leven, dan is het begrip van sociale cues heel belangrijk. En die kunnen ze alleen écht leren wanneer we ze in ons dagelijks leven zouden gaan gebruiken.
















