De IT-wereld staat sinds 2022 grotendeels in het teken van AI, of beter gezegd: LLM’s. Na diverse jaren doorontwikkeling en grote stappen voorwaarts wordt de hoop nu op het volgende gevestigd. World models moeten voor de volgende doorbraak zorgen, klinkt het opeens.
Een world model is kort gezegd een representatie van een fysieke omgeving. AI-systemen kunnen die omgeving verkennen en er voorspellingen over doen. Dr. Cees Snoek, professor Computer Science aan de Universiteit van Amsterdam, vergelijkt het met de inmiddels alom bekende grote taalmodellen (LLM’s). “LLMs doen technologisch gezien een simpel trucje. Je pakt een hele lange tekst, laat de AI tien woorden uit een zin zien en laat het voorspellen wat het volgende woord is. Dat trucje kun je verbeteren door nog veel meer woorden in je geschiedenis te zetten.”
De naam zegt het al: taalmodellen werken alleen met taal. Ze hebben dus beperkt inzicht in hoe de wereld eruitziet. Dat is met world models anders: die hebben juist een sterk beeldcomponent. Snoek: “Als je een videostroom neemt, kun je in theorie hetzelfde trucje doen als bij een LLM. In plaats van dat je het volgende woord in een zin voorspelt, kun je ook het volgende beeld in een sequentie voorspellen. Dus aan de hand van een videofragment kun je ongeveer voorspellen hoe objecten en mensen zich gaan bewegen en hoe het volgende beeld eruitziet. Dat is kort door de bocht hoe het werkt.”
Revival
Het idee van world models is niet nieuw. De huidige aandacht hiervoor is een revival, meent dr. Pim Haselager, professor Societal Implications of AI aan de Radboud Universiteit. Al in de jaren ’60 werd gewerkt aan een AI-systeem genaamd SHRDLU. “Dat bestond uit blokken, piramides en andere geometrische vormen.” Gebruikers konden het AI-model vragen stellen over die blokkenwereld. “Het kon bijvoorbeeld vertellen wat er moest gebeuren als je een blok dat onder een piramide ligt bovenop een ander blok wil zetten.”
Ook in de decennia daarna werd veel aan world models gewerkt. De ontwikkeling stokte uiteindelijk omdat er onvoldoende computationele kracht was om de wereldmodellen goed te laten draaien. De focus werd al snel verlegd, bijvoorbeeld naar AI-systemen die simpelweg reageren op feedback uit de wereld. Denk aan een robotstofzuiger die tegen een stoelpoot aankomt en daarop reageert. Daar heeft het geen 3D-omgeving van de wereld voor nodig. Het draait een klein stukje en probeert simpelweg of het dan geen obstakel tegenkomt. Is dat het geval, dan rijdt het apparaat door.















