KI-Glossar
Multimodale KI
KI, die verschiedene Datenarten – Text, Bild, Audio, Video – gleichzeitig verarbeitet.
Definition
Multimodale KI verarbeitet und erzeugt verschiedene Arten von Daten gleichzeitig – Text, Bilder, Audio und Video. Während frühe Modelle nur eine Modalität beherrschten (z. B. nur Text), können multimodale Modelle ein Bild beschreiben, eine Skizze in Code umwandeln oder gesprochene Sprache mit visueller Information verknüpfen. GPT-4o und Gemini sind Beispiele für multimodale Modelle.
Verwandte Begriffe
Quellen: a16z AI Glossary · CNET AI Terms Glossary