Kostenlos starten Demo buchen Kontakt
Plattform-Login
KI-Glossar

Multimodale KI

KI, die verschiedene Datenarten – Text, Bild, Audio, Video – gleichzeitig verarbeitet.

Definition

Multimodale KI verarbeitet und erzeugt verschiedene Arten von Daten gleichzeitig – Text, Bilder, Audio und Video. Während frühe Modelle nur eine Modalität beherrschten (z. B. nur Text), können multimodale Modelle ein Bild beschreiben, eine Skizze in Code umwandeln oder gesprochene Sprache mit visueller Information verknüpfen. GPT-4o und Gemini sind Beispiele für multimodale Modelle.

Quellen: a16z AI Glossary · CNET AI Terms Glossary

← Zurück zum KI-Glossar