Neu Konversa ist live: Gespräche mit KI transkribieren und zusammenfassen. Video ansehen Mehr erfahren

Jetzt ausprobieren
Kostenlos starten Demo buchen Kontakt
Plattform-Login
Alle Begriffe KI-Glossar

Multimodale KI

KI, die verschiedene Datenarten – Text, Bild, Audio, Video – gleichzeitig verarbeitet.

Multimodale KI verarbeitet und erzeugt verschiedene Arten von Daten gleichzeitig – Text, Bilder, Audio und Video. Während frühe Modelle nur eine Modalität beherrschten (z. B. nur Text), können multimodale Modelle ein Bild beschreiben, eine Skizze in Code umwandeln oder gesprochene Sprache mit visueller Information verknüpfen. GPT-4o und Gemini sind Beispiele für multimodale Modelle.

Kurz beantwortet

Was ist multimodale KI?

Multimodale KI verarbeitet und erzeugt verschiedene Datenarten gleichzeitig – Text, Bilder, Audio und Video. Sie kann ein Bild beschreiben, eine Skizze in Code umwandeln oder gesprochene Sprache mit visueller Information verknüpfen. GPT-4o und Gemini sind Beispiele.

KI im Unternehmen einsetzen?

Wir zeigen Ihnen, welche Anwendungen sich für Ihre Organisation lohnen.

Kontakt aufnehmen