Multimodale KI
Multimodale KI ist künstliche Intelligenz, die mit mehr als einer Art von Eingabe umgehen kann - etwa Text, Bildern und Audio - statt nur mit einer einzigen.
Was Multimodale KI bedeutet
Ein „Modus“ ist eine Art von Information: geschriebener Text, ein Foto, ein Ton, ein Video. Ältere KI-Tools verarbeiteten nur einen Modus. Multimodale KI kann mehrere gleichzeitig aufnehmen und miteinander verknüpfen - viel näher daran, wie Menschen die Welt wahrnehmen.
Du könntest einer multimodalen KI zum Beispiel ein Foto deines Kühlschranks zeigen und in Textform fragen: „Was kann ich damit kochen?“ Sie versteht das Bild und deine schriftliche Frage gemeinsam und antwortet dann mit Rezeptideen.
Warum Multimodale KI wichtig ist
Multimodale KI erweitert enorm, was du bauen kannst, denn echte Aufgaben bestehen selten nur aus Text. Zu wissen, was möglich ist, hilft dir, nützlichere Tools zu entwerfen.
Häufig gestellte Fragen
Mehr KI-Begriffe
Bereit, die KI-Skills aufzubauen, von denen deine Zukunft abhängt?
Mach das kostenlose 5-Minuten-Quiz und erhalte einen persönlichen Lernplan rund um deine Ziele, deinen Zeitplan und deine Erfahrung.