Jobescape
Glossaire IA

IA multimodale

L'IA multimodale est une intelligence artificielle capable de comprendre et de traiter plus d'un type d'entrée - comme le texte, l'image et l'audio - plutôt qu'un seul.

Ce que signifie IA multimodale

Une « modalité » est un type d'information : un texte écrit, une photo, un son, une vidéo. Les anciens outils IA ne traitaient qu'une seule modalité. L'IA multimodale peut en recevoir plusieurs à la fois et les relier entre elles, un peu comme les humains perçoivent le monde.

Par exemple, vous pourriez montrer à une IA multimodale une photo de votre frigo et demander, par écrit, « qu'est-ce que je peux cuisiner avec ça ? ». Elle comprend l'image et votre question écrite ensemble, puis répond avec des idées de recettes.

Pourquoi IA multimodale compte

L'IA multimodale élargit considérablement ce que vous pouvez construire, car les tâches réelles impliquent rarement le texte seul. Savoir que c'est possible vous aide à concevoir des outils plus utiles.

Elle permet à vos outils de lire documents, images et captures d'écran, pas seulement du texte
Elle ouvre la voie à des automatisations pour des tâches visuelles comme la vérification de photos
La plupart des modèles IA de pointe sont désormais multimodaux par défaut
Elle élargit l'éventail des tâches que vous pouvez confier à l'IA

Questions fréquentes

Beaucoup le sont. Les modèles de pointe derrière des outils comme ChatGPT et Claude peuvent traiter texte et images ensemble : vous utilisez peut-être déjà l'IA multimodale sans le savoir.

Prêt à bâtir les compétences IA dont votre avenir dépend ?

Faites le quiz gratuit de 5 minutes et recevez un plan d'apprentissage personnalisé, bâti autour de vos objectifs, de votre emploi du temps et de votre expérience.