Jobescape
Glossário de IA

IA multimodal

IA multimodal é inteligência artificial capaz de entender e trabalhar com mais de um tipo de entrada - como texto, imagens e áudio - em vez de apenas um.

O que significa IA multimodal

Uma "modalidade" é um tipo de informação: texto escrito, uma foto, um som, um vídeo. Ferramentas de IA mais antigas lidavam com apenas uma modalidade. A IA multimodal consegue receber várias ao mesmo tempo e conectá-las, muito mais próximo de como as pessoas percebem o mundo.

Por exemplo, você poderia mostrar a uma IA multimodal uma foto da sua geladeira e perguntar, em texto, "o que posso cozinhar com isso?". Ela entende a imagem e sua pergunta escrita juntas, e responde com ideias de receitas.

Por que a IA multimodal importa

A IA multimodal amplia enormemente o que você pode criar, porque tarefas reais raramente envolvem apenas texto. Saber que isso é possível ajuda você a projetar ferramentas mais úteis.

Permite que suas ferramentas leiam documentos, imagens e capturas de tela, não só texto
Abre espaço para automações em tarefas visuais, como verificar fotos
A maioria dos modelos de IA líderes de mercado já é multimodal por padrão
Amplia a variedade de trabalho que você pode assumir com IA

Perguntas frequentes

Muitas são. Os principais modelos por trás de ferramentas como ChatGPT e Claude conseguem lidar com texto e imagens juntos, então você já pode estar usando IA multimodal sem perceber.

Pronto para desenvolver as habilidades de IA de que o seu futuro depende?

Faça o quiz gratuito de 5 minutos e receba um plano de aprendizado personalizado, feito para as suas metas, a sua rotina e a sua experiência.