IA multimodal
Alinear visión y lenguaje al estilo CLIP
Una imagen y una frase pueden vivir en el mismo espacio: lo cercano en significado queda cerca en geometría. Esa es la apuesta contrastiva.
Intuición
CLIP entrena un encoder de imagen y uno de texto para acercar pares verdaderos y alejar los falsos.
El producto es zero-shot: clasificar con prompts sin reentrenar.
El laboratorio alinea puntos 2D de imágenes y captions.
Mecanismo
InfoNCE: mathcal{L}=-lograc{e^{sim(i,t)/ au}}{sum_j e^{sim(i,t_j)/ au}}.
Dual encoder vs fusion (cross-attn). Flamingo, GPT-4V, LLaVA.
Alineación no implica comprensión situada.
Laboratorio
Alineación contrastiva imagen–texto
Puntos 2D de imágenes y captions se atraen por pares. Arrastra y observa el retrieval zero-shot.
Historia
- 2013
DeViSE alinea visión y word2vec.
Frome et al.
- 2021
CLIP (Radford et al., OpenAI).
Radford et al. (2021)
- 2022
Flamingo few-shot multimodal.
Alayrac et al.
- 2023
LLaVA y la explosión de MLLMs.
Liu et al.
Límites
Sesgos del texto web se copian a la visión.
Composición y conteo siguen frágiles.
Alinear no es razonar sobre el mundo.
¿Compartir un espacio es compartir un significado?
Un perro y la palabra «perro» cercanos: ¿es semántica o co-ocurrencia?
Anclaje simbólico reaparece con otra ropa.