Saltar al contenido
Nóesis
Todas las familias
F30Redes que aprendendesde 2021

IA multimodal

Alinear visión y lenguaje al estilo CLIP

Una imagen y una frase pueden vivir en el mismo espacio: lo cercano en significado queda cerca en geometría. Esa es la apuesta contrastiva.

2021
año fundacional
1
laboratorio
2
ecuaciones
4
hitos citados
Ir al laboratorio en vivo
Lámina F30semitono de dos tintas · en vivo
§1

Intuición

Pensar es ajustar millones de conexiones.

CLIP entrena un encoder de imagen y uno de texto para acercar pares verdaderos y alejar los falsos.

El producto es zero-shot: clasificar con prompts sin reentrenar.

El laboratorio alinea puntos 2D de imágenes y captions.

§2

Mecanismo

InfoNCE: mathcal{L}=-log rac{e^{sim(i,t)/ au}}{sum_j e^{sim(i,t_j)/ au}}.

Dual encoder vs fusion (cross-attn). Flamingo, GPT-4V, LLaVA.

Alineación no implica comprensión situada.

Ec. 30.1InfoNCE imagen-texto
L=−log⁡exp⁡(sim(i,t)/τ)∑jexp⁡(sim(i,tj)/τ)\mathcal{L}= -\log\frac{\exp(sim(i,t)/\tau)}{\sum_j\exp(sim(i,t_j)/\tau)}
Ec. 30.2Similitud coseno
sim(i,t)=⟨f(i),g(t)⟩sim(i,t)=\langle f(i),g(t)\rangle
§3

Laboratorio

Lab 30.1 calculado en tu navegadorDetectando…

Alineación contrastiva imagen–texto

Puntos 2D de imágenes y captions se atraen por pares. Arrastra y observa el retrieval zero-shot.

§4

Historia

  1. 2013

    DeViSE alinea visión y word2vec.

    Frome et al.

  2. 2021

    CLIP (Radford et al., OpenAI).

    Radford et al. (2021)

  3. 2022

    Flamingo few-shot multimodal.

    Alayrac et al.

  4. 2023

    LLaVA y la explosión de MLLMs.

    Liu et al.

§5

Límites

1

Sesgos del texto web se copian a la visión.

2

Composición y conteo siguen frágiles.

3

Alinear no es razonar sobre el mundo.

§6 · Pregunta filosófica

¿Compartir un espacio es compartir un significado?

Un perro y la palabra «perro» cercanos: ¿es semántica o co-ocurrencia?

Anclaje simbólico reaparece con otra ropa.

Familias conectadas