Cómo funciona la IA moderna, en siete ideas
Un recorrido en lenguaje claro por cómo funcionan de verdad los LLMs: predecir la próxima palabra, el entrenamiento y el modelo congelado, las palabras como vectores, attention, el transformer, RAG y agentes. Con capturas del curso interactivo See How AI Works.
La IA moderna puede parecer una caja negra, pero las ideas de fondo son más entendibles de lo que parecen. Pasé los últimos meses armando un curso interactivo, See How AI Works, que las explica de a una, cada una con algo que operás vos mismo en vez de un muro de texto.
Acá van siete de esas ideas. Juntas cubren casi todo lo que pasa cuando le escribís una pregunta a ChatGPT o Claude, y cada una es una lección que podés probar gratis.

1. Una IA solo predice la próxima palabra
En el fondo, un modelo de lenguaje hace una sola cosa: lee el texto hasta ahí y predice la próxima palabra. Después la suma al texto y vuelve a predecir. No hay búsqueda ni respuesta guardada, solo una lista ordenada de palabras probables y una elección cerca del tope.
El curso arranca dejándote ser el modelo. Le das media frase y te muestra sus conjeturas ordenadas con probabilidades: leche 58%, agua 16%, crema 7%. No "sabía" la respuesta; le puso un puntaje a cada candidata y se quedó con la más probable. Repetí ese único movimiento unos cientos de veces y tenés un párrafo entero. Todo lo demás acá abajo es, en realidad, para que esa conjetura salga mejor.

2. Su conocimiento se entrena una vez y después se congela
¿De dónde salen esas probabilidades? El modelo se entrena una sola vez, jugando a adivinar la próxima palabra sobre un pedazo enorme y filtrado de internet, y ajustándose cada vez que se equivoca. Cuando el entrenamiento termina, los números quedan congelados.
Por eso todo modelo tiene una fecha de corte y no puede saber por sí solo el clima o las noticias de hoy. Cuando un chatbot igual responde sobre el ahora, la app que lo rodea ejecutó una herramienta (una búsqueda o una consulta) y pegó el resultado en el prompt para que el modelo lo lea. Nunca "se conectó a internet".
La lección dibuja todo en una sola imagen (internet en bruto → bucle de entrenamiento → modelo congelado → herramientas) y de paso rompe un mito común: adentro del modelo no hay una base de datos de hechos, solo números congelados. Lo actual llegó ahí como texto que alguien le pasó.

3. Las palabras se vuelven números, y la cercanía es similitud
Para que todo esto sea aritmética, las palabras primero tienen que volverse números. Cada palabra se convierte en un vector: una posición en un gran espacio de significado. La gracia de ese espacio es que la posición carga significado. Las palabras que significan cosas parecidas quedan cerca, así que "gato" cae cerca de "perro" y "cachorro" y lejos de "coche", y la distancia pasa a medir qué tan relacionadas están dos cosas.
En el curso soltás una palabra en un mapa revuelto y la ves ordenarse sola: los animales se juntan en una esquina, los vehículos en otra. Acordate de esta idea. "La cercanía es similitud" es el mismo truco que hace funcionar las dos que siguen.

4. Attention: cada palabra mira a las demás
El significado de una palabra depende de las que tiene alrededor. "Banco" no significa lo mismo al lado de "plaza" que al lado de "préstamo". Attention es el mecanismo que resuelve eso: cada palabra puede mirar a las otras de la frase y traerse las que importan, puntuadas con la misma medida de cercanía de antes. Cada palabra termina con un significado moldeado por su contexto.
Esta es la idea que destrabó los modelos de lenguaje modernos. La lección la muestra como una grilla de pesos con un control de nitidez, así ves cómo una palabra pone casi toda su atención en la palabra de la que depende, y podés afinar o difuminar ese foco y ver cómo se redistribuyen las porciones.

5. Un transformer es ese bloque, apilado
"Transformer", la T de GPT, suena exótico, pero es sobre todo el attention que acabás de ver, empaquetado en una unidad que se repite. Un bloque corre attention, después un pequeño paso de procesamiento por palabra, con un par de estabilizadores alrededor para que el entrenamiento no se vaya de las manos.
Un solo bloque ajusta las palabras apenas. La jugada de verdad es apilar decenas, para que cada capa refine lo que produjo la anterior, y en esa profundidad está la sofisticación. El curso arma el bloque parte por parte y después lo muestra apilado, alimentando la predicción de la próxima palabra de la idea #1.

6. RAG: darle a un modelo congelado tu propio conocimiento
Como el modelo está congelado, no sabe nada de los documentos de tu empresa ni de nada que haya pasado después del entrenamiento. RAG (retrieval-augmented generation) es la solución estándar, y reutiliza la idea de cercanía tal cual. Agarrás la pregunta, buscás en tu propio texto los fragmentos más cercanos en significado, y los pegás en el prompt antes de que el modelo responda.
No se reentrena nada. Al modelo simplemente se le entrega el pasaje justo para leer. Casi todas las funciones de "chateá con tus documentos" funcionan así. En la lección hacés una pregunta y, de cuatro notas privadas, la que de verdad responde se ilumina y entra al contexto.

7. Agentes: envolver al modelo en un loop para que actúe
Un modelo, solo, únicamente puede producir texto. No busca, no ejecuta código, no cambia nada en el mundo. Un agente es el loop que le ponés alrededor: el modelo propone una acción (llamá a esta herramienta con estos datos), la app la ejecuta de verdad, el resultado vuelve a entrar, y el modelo decide el próximo paso, una y otra vez hasta terminar la tarea.
Lo importante es que un agente no es un modelo más inteligente. Es el mismo modelo congelado con un loop y unas herramientas atadas. Esa es la maquinaria detrás de la ola actual de IA que reserva cosas, edita archivos o escribe código. El curso lo dibuja como un ciclo pensar → actuar → observar: el modelo escribe una llamada a herramienta que no puede ejecutar por sí solo, y el loop la ejecuta y le devuelve el resultado.

La historia completa
Esas siete ideas encajan en una sola imagen: un modelo que solo predice la próxima palabra, entrenado sobre internet y después congelado, trabajando sobre palabras-como-vectores, usando attention para leer el contexto, apilado en un transformer, y extendido con retrieval y herramientas para alcanzar conocimiento fresco y actuar. Eso es casi todo lo que hacen los sistemas de hoy.
El curso completo va más lejos (tokens, escalado, por qué los modelos alucinan, cómo se evalúan, el hardware que hay debajo), y cada lección está hecha igual: un problema que se siente y después el mecanismo que lo resuelve, siempre algo que operás en vez de leer.
Está en pleno lanzamiento, así que es gratis para los primeros 100 que lo reclamen, de por vida, con un solo inicio de sesión y sin tarjeta. Después es una compra única, sin suscripción, y las actualizaciones van incluidas a medida que el campo avanza. Podés empezar gratis y sin cuenta en seehowaiworks.com.