Attention Is All You Need: la semilla de la IA generativa moderna
El paper de 2017 que cambió el paradigma: de leer palabra a palabra a que todas se consulten entre sí a la vez.
// espacio-latente.com
Construyo y documento sistemas reales con agentes, LLM locales y automatización.
Cada módulo lleva un número de serie (U-01, U-02…): marca el orden en que se montó, no un nivel ni una jerarquía de lectura.
La mecánica interna: atención, representación, compresión y unidades mínimas de texto.
El paper de 2017 que cambió el paradigma: de leer palabra a palabra a que todas se consulten entre sí a la vez.
Primer módulo de la serie 'Por dentro de los LLM': por qué el significado se puede medir como distancia y dirección entre vectores.
Tercer módulo de la serie 'Por dentro de los LLM': cómo se trocea el texto antes de que el modelo lo vea, por qué escribir en español te sale un 45 % más caro, y qué ocurre exactamente en la primera capa.
Cómo un modelo aprende a resumir sin perder lo esencial.
El primer paso, y por qué el modelo no ve palabras sino fragmentos.
Con los fundamentos en el rack: cómo un modelo pasa de predecir texto a actuar.
Un agente que responde por mí: quién soy, qué hago y por qué.
Tres vocabularios que se usan como si compitieran y no compiten: uno describe quién decide el siguiente paso, otro cómo se dibuja el recorrido, y el tercero el suelo sobre el que se pisa. Con la evidencia de que el suelo importa más de lo que parece.
Este sitio también es un caso de estudio: qué se monta, con qué piezas, por qué y qué se descarta por el camino.
Primer episodio de la bitácora de construcción: qué es el radar, qué tecnologías lo mueven (colas, embeddings, retrieval) y las decisiones — y los descartes — detrás de cada una.
Segundo episodio de la bitácora: cómo el radar dejó de repetir la misma noticia contada por dos medios distintos — y un límite de la plataforma que nadie había verificado hasta que falló de verdad.
Tercer episodio de la bitácora: cómo se bajó el coste de la memoria semántica agrupando en lotes, se cerró de verdad el límite de peticiones con un tope duro, y dos bugs reales que solo encontró la primera suite de tests del proyecto — ninguno lo había reportado un lector.
Cómo tengo montada la infraestructura que decompone tareas, las reparte entre agentes maker/checker en contenedores Docker, y por qué construirla sobre el fork de agent-loops (Daniel Fernández) en vez de reescribirla desde cero.
GLM-5.2 se quedó sin saldo como maker de la granja de agentes. Construir una comparativa justa entre 5 modelos locales destapó un fallo que no era de los modelos — y terminó en un modelo gratuito a la altura de Claude Sonnet 5 en el harness, con matices en producción.
La comparativa de 5 candidatos del round 1 tenía un problema de metodología escondido: un muestreo aleatorio hacía que dos corridas de Terminal-bench no fueran comparables entre sí. Corregido eso, la revancha contra el candidato más serio (Qwen3.8-27B) se decide 3 baterías a 2. Un tercer candidato, BTL-4-Compact —cuantizado a 2.3 bits de fábrica—, se queda fuera: HumanEval flojo y una corrida de Terminal-bench que ni siquiera pudo completarse por límite térmico.
Un motor de análisis de fondos sobre el catálogo público de MyInvestor tiene una feature central —detectar solapamiento oculto— que un límite real del catálogo deja incompleta. La historia de por qué ese límite se queda documentado en vez de maquillado.
Sweep de --n-cpu-moe en una 3090 Ti con un modelo MoE de 35B: la velocidad degrada suave hasta un muro de admisión, y subir de Q4 a Q6 para poder offloadear cuesta más de la mitad del throughput sin ganar calidad medible.
Tercer aspirante a la RTX 3090 Ti: Ornith-1.5-35B, ~3 veces más rápido que el campeón. Con contexto extendido a 128k completa por fin la batería de Terminal-bench pendiente desde el round 2 — y empata 7/10 con Devstral. Empatar no es superar: el título se queda donde estaba.
Embeddings y búsqueda vectorial para no publicar la misma noticia dos veces.
No son artículos, son máquinas encendidas: cosas que he construido y que siguen funcionando (o esperando a que las retome).
Sistema de trading multi-agente: analiza 21 tickers al día, razona sobre señales técnicas y sentimiento con LLMs locales, y ejecuta órdenes en una cuenta paper de IBKR.
Propón un experimento, una duda sobre agentes o algo que quieras ver documentado aquí.
Perfílala con IA (opcional)
Cuéntame qué te gustaría ver y te ayudo a acotarlo — unos pocos mensajes, gratis.