Volver al blog
ia stack llm herramientas infraestructura

Mi stack de IA en 2026

3 min de lectura

Mi stack de IA en 2026

Hace un año mi stack era el de un full-stack con curiosidad por la IA. Hoy es al revés: construyo sistemas de IA y el resto del stack existe para sostenerlos. Este es el inventario honesto de lo que uso a diario, con sus porqués.

Orquestación de agentes

LangGraph para los flujos complejos: cuando un agente necesita estados, reintentos y bifurcaciones, un grafo explícito gana a cualquier cadena de prompts. PydanticAI cuando quiero menos ceremonia y tipado fuerte de entrada y salida. Y MCP como estándar de conexión entre modelos y herramientas; en 2026 ya no es apuesta, es fontanería básica.

Para mensajería entre servicios uso NATS. Ligero, rápido y con la semántica justa para que decenas de agentes se hablen sin montar un monstruo.

Inferencia: de la API al hierro

Aquí está el cambio grande de estos años. Trabajo a diario con Claude, GPT, Gemini y GLM vía API, pero cada vez más cosas corren en infraestructura propia: vLLM para servir modelos abiertos con throughput serio, Ollama y llama.cpp para experimentos y cargas pequeñas. Delante de todo, LiteLLM como proxy multi-proveedor con routing y fallback: si un proveedor se cae o se encarece, el sistema ni se entera.

El asistente de esta misma web corre sobre GLM a través de un proxy propio. No hay mejor forma de entender un stack que comer de él.

Memoria y recuperación

pgvector cuando el proyecto ya vive en Postgres y Qdrant cuando la carga vectorial manda. RAG sigue siendo la técnica más rentable del catálogo, con una condición: medir la calidad de la recuperación, no solo la del modelo. La mayoría de los «el RAG no funciona» son un retrieval pobre con un LLM inocente.

Entrenar en casa

Lo que más me ha sorprendido este año es lo accesible que se ha vuelto el post-entrenamiento. Con Unsloth y GRPO se puede afinar un modelo abierto en hardware local de gama alta. No sustituye a los modelos frontera, pero para tareas acotadas un modelo pequeño bien afinado es más barato, más rápido y más tuyo.

Voz e IA en el dispositivo

Whisper acelerado y pyannote para transcripción y diarización en tiempo real, y LiteRT con Gemma para experiencias completamente locales en Android. La IA que no sale del dispositivo abre casos de uso que la nube no puede tocar, empezando por la privacidad.

Lo de siempre, que sigue importando

TypeScript y Python como lenguas francas. Node y FastAPI en el backend. Postgres, MongoDB y Redis según el problema. Docker y GitHub Actions para que todo llegue a producción, Traefik delante y Playwright vigilando que no se rompa. Nada glamuroso, todo imprescindible.

El criterio detrás del inventario

Si tuviera que resumir el stack en una regla: cada pieza tiene que poder explicarse en una frase y sustituirse en una semana. Las herramientas pasan; los sistemas que aguantan producción se quedan.