Documento vivo

Camino a AI Engineer

Full-stack hoy, AI engineer en 2029. Cada fase, cada proyecto, cada hábito — y también lo que hago mal. Se actualiza sobre la marcha, no después.

Leer el post completoÚltima actualización: 5 de septiembre de 2026
Fase actual
Fase 0Fase actual
Proyectos publicados
0 / 7Proyectos publicados
Brechas en seguimiento
10Brechas en seguimiento
Perfil senior objetivo
2029Perfil senior objetivo

Qué estoy haciendo ahora

La foto honesta. Si algo no está en esta lista esta semana, esta semana no está pasando.

  • Aplico plan → worktrees → verificación → revisión por riesgo en un proyecto real de cliente, no en un repo de juguete.
  • Escribo y mantengo CLAUDE.md, hooks y allow-lists de permisos en cada repo que toco.
  • Avanzo en Anthropic Academy: Claude Code in Action, MCP básico y avanzado, Agent Skills y Subagents.
  • Mido el tiempo en revisión durante cuatro semanas para que la Fase 0 cierre con un número, no con una sensación.
  • Leo los posts de ingeniería de Anthropic sobre agentes efectivos, context engineering, evals y diseño de harness.

Las fases

Sep 2026 → 2029. Cada fase tiene una condición de cierre, no solo una fecha.

  1. Fase 0Sep – Oct 2026En progreso

    Trabajar como la élite en mi trabajo actual

    Costo cero, retorno inmediato y la primera línea de un CV de AI engineer. Cambiar cómo trabajo antes de cambiar qué estudio.

    35%
    • Adoptar plan → worktrees → verificación → revisión por riesgo en un proyecto real
    • Escribir y mantener el CLAUDE.md del repo
    • Configurar hooks, allow-lists de permisos y un comando /commit-push-pr
    • Sumar revisión con AI antes de la humana y medir el tiempo en revisión durante cuatro semanas
    • Anthropic Academy: Claude Code in Action, MCP, Agent Skills y Subagents
    Claude Code
    Harness de agentes
    Revisión en CI
  2. Fase 1Nov 2026 – Feb 2027Planeado

    Fundamentos en mi stack + primer proyecto real

    Aprender bien la capa de API en TypeScript, sumar Python de producción y publicar un sistema de recuperación que un negocio real use.

    0%
    • Anthropic Academy — Building with the Claude API (8h)
    • AI SDK v6 Crash Course de Matt Pocock: agentes, tool calling, desarrollo guiado por evals
    • Chip Huyen — AI Engineering
    • Python de producción: FastAPI, Pydantic, async
    • Spec de MCP 2026-07-28, de punta a punta
    • Proyecto 1: RAG con recuperación híbrida, reranking, citas, set de 50 preguntas y Langfuse desde el día uno
    Claude API
    AI SDK v6
    FastAPI
    RAG
  3. Fase 2Mar – Jun 2027Planeado

    Evals y agentes — el diferenciador

    La parte que casi todos los portafolios se saltan, y sobre la que giran las entrevistas senior.

    0%
    • Material gratuito de evals de Hamel Husain + el repo evals-skills
    • Cursos de evals de W&B y DeepLearning.AI, Agentic AI de Andrew Ng
    • Examen Claude Certified Developer
    • Proyecto 2: harness de evals con taxonomía de fallos etiquetada y gate de regresión en CI
    • Proyecto 3: servidor MCP para un sistema real, OAuth 2.1
    • Proyecto 4: agente de back-office con el Claude Agent SDK, hooks de aprobación y costo por ejecución documentado
    • AI Engineer Miami — 26–27 de abril de 2027
    Evals
    LLM como juez
    Agent SDK
    Servidores MCP
  4. Fase 3Jul – Dic 2027Planeado

    Profundidad, visibilidad y primeras aplicaciones

    Dejar de aprender en privado. Contribuir, publicar números y empezar a aplicar a puestos remotos de AI product engineer.

    0%
    • Cursos de Agents y Context de Hugging Face, intro a LangGraph, intensivo de agentes de Google
    • Proyecto 5: pipeline de extracción documental con UI de revisión humana
    • Proyecto 6: agente de voz para un hackathon
    • Proyecto 7: copiloto interno con dashboards de costo y latencia
    • Contribuir a MCP, Langfuse, Promptfoo o Mastra
    • Publicar tres posts técnicos con números reales
    • Empezar a aplicar a puestos remotos de AI product engineer
    Open source
    Escribir
    Búsqueda de empleo
  5. Años 2–32028 – 2029Planeado

    Especialidad y perfil senior

    Entender los modelos por dentro, elegir especialidad y hablar de un sistema mío que corre en producción.

    0%
    • Stanford CS336 y nanochat de Karpathy
    • Los dos libros 'from scratch' de Raschka
    • MOOC de Agentic AI de Berkeley
    • Track Claude Certified Architect, si me muevo hacia arquitectura o consultoría
    • Una charla de conferencia sobre un sistema mío en producción
    Fundamentos
    Arquitectura
    Charlas

Mi brecha, sin adornos

Ordenada por cuánto la citan las fuentes de contratación. La barra es dónde estoy hoy, no dónde quiero estar.

  • Evals y análisis de errores

    15%

    La brecha más citada. Datasets dorados, LLM como juez validado contra etiquetas humanas.

  • Calidad de recuperación

    30%

    No solo 'RAG': búsqueda híbrida, reranking y nombrar los modos de fallo sin que te pregunten.

  • Context engineering

    40%

    Compactación intencional y la zona tonta del contexto largo.

  • Diseño de agentes acotados

    35%

    Incluye saber cuándo un workflow simple le gana a un agente.

  • Economía de costo y latencia

    30%

    Ruteo de modelos, caché, salidas estructuradas.

  • Seguridad en LLM

    20%

    Prompt injection, exfiltración vía herramientas, OWASP LLM Top 10.

  • Observabilidad

    25%

    Trazas, versionado de prompts, drift, monitoreo de costo.

  • Python de producción

    35%

    FastAPI, Pydantic, async. Mi stack es TypeScript primero.

  • Pipelines documentales

    20%

    Chunking, OCR, extracción, deduplicación.

  • Bases de fine-tuning

    10%

    Baja prioridad: sobre todo saber cuándo elegirlo antes que RAG o prompting.

Los siete proyectos

Cada uno sale con su suite de evals y sus trazas — esa combinación es el portafolio.

  1. Planeado

    RAG sobre documentos de un negocio real

    Recuperación híbrida, reranking y citas sobre documentos de los que un negocio depende — no un corpus de demo.

    Next.js
    Vercel AI SDK
    pgvector
    Promptfoo
  2. Planeado

    Harness de evals para ese RAG

    Un juez LLM validado contra etiquetas humanas, con taxonomía de fallos etiquetada.

    Promptfoo
    Langfuse
    CI
  3. Planeado

    Servidor MCP para un sistema real

    OAuth 2.1, publicado en un registro y usado por algo más que mi laptop.

    MCP
    OAuth 2.1
    TypeScript
  4. Planeado

    Agente de back-office

    Facturas → extracción → validación → ERP, con hooks de aprobación y costo por ejecución documentado.

    Claude Agent SDK
    Hooks
    ERP
  5. Planeado

    Pipeline de extracción documental

    Puntajes de confianza y UI de revisión humana, porque extraer sin revisar es un pasivo.

    Python
    FastAPI
    OCR
  6. Planeado

    Agente de voz con tool calling

    Hecho para un hackathon, así la fecha límite es externa.

    Realtime API
    Tools
  7. Planeado

    Copiloto interno

    Spans de OpenTelemetry GenAI, SLOs de costo y latencia en un dashboard que alguien más lee.

    OTel
    Grafana
    Agent SDK

Día a día

Los hábitos debajo del roadmap. Aburridos a propósito.

  • Publicar en abierto

    Cada proyecto lleva repo, README con números reales y un post. Lo privado me enseña; lo público me contrata.

  • Evals antes que features

    Ninguna capacidad nueva entra sin algo que me avise si se degradó. Las vibras no son una suite de pruebas.

  • Un usuario real

    Cada proyecto apunta a un negocio o una persona real. Los corpus de demo esconden los fallos que preguntan en entrevistas.

  • Medir el número aburrido

    Tiempo en revisión, costo por ejecución, latencia p95. Una afirmación sin números es una opinión.

  • Agentes en repos reales

    Plan, worktrees, verificación y revisión por riesgo — en trabajo de producción, a diario, no en ejercicios.

  • Escribir el post en caliente

    Las notas se pudren rápido. Esta página existe para no reescribir la historia después.

Sigo / ignoro

Lo que de verdad aplico y el ruido que decidí saltarme. Ambos cuestan tiempo.

Sigo

  • Los evals como filtro de contratación

    Salir de las vibras: datasets dorados, LLM como juez validado contra humanos, suites de regresión con gate en CI.

  • '¿Qué se te ha roto?'

    La pregunta que abre casi toda entrevista senior. Vale la pena tener tres respuestas reales listas.

  • La zona horaria como ventaja real

    UTC-6 es US Central. Toda guía de nearshore la lista primero, y Honduras no aparece en ninguna guía de talento AI de LATAM.

  • La realidad de comprar en vez de construir

    76% de los casos de uso de AI empresarial se compran, no se construyen. Alguien tiene que integrarlos a procesos reales — ese es el trabajo.

Ignoro

  • 'Un millón de líneas en una semana'

    Los equipos con throughput verificable lo atribuyen a linters, docs, tests y sandboxes — no a flotas de 30 agentes autónomos.

  • Estadísticas de adopción autorreportadas

    '98% de los empleados usa X' y '47% del código lo escriben agentes' son percepción o datos de vendor.

  • Capturas de sueldos FDE de $450K

    Solo laboratorios frontier, 55–70% en equity y casi siempre exigen presencia en US/UK/EU.

  • El cohorte de evals de $4,200

    Fuera de presupuesto, y el material gratuito cubre casi todo. Certificaciones cloud solo si el stack de un empleador lo exige.

Bitácora

Entradas cortas conforme avanzo. Lo más reciente primero.

  1. El roadmap se hace público

    Publiqué el post de investigación y lo convertí en esta página. Hacer visible el plan es la forma más barata de rendir cuentas que conozco.

    Fase 0
    Escribir
  2. Arranca la Fase 0

    CLAUDE.md escrito para el repo principal del cliente. Siguen hooks y allow-lists de permisos, y luego cuatro semanas midiendo el tiempo en revisión.

    Fase 0
    Claude Code
Camino a AI Engineer — Angel Valladares