Ingeniero de software
hace 4 días
Chazo
Una compañía con equipos de IA avanzada incorpora un/a AI Runtime & Evaluation Engineer para el diseño, implementación y evaluación de arquitecturas de agentes de IA a escala productiva. Rol clave en la creación de sistemas robustos de evaluación y benchmarking de LLMs, gestión del runtime de agentes y observabilidad avanzada. Rol fundamental en el ciclo de vida de sistemas de agentes IA en producción real — no POCs, no research aislado. 🎯 Sobre el ro lSerás responsable de construir, optimizar y validar rigurosamente sistemas de agentes de IA. Diseñarás las arquitecturas, gestionarás su runtime end-to-end, y — muy importante — establecerás la metodología de evaluación que asegura calidad, rendimiento y reproducibilidad. Impacto tangible en la fiabilidad de soluciones IA a escala . ?? Lo que har ás Arquitecturas de agent • es:Diseñar sistemas de agentes: planning, tool calling, function calling, memory, context engineering, semantic routi, • ng.Distinguir y diseñar workflows vs agentes según caso de u, • so.Trabajar con MCP (Model Context Protocol) y, idealmente, A, • 2A.Orquestar sistemas multi-agen te. Runtime de agen • tes:Gestionar execution loop, state management, orchestration, retries, checkpoint, • ing.Implementar streaming, human-in-the-loop, gestión de conte, • xto.Observabilidad avanzada, tracing, tool execution, concurre ncy. Evaluación (crít • ico):Diseñar evals offline y on, • line.Construir benchmarks robustos + golden datasets + synthetic data, • sets.Aplicar LLM-as-a-judge, pairwise compar, • ison.Regression testing + experiment tracking + reproducibilidad (MLf low) • . RAG:Chunking, embeddings, reranking, vector databases, retrieval quality, context wi ndows. LLM Engin • eering:Prompting, structured outputs, JSON schema, function c, • alling.Optimización de tokenización, coste, latencia, c, • aching.Reasoning models + context window mana gement. Backend + Observabilidad + • Testing:Python backend con FastAPI, Docker, Kub, • ernetes.OpenTelemetry + Grafana + Pro, • metheus.Unit testing, integration testing, eval testing, regression suites, CI/CD para IA. ✅ Impres • cindiblesExperiencia sólida diseñando arquitecturas de agentes IA en producción (planning, tool/function calling, memory, context engineering, semantic routi, • ng, MCP).Experiencia práctica con runtime de agentes end-to-end (execution loop, state, retries, checkpointing, streaming, HITL, conc, • urrency).Experiencia crítica en evaluación de modelos: offline + online evals, benchmark design, golden + synthetic datasets, LLM-as-a-judge, regression testing, experiment, • tracking.Dominio avanzado de Python para backend, • robusto.Conocimiento experto de RAG (chunking, embeddings, reranking, vector DBs, retrieval, • quality).LLM Engineering avanzado (prompting, structured outputs, function calling, tokenización, coste, latencia, caching, reasoning, • models).Experiencia con MLflow para experiment, • tracking.Inglés avanzado 💡 Muy • valorableFrameworks de agentes: LangGraph, OpenAI A, • gents SDK.A2A (Agent-to-Agent, • Protocol).Infraestructura: FastAPI, Docker, Kubernetes, Redis, Kafka, P, • ostgreSQL.Observabilidad: OpenTelemetry, Grafana, P, • rometheus.Testing: unit + integration + eval + regression suites + CI/C, • D para IA.Cloud AI: Azure OpenAI, AWS Bedrock + AgentCore, GCP Vertex AI. 💻 • CondicionesModalidad: freelance v, • ía Shakers.Duración: 12 meses con alta probabilidad de, • extensión.Ubicación: 100% remoto de sde España. En Shakers nos ocupamos de la gestión del proyecto, la facturación y el acompañamiento. Tú te centras en construir agentes IA fiables y evaluables a escala productiva.