«La ejecución de bajo nivel sigue siendo clásica (MoveIt 2, controladores PID): el puente semántico→acción es el cuello de botella.»
awesome-embodied-ai — research-gaps.md, §2: Planificación semántica y agentes robóticos, 2026.
«Low-level execution remains classical (MoveIt 2, PID controllers) — the semantic→action bridge is the bottleneck.»
El resto de esta fase traduce esa frase a decisiones de diseño concretas.
De la señal a la conexión
En la fase 5 faltaba una señal de error. Aquí falta una conexión estándar entre quien decide y quien actúa.
El modelo de lenguaje decide qué hacer; el controlador mueve el robot. Ambos pueden fallar. La propuesta de la ponencia es unirlos mediante una capa de habilidades con contrato: acciones permitidas, límites y resultados comprobables.
Modelo → Habilidades con contrato → ROS 2 → Controladores ← Resultado verificado de cada acción
Esa capa de verificación se diseña: un modelo mejor, por sí solo, no la sustituye.
La conexión, en cinco piezas
1 · Catálogo de accionesHabilidades concretas: tomar, insertar, mover. El modelo invoca acciones del catálogo con parámetros; no inventa órdenes ejecutables.
2 · Contrato por habilidadDeclara qué debe cumplirse antes, qué se comprueba después y qué fallos puede devolver.
3 · Guarda previaComprueba objeto, alcance y límites de fuerza. Si no se cumplen, rechaza la llamada o pide aclaración antes de mover.
4 · Resultado tipadoDistingue éxito, precondición incumplida, ejecución sin lograr el resultado y acción abortada. Recibir la orden no equivale a cumplirla.
5 · Transporte comúnAcciones y servicios de ROS 2 con un esquema compartido entre modelos y robots: eso es lo que se busca estandarizar.
Ejemplo: insertar un conector. Antes: conector localizado y zócalo accesible. Durante: respetar la fuerza máxima. Después: comprobar la conexión. Si la comprobación falla, devolver un fallo explícito.
La comprobación previa, en acción
Ejemplo interactivo
Misma orden. Una comprobación cambia el resultado.
Orden: «Guarda la taza en el cajón». El plan propone insertarla directamente, sin abrirlo primero.
El cajón está:
Sin verificación
ModeloPropone insertar la taza.
ComprobaciónSe omite: la orden pasa al robot.
RobotIntenta insertarla en el cajón cerrado.
✕ Choque con el cajónLa orden llegó al robot; la taza no quedó guardada.
Con verificación
ModeloPropone insertar la taza.
Comprobación¿Está abierto? No → bloquea la acción.
RobotNo se mueve. La taza sigue fuera.
✓ Choque evitadoDevuelve «precondición incumplida»: hay que abrir el cajón y volver a comprobar.
💡
Intuición clave:Cajón cerrado: sin guarda hay choque; con guarda se bloquea la acción antes de mover.
La guarda comprueba una precondición: cajón abierto. El contrato completo también debe comprobar que la taza quedó dentro.
📄Base conceptual: SayCan (Ahn et al., 2022) · ejemplo didáctico de verificación previa.
No impiden que el modelo invente una respuesta: ayudan a contenerla. La tarea pendiente que recoge la ponencia es una interfaz común de habilidades entre modelos de lenguaje y ROS 2.
El contrato deja decisiones humanas a la vista
Alguien define qué fuerza es segura, qué cuenta como «hecho» y qué ocurre si falla la comprobación.
La capa de habilidades hace esas decisiones explícitas y auditables. Diseñar el catálogo, los contratos y los límites es trabajo de ingeniería de interfaces y middleware.
El mazo de cables de la fase 4 vuelve como capa de software. La siguiente pregunta es quién responde por las decisiones que quedaron allí.
Michael Ahn et al. «Do As I Can, Not As I Say: Grounding Language in Robotic Affordances». arXiv:2204.01691, 2022.Ancla el plan a las habilidades disponibles; antecedente de la guarda del ejemplo.
Jacky Liang et al. «Code as Policies: Language Model Programs for Robots». arXiv:2209.07753, 2022.Convierte instrucciones en programas revisables antes de ejecutarlos.
Bo Liu et al. «LLM+P: Empowering Large Language Models with Optimal Planning Proficiency». arXiv:2304.11477, 2023.Separa la traducción del problema y su resolución con un planificador formal.
Krishan Rana et al. «SayPlan: Grounding Large Language Models using 3D Scene Graphs for Scalable Robot Task Planning». arXiv:2309.11489, 2023.Conecta el plan con un grafo de la escena y depende de la calidad de ese mapa.
Wenlong Huang et al. «Inner Monologue: Embodied Reasoning through Planning with Language Models». arXiv:2207.05608, 2022.Incorpora retroalimentación en lenguaje para ajustar el plan.
«Harness Engineering for Physical AI: Robot Middleware Is the Harness Layer». arXiv:2606.09416, 2026.Presenta el middleware como capa de arnés entre la decisión y la acción física.