«La ejecución de bajo nivel sigue siendo clásica (MoveIt 2, controladores PID): el puente semántico→acción es el cuello de botella.»
awesome-embodied-ai — research-gaps.md, §2: Planificación semántica y agentes robóticos, 2026.
«Low-level execution remains classical (MoveIt 2, PID controllers) — the semantic→action bridge is the bottleneck.»
Tesis
El fallo silencioso de la fase anterior es del robot. Pero encima de la política de control ya no hay solo control: hay un modelo de lenguaje decidiendo qué hacer, y entre lo que ese modelo dice y lo que el actuador ejecuta queda un hueco que nadie ha estandarizado.
Ahí el fallo cambia de naturaleza. Cuando el modelo escribe texto, la salida equivocada la lee una persona y, con suerte, la corrige: una frase se corrige leyéndola. Cuando el modelo está al otro lado del puente, esa misma salida ya es una consigna de movimiento — y la corrección llega después del contacto, con la pieza rota en la mano.
La conclusión de la fase no es tranquilizadora ni catastrofista: el puente no se cierra con un modelo mejor, sino con una capa de verificación. Y esa capa no se entrena — se diseña.
Cinco maneras de tender el puente
Son los cinco enfoques que aparecen en la colección de referencia. Lo revelador no es lo que cada uno logra, sino el límite que cada uno declara — porque ese límite marca dónde queda trabajo.
Anclar a lo que el robot puede hacer.SayCan — do as I can, not as I say. El modelo propone; el robot filtra por sus afordancias reales, y la frase que no corresponde a ninguna acción posible no llega al actuador. Límite declarado: afordancias preentrenadas — el filtro solo cubre lo que se anticipó.
Que el modelo escriba el código.Code as Policies. El modelo no emite acciones: emite programas que el robot ejecuta, y un programa se puede leer antes de correrlo. Límite declarado: el código generado requiere validación — alguien tiene que leerlo.
Traducir a un planificador clásico.LLM+P. El modelo traduce el problema a PDDL y lo resuelve un planificador formal, que sí garantiza lo que promete: la creatividad queda en la traducción, la garantía en el planificador. Límite declarado: exige la traducción a PDDL — y traducir mal es un fallo silencioso más.
Anclar a un grafo de escena.SayPlan. El plan se apoya en un grafo 3D del entorno, de modo que el modelo no puede referirse a cosas que no existen en la escena. Límite declarado: depende de la calidad del grafo — el anclaje no es mejor que el mapa.
Cerrar el lazo con retroalimentación.Inner Monologue. El resultado de cada paso vuelve al modelo como texto, así que puede notar que algo salió mal y replanificar. Límite declarado: el lazo es manual — quien lo cierra, hoy, sigue siendo un humano.
Intuición Física 07 · Animación Interactiva
El Puente Semántico→Acción: con y sin Capa de Verificación
Una instrucción en lenguaje cruza hacia el actuador. Observa qué ocurre cuando el plan es infactible y no hay nada entre la frase y el movimiento — y qué cambia cuando el filtro de afordancias se interpone.
PLAN: —VERIFICACIÓN: ningunaEN TRÁNSITO
💡
Intuición clave: la capa de verificación no hace al modelo más listo ni elimina la confabulación: la contiene. Con una instrucción factible, ambos puentes se comportan igual — el filtro no estorba. La diferencia aparece justo cuando el plan es plausible y falso, que es el único caso en el que hacía falta.
📄Base científica: SayCan (Ahn et al., 2022) · Code as Policies (Liang et al., 2022) · Inner Monologue (Huang et al., 2022) · Harness Engineering (2026)
Los cinco enfoques comparten algo más que su límite: ninguno elimina la confabulación. Los cinco la contienen, interponiendo algo verificable entre el lenguaje y el actuador — una afordancia, un código revisable, un plan comprobable, un grafo, un humano en el lazo.
Conviene mirar dónde termina cada uno de esos límites. En SayCan, en lo que alguien anticipó. En Code as Policies, en quien lee el código. En LLM+P, en quien escribe la traducción. En SayPlan, en quien construyó el mapa. En Inner Monologue, en quien cierra el lazo. Los cinco puentes, mirados de cerca, terminan en una persona.
No hay puente LLM→ROS 2 estandarizado.La colección lo registra como hueco abierto: cada trabajo genera código ad hoc. La oportunidad declarada es un marco de primitivas de habilidad en ROS 2 invocables por un modelo de lenguaje.
La detección avanzó; la recuperación no.Ya hay detectores para los dos orígenes del fallo — el razonamiento y los datos capturados —, pero la recuperación automática sigue casi vacía. Detectar que el puente falló no es todavía saber qué hacer después.
El lazo sigue siendo manual.Inner Monologue lo cierra con retroalimentación en lenguaje, pero quien la produce es una persona. La memoria episódica persistente entre sesiones figura como hueco, no como resultado.
La capa ya tiene nombre.Harness Engineering propone entender el middleware como capa de arnés del sistema físico. El mazo de cables de la fase 4 vuelve, esta vez como metáfora de lo que sostiene todo lo demás.
De ahí sale el trabajo de ingeniería de esta fase, y no es investigación en aprendizaje automático: decidir qué se comprueba antes de actuar, contra qué referencia, con qué latencia y qué ocurre cuando la comprobación falla. La fase siguiente pregunta quién responde cuando esa capa no estaba.
Michael Ahn et al. «SayCan: Do As I Can, Not As I Say: Grounding Language in Robotic Affordances». arXiv:2204.01691, 2022.El anclaje a lo posible. Limitación registrada: afordancias preentrenadas. PDF local: papers/06_ROS2_AI_LLMs.
Jacky Liang et al. «Code as Policies: Language Model Programs for Robots». arXiv:2209.07753, 2022.El modelo escribe el programa. Limitación registrada: el código generado requiere validación. PDF local: papers/06_ROS2_AI_LLMs.
Bo Liu et al. «LLM+P: Empowering Large Language Models with Optimal Planning Proficiency». arXiv:2304.11477, 2023.La garantía la da el planificador formal, no el modelo. Limitación registrada: exige la traducción a PDDL. PDF local: papers/06_ROS2_AI_LLMs.
Krishan Rana et al. «SayPlan: Grounding Large Language Models using 3D Scene Graphs for Scalable Robot Task Planning». arXiv:2309.11489, 2023.El anclaje al mapa. Limitación registrada: depende de la calidad del grafo de escena. PDF local: papers/05_Surveys_Case_Studies.
Wenlong Huang et al. «Inner Monologue: Embodied Reasoning through Planning with Language Models». arXiv:2207.05608, 2022.El lazo cerrado con lenguaje. Limitación registrada: la retroalimentación es manual. PDF local: papers/06_ROS2_AI_LLMs.
Wenlong Huang et al. «VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models». arXiv:2307.05973, 2023.La variante que convierte el lenguaje en mapas de valor 3D. Limitación registrada: requiere un modelo de visión externo; sin integración en ROS.
«Harness Engineering for Physical AI: Robot Middleware Is the Harness Layer». arXiv:2606.09416, 2026.El middleware como capa de arnés — el nombre que el campo le da a lo que sostiene el puente. PDF local: papers/07_Recent_2025_2026.