La demostración de Digit en IROS 2026 muestra que la próxima prueba humanoide será la fiabilidad medible
La primera ejecución de manipulación móvil de Digit v4 resulta una señal de investigación relevante, pero no demuestra autonomía general en almacenes. La prueba decisiva será la repetibilidad, la recuperación, la seguridad y el coste en una instalación real.
La afirmación más útil sobre robots humanoides que dejó IROS 2026 es también la más fácil de sobredimensionar. Un breve informe desde la sala de exposición afirma que un Agility Digit v4 completó, en su primer intento, una ejecución integral de manipulación móvil. El dato resulta interesante porque reúne dos tareas que suelen demostrarse por separado: desplazarse por un espacio y realizar un trabajo útil con los brazos. Por sí solo, no demuestra que un humanoide pueda operar de forma fiable durante todo un turno en un almacén.

La distinción importa. Las empresas de robótica están pasando de demostraciones cuidadosamente preparadas a sistemas que deben navegar, percibir, agarrar, recuperarse de errores y mantenerse seguros cerca de equipos y personas. Una puesta en marcha exitosa puede mostrar que un controlador, un robot y una tarea fueron compatibles en esa ocasión. No permite establecer una tasa de producción, un caso de seguridad, una distribución de fallos ni una ventaja de costes.
IROS 2026, celebrado en Pittsburgh del 27 de septiembre al 1 de octubre, ofrece un buen contexto para examinar esa brecha. Su programa sitúa junto a junto a la manipulación móvil el control de cuerpo completo, el aprendizaje y la seguridad física. El informe sobre Digit aporta el gancho informativo. Las propias comunicaciones de Agility aportan el contexto comercial. En conjunto, apuntan a una conclusión menos espectacular pero más útil: la próxima prueba para los humanoides no es saber si una política aprendida puede mover a la vez el cuerpo y las manos de un robot. Es saber si esa capacidad puede medirse, acotarse y operar como servicio.
Qué afirma realmente la demostración de IROS
La afirmación pública procede de Chris Paxton, quien describió como realizada “out of the box” y al primer intento una ejecución integral de manipulación móvil en un Agility Digit v4 durante IROS 2026. Un artículo de noticias sobre robótica que conservó la publicación y los vídeos disponibles añade una salvedad importante: el informe no incluía una tasa de éxito, un número de intentos, una lista de tareas ni una comparación controlada.
Aun así, se trata de un resultado significativo. En una arquitectura robótica convencional, la navegación, el movimiento de los brazos, el agarre y la lógica de la tarea pueden estar separados en módulos distintos. Pueden intercambiar estados, pero cada conexión es un punto donde las suposiciones pueden volverse frágiles. Un manipulador móvil puede llegar a un objeto con una orientación ligeramente incorrecta; un planificador de brazos puede esperar que la base permanezca inmóvil; un agarre puede fallar porque el objeto no está donde el modelo de cámara había previsto. “De extremo a extremo” suele indicar que un sistema aprendido o controlado conjuntamente coordina una parte mayor del comportamiento del robot como un único problema de decisión.
La expresión no aclara qué proporción del sistema es aprendida, cuál está diseñada manualmente ni cómo se seleccionó la tarea. Tampoco indica si había una persona preparada para intervenir, si la ruta y la disposición de los objetos estaban preparadas o si el robot había visto la escena durante una recopilación de datos anterior. No son acusaciones. Son las variables básicas necesarias para interpretar una demostración.
Por tanto, un éxito al primer intento puede respaldar una afirmación limitada: Digit v4 fue capaz de ejecutar al menos un escenario integrado de manipulación móvil bajo las condiciones de la demostración. No respalda la afirmación más amplia de que Digit pueda generalizar a cualquier trabajo de almacén. La pregunta editorial útil no es si el vídeo es auténtico. Es qué evidencia convertiría el vídeo en una afirmación operativa.
Por qué la manipulación móvil es más difícil que un vídeo de recoger y colocar
Un brazo estacionario tiene una ventaja importante: su espacio de trabajo, sus soportes, la posición de la cámara y sus límites de colisión pueden diseñarse de antemano. Las células industriales suelen parecer repetitivas porque la repetibilidad forma parte del producto. El robot no tiene que comprender un edificio entero; debe ejecutar un movimiento definido dentro de un entorno conocido.
Un manipulador móvil renuncia a parte de ese control. La base cambia la geometría de cada alcance. El suelo puede ser irregular. Una persona puede cruzarse en el camino. Un contenedor puede estar parcialmente obstruido. El robot debe decidir dónde colocarse, a qué distancia puede aproximarse con seguridad, si puede alcanzar el objeto desde esa posición y qué hacer si falla el primer agarre. Si es bípedo, mantener el equilibrio mientras alcanza o transporta algo introduce otro acoplamiento entre locomoción y manipulación.
Ese acoplamiento explica por qué la palabra “móvil” tiene tanto peso. Caminar hasta un punto marcado es navegación. Recoger un objeto de una presentación fija es manipulación. Hacer ambas cosas mientras se adapta a la posición real del objeto es una capacidad de horizonte más largo. El espacio de acciones se amplía y también aumenta el número de formas en que un pequeño error puede propagarse.
El programa de IROS refleja este problema de investigación. La conferencia enumera sesiones sobre aprendizaje por refuerzo para locomoción ágil de humanoides y robots con patas, locomoción en terrenos difíciles y trabajos sobre comunicación y colaboración. Un taller dedicado a Mobile Manipulation and Embodied Intelligence describe la manipulación móvil con abundantes contactos como una base para una autonomía robusta y desplegable. Ese marco resulta más informativo que una promesa general de “inteligencia de propósito general”: el contacto, la recuperación y las condiciones de despliegue son los puntos donde las suposiciones del robot se encuentran con el mundo físico.
La base comercial de Digit ya es más limitada que el titular
Los materiales públicos de Agility sitúan a Digit v4 en un papel industrial concreto. En una declaración presentada en relación con su propuesta de combinación empresarial, la compañía describe v4 como desplegado, con una capacidad de carga declarada de hasta 35 libras, una autonomía anunciada de cuatro horas y carga autónoma. La misma presentación afirma que el robot dispone de percepción de 360 grados, destreza adaptativa orientada a flujos industriales y control de cuerpo completo que incluye modelos de visión, lenguaje y acción.
Son afirmaciones de la compañía y deben leerse como tales. La declaración también muestra el trabajo previsto: un Digit v4 que coloca cestas de 25 libras con componentes de rodamientos desde una prensa de estampación en una máquina de lavado industrial. No es una afirmación de que el robot pueda realizar todas las tareas que realiza una persona. Es un flujo concreto de manipulación de materiales, con una clase de objeto, una ruta y un destino definidos.
El comunicado de prensa de Agility de septiembre de 2026 presenta Digit v5 como una generación posterior diseñada para el trabajo cooperativo a escala. La presentación contrasta las capacidades previstas de v5 con las de v4, incluida una mayor capacidad de elevación declarada, un potencial de funcionamiento más prolongado, mayor alcance y efectores finales intercambiables. También describe v5 como destinado a operar fuera de una célula de trabajo y junto a personas. La palabra importante es “previsto”: esas cifras de v5 son expectativas hasta que el producto se publique, se pruebe y se despliegue bajo las condiciones indicadas.
Esta base comercial facilita la interpretación de la ejecución de IROS. La demostración puede representar una ampliación desde un flujo de manipulación de materiales diseñado para un propósito concreto hacia un control más integrado. Pero no debe confundirse con las pruebas de despliegue ya divulgadas por la compañía, y ninguna de las dos cosas debe confundirse con un sustituto general para un almacén. Hay, como mínimo, tres hitos distintos:
- un robot puede completar una tarea seleccionada en una demostración;
- un robot puede repetir un flujo definido con una tasa de intervención medida;
- un robot puede ofrecer una economía y una seguridad aceptables durante un horario real de operación.
El primero es un resultado de investigación. El segundo es un resultado de ingeniería. El tercero es un resultado empresarial y operativo. La cobertura sobre humanoides suele comprimirlos en una sola frase.
El denominador es la parte que falta en la mayoría de las demostraciones robóticas
“Al primer intento” suena preciso, pero no tiene denominador. ¿Primer intento de cuántas pruebas preparadas? ¿Se eligió la ejecución porque salió bien? ¿Cuántos intentos fallidos se produjeron durante la preparación? ¿Qué se consideró éxito: tocar el objeto, agarrarlo, colocarlo en el sitio correcto o completar toda la secuencia sin ayuda humana?
Una evaluación seria publicaría la definición de la tarea y las condiciones que la rodean. Como mínimo, los lectores necesitan saber:
- cuántas ejecuciones se intentaron y cuántas tuvieron éxito;
- si el objeto, la ruta y el destino cambiaron entre ejecuciones;
- si el robot había recibido demostraciones previas o ajustes específicos para la escena;
- si intervino un teleoperador o un observador de seguridad;
- la duración de cada ejecución y el tiempo dedicado a recuperarse;
- las consecuencias de un agarre fallido, una colisión o un error de navegación;
- qué sensores y qué capacidad de cómputo estaban activos en el robot;
- si la misma política funcionó en un segundo robot o en una segunda instalación.
No es burocracia por sí misma. Es la forma de hacer comparable una capacidad. Una tasa de éxito del 95 % en una presentación fija y limpia puede ser excelente para un flujo de trabajo y no servir para otro. Una tasa del 70 % en un entorno desordenado podría ser un paso de investigación valioso si el robot detecta la incertidumbre y pide ayuda de forma segura. Sin el denominador y las condiciones operativas, un vídeo mide sobre todo la calidad del momento seleccionado.
La misma lógica se aplica a la autonomía. Un robot puede ser autónomo en el movimiento de bajo nivel y, aun así, depender de una persona para elegir la tarea, aprobar una recuperación o recolocar un objeto. La supervisión humana no convierte a un sistema en fraudulento; cambia el servicio que se está vendiendo. Un operador de almacén que compra un robot que funciona con asistencia ocasional está comprando un producto distinto de uno que opera sin supervisión.
Por qué el control integrado sigue siendo un avance técnico real
La cautela no debería ocultar el valor de la investigación. Coordinar locomoción y manipulación es difícil porque el robot debe mantener una configuración corporal útil mientras cambian sus puntos de contacto y su equilibrio. Un movimiento de la base que mejora el alcance puede reducir la estabilidad. Una postura prudente puede hacer que el brazo no llegue al objeto. Un agarre puede modificar la distribución de la carga. Si el controlador trata cada etapa de forma independiente, puede producir acciones localmente razonables que fracasan como secuencia.
Una política de extremo a extremo puede, en principio, aprender relaciones entre esas etapas. Puede aprender que un mejor ángulo de aproximación reduce los fallos de agarre, o que la base debe detenerse antes porque el brazo necesita espacio para cerrarse alrededor del objeto. Con suficientes datos variados y una capa de seguridad adecuada, esto puede reducir las interfaces frágiles entre planificadores escritos a mano.
Pero “de extremo a extremo” no significa magia. Una política sigue dependiendo del espacio de observación, la distribución de entrenamiento, los límites de acción, el estado del hardware y el diseño de recuperación. Un sistema aprendido puede ser fluido y rápido en situaciones conocidas y estar mal calibrado en el límite de su experiencia. El controlador también necesita reconocer cuándo no sabe qué hacer. En máquinas físicas, la incertidumbre no es simplemente una puntuación de confianza en una pantalla; puede convertirse en una carga caída, un movimiento inesperado o una persona obligada a entrar en el área de trabajo.
Por eso, la arquitectura más útil a corto plazo podría ser híbrida. Los componentes aprendidos pueden proponer movimientos e interpretar escenas. El control clásico, la supervisión de colisiones, los límites de fuerza, la geovalla y la lógica supervisora pueden restringir lo que ocurre después. La división exacta variará según la tarea, pero el despliegue comercial exige algo más que una política que parece capaz en un vídeo.
La prueba operativa es la recuperación, no solo la finalización
Un almacén no paga para que un robot tenga éxito una vez. Paga por trabajo completado a lo largo del tiempo. Los eventos costosos no suelen ser fallos espectaculares; son las pequeñas interrupciones que obligan a un empleado a detenerse, retirar un objeto, volver a colocar un contenedor, reiniciar un sistema o explicar por qué el robot se ha vuelto prudente.
Por eso, un informe de despliegue debería incluir métricas de recuperación junto a las de éxito de la tarea. ¿Con qué frecuencia hace una pausa el robot? ¿Cuánto tarda en reanudar el trabajo? ¿Puede regresar de forma segura a un estado conocido después de un agarre fallido? ¿Identifica la causa del fallo o una persona debe inspeccionar la escena? ¿Qué ocurre cuando se degrada una batería, una pinza, una cámara o la conexión de red?
La declaración de Agility afirma que los despliegues de clientes habían acumulado más de 65.000 horas de operación y describe despliegues o compromisos en nueve instalaciones de clientes. Esas cifras son más relevantes para la madurez que una sola ejecución en un escenario porque apuntan a un uso repetido en entornos reales. Aun así, las horas de funcionamiento necesitan contexto. El material público no ofrece por sí solo un desglose completo de horas productivas, intervenciones, disponibilidad, combinación de tareas, ahorro de mano de obra ni coste por movimiento completado.
La lectura adecuada no es ni despectiva ni crédula. Las horas indican que la empresa ha avanzado más allá de una historia limitada al laboratorio. No demuestran que todos los flujos sean rentables, que todos los centros tengan el mismo rendimiento ni que el robot pueda operar sin apoyo. Un despliegue real es evidencia de ingeniería y de disposición del cliente. No es automáticamente evidencia de una economía unitaria positiva.
La seguridad cambia cuando el robot sale de la célula de trabajo
Un robot dentro de una célula vallada o controlada puede diseñarse alrededor de límites previsibles. Un robot que opera junto a trabajadores necesita otro caso de seguridad. Debe limitar la fuerza y la velocidad, detectar personas y obstáculos, comunicar su intención, detenerse con seguridad y reiniciarse de forma controlada. Sus actualizaciones de software, procedimientos de mantenimiento y gestión de excepciones pasan a formar parte del sistema de seguridad.
Los materiales de Agility describen Digit v4 como provisto de sistemas de seguridad y orientado a un despliegue en células de trabajo, mientras la compañía presenta Digit v5 como destinado a la operación cooperativa cerca de personas. Esa progresión es plausible como estrategia de producto, pero también muestra por qué las generaciones no deben tratarse como intercambiables. Un objetivo de diseño futuro no es una certificación presente. Un diagrama de marketing no es un análisis de peligros.
El entorno físico también importa. Un robot seguro junto a un carril de palés señalizado quizá no lo sea cerca de un trabajador que lleva un objeto largo, una carretilla elevadora que gira sin visibilidad o un suelo mojado. Una ejecución de manipulación exitosa dice poco sobre esas interacciones salvo que formaran parte de la prueba. Cuanto más general sea el entorno, más situaciones inusuales pero previsibles tendrá que cubrir el argumento de seguridad.
Para los compradores, la pregunta práctica no es simplemente “¿Es seguro el robot?”. Es “¿Qué riesgos controla el robot, cuáles controla la instalación y cuáles dependen de los procedimientos humanos?”. Esa pregunta conduce a requisitos concretos: zonas restringidas, límites de velocidad, paradas de emergencia, calendarios de inspección, formación de operadores, registro de incidentes y un procedimiento claro para desactivar la máquina. La autonomía es una propiedad del sistema, no una etiqueta adherida al modelo.
Coste y madurez: la forma humanoide no equivale a valor
Una forma humanoide puede resultar útil cuando el lugar de trabajo ya está construido para personas. Dos piernas permiten utilizar pasillos y escaleras existentes; un cuerpo erguido puede alcanzar estantes e interfaces diseñadas para manos humanas. Esa flexibilidad es el argumento a favor de los formatos de propósito general.
También tiene un coste. Un bípedo necesita control del equilibrio, gestión de caídas, mantenimiento más complejo y un perímetro de seguridad mayor que un brazo fijo o una máquina especializada con ruedas. Si la tarea consiste en mover un contenedor por una ruta plana y predecible, una cinta transportadora, un carro o una base móvil pueden ser más baratos y fáciles de mantener en funcionamiento. Un humanoide justifica su complejidad cuando su capacidad para utilizar espacios y herramientas existentes compensa el coste de esa complejidad.
El modelo de negocio importa tanto como el precio de compra. Robot-as-a-Service puede trasladar la decisión del gasto de capital a un contrato operativo, pero no hace desaparecer el trabajo humano. El cliente sigue pagando por espacio, integración, carga, supervisión, mantenimiento y excepciones. Un robot barato al mes que requiere intervenciones frecuentes quizá no supere a una máquina especializada. Un sistema más caro podría tener sentido si cubre varios flujos sin una reconfiguración importante.
Aquí el perfil actual de Digit resulta más creíble que el lenguaje amplio de “robot de propósito general”. Un flujo industrial definido permite al proveedor medir el resultado y construir el proceso de soporte. El producto puede ampliarse después si los datos muestran que merece la pena resolver la siguiente tarea. La trayectoria comercial probablemente se parecerá menos a un sustituto humano que llega de una vez y más a una secuencia de trabajos acotados conectados por una plataforma de control y operaciones cada vez mayor.
Qué conviene observar después de la conferencia
Las próximas divulgaciones útiles serán menos cinematográficas que el vídeo de IROS. Hay que buscar pruebas repetidas, descripciones de tareas, tasas de intervención y evidencias de un segundo centro. También conviene distinguir entre una política que completa una ruta y otra que puede recuperarse cuando se mueve un objeto, una persona entra en el camino o una pinza pierde su sujeción.
En el caso de Digit, los despliegues de clientes anunciados por la empresa, las divulgaciones sobre horas de operación y los planes para v5 ofrecen una base frente a la cual contrastar nuevas afirmaciones. Si una demostración nueva se presenta como una capacidad de v4, debería compararse con la carga útil, la autonomía, el efector final y el contexto de seguridad de v4. Si se refiere a v5, los lectores deberían distinguir una especificación prevista de un resultado de campo observado de forma independiente.
Para el sector humanoide en general, se aplica la misma lista de comprobación:
- ¿La tarea tiene suficiente valor para justificar un cuerpo complejo?
- ¿El robot trabaja a una velocidad relevante para el operador?
- ¿Puede reconocer y contener los fallos?
- ¿Qué proporción del tiempo requiere una persona?
- ¿Qué sucede cuando cambia el entorno?
- ¿Se han verificado los controles de seguridad para el lugar previsto?
- ¿Las afirmaciones se basan en una flota o en una ejecución cuidadosamente seleccionada?
La demostración de Digit en la sala de IROS merece cobertura porque muestra que la industria está atacando un cuello de botella real: la conexión entre llegar a una tarea y completarla físicamente. Debe presentarse como una señal temprana de capacidad integrada, no como una prueba de autonomía general.
Esa distinción es el consejo práctico para cualquiera que evalúe robots humanoides ahora. Hay que pedir la definición de la tarea, el denominador, la política de intervención y las cifras de recuperación. Un robot que puede completar una maniobra difícil una vez puede ser un sistema de investigación impresionante. Un robot que puede terminar un trabajo útil repetidamente, explicar cuándo no puede hacerlo y mantenerse seguro mientras comparte el espacio con personas es un sistema desplegable. La distancia entre ambas descripciones es el lugar donde se decidirá el negocio de la robótica.
Fuentes
La afirmación sobre la ejecución de manipulación móvil de extremo a extremo en el primer intento procede del informe de Robotics Daily titulado “Paxton says end-to-end mobile manipulation ran first try on Digit v4”, publicado en roboticsweekly.news: https://roboticsweekly.news/stories/chris-paxton-digit-v4-end-to-end-mobile-manipulation-iros
El contexto del programa y la participación institucional en IROS 2026 se ha tomado de “GT @ IROS 2026”, del Georgia Tech Institute for Robotics and Intelligent Machines: https://robotics.gatech.edu/gt-iros-2026
El contexto sobre el taller de percepción, planificación y control para manipulación móvil e inteligencia encarnada procede de MOMA.v5 Workshop: https://mobile-manipulation.net/events/moma-iros26/
Las cifras y descripciones comerciales de Digit v4 proceden de la presentación para inversores de Agility presentada ante la U.S. Securities and Exchange Commission: https://www.sec.gov/Archives/edgar/data/2074973/000121390026071287/ea029548401ex99-2.htm
La información sobre Digit 5 y otras comunicaciones de la empresa procede de los comunicados de prensa de Agility Robotics: https://www.agilityrobotics.com/press-releases
La discusión sectorial adicional se ha contrastado con “Robotics Weekly, September 27, 2026”: https://roboticsweekly.news/issues/2026-09-27
Comments
Sign in to comment.
No comments yet.