Teleoperación en videos de robots: cómo detectarla
Tabla de contenido

Teleoperación en videos de robots: cómo detectarla

La teleoperación en videos de robots es común y casi nunca se declara. Ocho señales de que hay un humano manejando y la explicación inocente de cada una.

En 2025, Unitree organizó lo que presentó como el primer torneo de boxeo entre robots humanoides. Cuatro robots G1 en un ring pequeño. La parte honesta, que el registro publicado dice sin rodeos, es que el evento combinaba control remoto con secuencias autónomas cortas. Esa mezcla es la norma, no la excepción. La teleoperación en videos de robots (una persona manejando la máquina desde fuera de cámara) está presente en muchísimo material que se lee como autónomo, y aprender a detectarla es la habilidad de alfabetización mediática más útil que un niño puede desarrollar hoy sobre robots.

Puntos clave

  • La teleoperación no es trampa. Es cómo se recolectan datos de entrenamiento y cómo los despliegues tempranos realmente completan tareas. El problema es no declararla, no la práctica.
  • La señal más fuerte es negativa: un video que no dice qué nivel de autonomía está mostrando. Los grupos de investigación suelen decirlo. Los videos promocionales, con frecuencia no.
  • La firma del movimiento es la mejor señal visual. El movimiento manejado por humano titubea, busca, varía de velocidad y corrige con retraso. El autónomo suele ser muy suave o inquietantemente consistente en sus tiempos.
  • Cada señal tiene una explicación inocente, y por eso se pesan varias en lugar de apoyarse en una.
  • Charlie Kemp, cofundador y director de tecnología de Hello Robot, resumió el problema en septiembre de 2026: hay una diferencia enorme entre un video de demostración y un robot siendo productivo en el mundo real.

Qué es la teleoperación y por qué está en todas partes

La teleoperación es el control remoto de un robot por un operador humano, normalmente a través de un video en vivo y alguna forma de entrada de movimiento: un joystick, un guante, un par de controles rastreados o un traje de captura de movimiento.

Existe en la robótica por tres buenas razones.

Recolección de datos. La manipulación basada en aprendizaje necesita demostraciones. La forma más eficiente de conseguir demostraciones de una tarea en un robot específico es que una persona teleopere ese robot haciéndola. Cada sesión teleoperada es dato de entrenamiento.

Completar la tarea hoy. Un robot desplegado que falla en una tarea desconocida es inútil para el cliente. Un robot desplegado donde un operador remoto toma el control cuando la autonomía falla es útil de inmediato, y mejora con el tiempo.

Seguridad. Un humano en el ciclo atrapa disparates que una política ejecutaría. Es un beneficio real, y viene con un costo real: un canal de control remoto en vivo es una superficie de ataque, como vemos en ciberseguridad en robots.

Así que la práctica es defendible. Lo que no es defendible es un video que deja a quien mira concluir que un robot es autónomo cuando no lo es. Y la presión económica va en una sola dirección: la autonomía es lo que sostiene una valuación.

Las ocho señales, con la explicación inocente de cada una

Una: titubeo antes del contacto. Un teleoperador frena cuando la pinza se acerca a un objeto, porque está juzgando profundidad desde una imagen plana. Las políticas autónomas suelen comprometerse a velocidad constante. Explicación inocente: algunos controladores autónomos frenan a propósito cerca del contacto para controlar fuerza.

Dos: la cabeza barre como un humano. Si la cabeza del robot gira con patrón humano (mira a la izquierda, a la derecha, de vuelta a la mano), probablemente alguien está mirando por ahí. La percepción autónoma no necesita centrar un objeto en el cuadro. Explicación inocente: la visión activa es una técnica real y algunos robots mueven cámaras para reducir oclusiones.

Tres: corrección con retraso. El robot se pasa, hace una pausa y corrige. Esa pausa es latencia de ida y vuelta más tiempo de reacción humano, típicamente unos cientos de milisegundos o más. Los ciclos de control autónomo corrigen en milisegundos, así que la corrección se ve continua y no escalonada. Explicación inocente: una tubería de percepción lenta produce un escalonado parecido.

Cuatro: tiempos inconsistentes entre repeticiones. Corre la misma tarea tres veces. Una política produce duraciones casi idénticas. Un humano produce variación. Es la señal más confiable que existe y la más fácil de probar, y por eso casi nunca aparece en material promocional. Explicación inocente: las políticas estocásticas y las posiciones variables de objetos también generan variación genuina.

Cinco: cortes en el momento difícil. El video corta justo en el agarre, o acelera durante la aproximación, o nunca muestra un plano amplio del cuarto completo. Explicación inocente: editar por duración es normal y por sí solo no prueba nada.

Seis: la tarea tiene una forma sospechosamente humana. Doblar una camisa con dos manos en un movimiento fluido es exactamente lo que produce un traje de captura de movimiento y es muy difícil de aprender de forma autónoma. Explicación inocente: el aprendizaje por imitación está diseñado justo para reproducir movimiento de forma humana, así que esta señal se va debilitando. El tema está en cómo un robot aprende a doblar ropa.

Siete: cero fallas, nunca. Los artículos académicos reportan tasas de éxito. Los videos promocionales reportan momentos destacados. Si un robot hace diez tareas desconocidas al hilo sin error, estás viendo la mejor toma de cada una, posiblemente con alguien manejando.

Ocho, y la más fuerte: nadie lo dijo. La ausencia de una afirmación de autonomía es la señal. Los laboratorios suelen declarar qué fue autónomo porque los revisores van a preguntar. Una empresa que es plenamente autónoma lo dice bien grande, porque es todo su activo. El silencio informa.

El análisis de Ackerman en IEEE Spectrum de septiembre de 2025 agrega un patrón útil para todo el género: los videos de demostración muestran a estos humanoides sobre todo quietos o moviéndose distancias cortas de forma repetitiva sobre pisos planos. El encuadre esconde tanto como la edición.

Cómo enseñarle esto a tu hijo

Es uno de los temas más divertidos de enseñar, porque el niño le toca ser el robot.

De 5 a 8 años

Tápale los ojos y que complete una tarea simple (poner un vaso en un estante) mientras tú das solo instrucciones verbales. Después cambien de rol. Va a descubrir de inmediato que las instrucciones llegan tarde, que la mano se pasa, y que es mucho más difícil que hacerlo uno mismo. Después vean cualquier video de robots juntos y pregúntale: “¿parece que alguien le está diciendo qué hacer?”. Va a tener una opinión, y va a estar basada en experiencia.

De 9 a 12 años

El mismo ejercicio, pero ahora cuentas hasta dos antes de dar cada instrucción. El patrón de pasarse, pausar y corregir aparece de inmediato y es obvio incluso para un niño pequeño. Ponle nombre: latencia. Después muéstrale un video de robots y que cace el patrón. Una vez visto, es difícil dejar de verlo.

De 13 en adelante

Armen una rúbrica con las ocho señales de arriba. Que califique tres videos (uno de un laboratorio universitario, uno de una empresa de robótica y uno de una cuenta de redes sin atribución) y escriba un párrafo de cada uno. La frase final obligatoria: “para estar seguro, necesitaría saber ___”. Esa frase es el verdadero entregable. Saber qué te haría falta para estar seguro es toda la habilidad.

La pregunta que debes hacer: “¿Qué podría haber mostrado la persona que hizo este video para probar que el robot estaba solo?”

Las señales, y qué resolvería cada una

SeñalQué sugiereLa explicación inocenteQué lo resolvería
Titubeo antes del contactoHumano juzgando profundidad en imagen planaFrenado a propósito para controlar fuerzaTres repeticiones con tiempos comparados
Barrido de cabeza con patrón humanoOperador mirando por el robotVisión activa reduciendo oclusionesUna tubería de percepción declarada
Pasarse, pausar, corregirLatencia de red más reacción humanaCiclo de percepción lentoLa frecuencia publicada del ciclo de control
Tiempos inconsistentes entre corridasUn humano haciéndolo cada vezPolítica estocástica, objetos en posiciones distintasDuraciones publicadas por intento
Cortes en el agarreEsconder fallas o un operadorEdición normal por duraciónUna toma continua sin editar
Movimiento fluido con dos manosUn traje de captura de movimientoEl aprendizaje por imitación ya funciona asíEl método de entrenamiento declarado
Cero fallas en muchas tareasSelección de la mejor tomaUn sistema genuinamente buenoUna tasa de éxito reportada
Ningún nivel de autonomía declaradoNadie quiso decirloDescuido en una publicación casualUna frase de quien publicó

Ten presente la columna del medio cada vez. La razón de mantener las explicaciones inocentes a la vista es que la meta es calibración, no cinismo: un niño que concluye que todos los videos de robots son falsos aprendió algo falso, y se va a equivocar en la otra dirección cuando algo sí funcione.

¿Y en América Latina?

Aquí hay un problema específico de la región que vale nombrar, porque cambia la táctica.

Casi todo el contenido de robots que llega a un niño en Bogotá, Lima, Santiago o Guadalajara llega por video corto en el celular, reeditado y vuelto a subir por una cuenta sin atribución, con narración en español agregada encima. Y ese proceso borra justamente la pieza de información que más importa: si el video original declaraba el nivel de autonomía, la declaración se perdió en el recorte. Lo que queda es el momento impactante, música y una voz afirmando cosas que el laboratorio nunca dijo.

Eso tiene dos consecuencias prácticas.

La primera es que la señal número ocho,“nadie lo dijo”, deja de ser útil tal cual, porque en un clip reeditado nunca lo dice nadie. La pregunta local tiene que cambiar a: ¿quién hizo el video original y dónde está? Si el clip no da el nombre del laboratorio o de la empresa, la primera tarea no es juzgar el robot: es encontrar la fuente. Y esa búsqueda, que termina en una página en inglés con un artículo adjunto, es por sí misma una habilidad valiosa. Buscar la fuente original es más transferible que cualquier señal visual.

La segunda es que buena parte de esas cuentas ahora generan narración y hasta imágenes con IA, y lo hacen para conseguir vistas con datos prepago en el celular. Los videos cortos y recortados son el formato del plan de datos barato, y es también el formato que más distorsiona. No es un problema moral de nadie: es cómo funciona la distribución. La regla de casa que sí funciona es sencilla y gratuita: después de cada video, “¿quién lo manejaba y cuántas tomas hubo?”, y si el clip no tiene fuente, buscarla juntos una vez. Con una sola búsqueda hecha en compañía, el hábito se instala.

Y vale cerrar con lo que no hay: la región no tiene una prensa especializada de robótica que haga esta verificación por ti. En Estados Unidos o Europa un padre puede apoyarse en IEEE Spectrum. Aquí la verificación es casera, y por eso enseñar el procedimiento vale más que enseñar la conclusión. El complemento está en el humano detrás del robot “autónomo” de casa.

Qué observar en los próximos 3 meses

  • Semana 4: Fíjate si alguna empresa de humanoides empieza a etiquetar videos con un nivel de autonomía, como la industria automotriz etiqueta los niveles de asistencia a la conducción. La primera que lo haga por voluntad propia estará haciendo una jugada de credibilidad que vale premiar.
  • Señales de alerta en el mes 2: El mismo material reapareciendo en varias publicaciones con música o textos distintos. Suele significar que hay una sola toma buena. También cualquier evento de combate o deporte robótico que no publique si los operadores pueden intervenir, vacío que marcamos en la liga de combate de robots.
  • Autoevaluación del mes 3: Vean un video y deja que tu hijo hable primero. Si su pregunta de apertura es sobre control y tomas en lugar de qué increíble está, la habilidad se transfirió, y se transfiere directo a video generado con IA, demostraciones de producto y promesas de publicidad.

Preguntas frecuentes

¿La teleoperación es deshonesta?

La práctica no. Es ingeniería estándar, es cómo se recolectan datos de entrenamiento y hace útiles los despliegues tempranos. Lo deshonesto es presentar material teleoperado de forma que invite a concluir que el robot es autónomo. Se arregla con una frase de declaración, que no cuesta nada.

¿Se puede estar seguro solo con el video?

Pocas veces. La prueba de consistencia de tiempos entre varias corridas se acerca, y una toma amplia continua sin editar ayuda mucho. Pero la certeza casi siempre requiere información de afuera del video: un nivel de autonomía declarado, una tasa de éxito publicada, o un tercero corriendo la prueba.

¿Los videos universitarios son más confiables?

En general sí, por una razón estructural y no moral: el trabajo académico pasa por revisión por pares, donde los revisores preguntan qué fue autónomo y cuál fue la tasa de éxito. Un video pegado a un artículo tiene una afirmación comprobable detrás.

¿Cuánta latencia agrega la teleoperación?

Suficiente para verse. Un enlace local con cable puede ser bajo, pero cualquier cosa que pase por una conexión de internet de consumo agrega retardo de ida y vuelta, y el tiempo de reacción humano se suma encima. El resultado visible es el patrón de pasarse, pausar y corregir.

¿Esto también aplica al video generado con IA?

El hábito se transfiere directo. La pregunta de fondo es la misma: qué me está invitando a creer este material, y qué evidencia de afuera lo confirmaría. Un niño que practicó eso con videos de robots está mejor equipado para medios sintéticos que uno al que solo le advirtieron.

¿La teleoperación va a desaparecer?

En parte, despacio y de forma desigual. Mientras las políticas autónomas mejoran, baja la proporción de tareas que necesitan un humano. Pero la casa es el ambiente más difícil, y el reporteo de IEEE Spectrum sugiere que la vara de confiabilidad del trabajo industrial (cerca de 99,99 por ciento de disponibilidad) sigue sin cumplirse de forma general. Espera autonomía mixta por años.


Sobre el autor

Ricky Flores es el fundador de HiWave Makers e ingeniero eléctrico con más de 15 años de experiencia desarrollando tecnología de consumo en Apple, Samsung y Texas Instruments. Escribe sobre cómo los niños aprenden a construir, pensar y crear en un mundo saturado de tecnología. Lee más en hiwavemakers.com.


Fuentes

  1. Robots Guide. (28 de septiembre de 2026). “A Day in the Life of a Roboticist: Charlie Kemp.” https://robotsguide.com/learn/a-day-in-the-life-of-a-roboticist-charlie-kemp
  2. Ackerman, E. (11 de septiembre de 2025). “Reality Is Ruining the Humanoid Robot Hype.” IEEE Spectrum. https://spectrum.ieee.org/humanoid-robot-scaling
  3. Colaboradores de Wikipedia. “Humanoid robot” (secciones sobre competencias humanoides, el torneo de boxeo de Unitree de 2025 y URKL de EngineAI). https://en.wikipedia.org/wiki/Humanoid_robot
  4. National Institute of Standards and Technology. “Robotic Grasping and Manipulation for Assembly.” Intelligent Systems Division. https://www.nist.gov/el/intelligent-systems-division-73500/robotic-grasping-and-manipulation-assembly
  5. Calli, B., Walsman, A., Singh, A., Srinivasa, S., Abbeel, P. y Dollar, A. M. (2015). “Benchmarking in Manipulation Research: The YCB Object and Model Set and Benchmarking Protocols.” IEEE Robotics & Automation Magazine, 22, 36–52. https://arxiv.org/abs/1502.03143
  6. Ackerman, E. (15 de septiembre de 2026). “Digit 5 May Be the First Humanoid Robot Worker That’s Truly Safe.” IEEE Spectrum. https://spectrum.ieee.org/humanoid-robot-safety
  7. Robey, A., Ravichandran, Z., Kumar, V., Hassani, H. y Pappas, G. J. (2024). “Jailbreaking LLM-Controlled Robots.” https://arxiv.org/abs/2410.13691
Ricky Flores
Escrito por Ricky Flores

Fundador de HiWave Makers e ingeniero eléctrico con más de 15 años trabajando en proyectos con Apple, Samsung, Texas Instruments y otras empresas Fortune 500. Escribe sobre cómo los niños aprenden a construir, pensar y crear en un mundo impulsado por la tecnología.