Producto · 26 de agosto de 2026

También publicado en Português (Brasil)

Generalist lanza GEN-1.5: un modelo de IA física que aprende nuevas tareas con una sola demostración

a close up of a cell phone on a table
Lana Codes / Unsplash

Generalist presentó su nuevo modelo GEN-1.5, que permite a un robot aprender tareas desconocidas tras observar una sola demostración de entre 3 y 12 segundos. Según la empresa, el sistema no requiere ajustes adicionales ni reentrenamiento para adaptarse a cambios en la posición de los objetos o herramientas. En pruebas con 10 tareas nuevas, el modelo logró una tasa de éxito del 59% con una sola demostración, y del 83% tras recibir entre 1 y 5 minutos de datos adicionales y ajustar los parámetros entre 1 y 10 veces.

El avance se basa en la capacidad del modelo para generalizar comportamientos aprendidos previamente. En demostraciones, los investigadores reemplazaron herramientas como cepillos o cucharones por objetos no entrenados, como plátanos o cajas, y el robot adaptó su acción sin instrucciones adicionales. Ted Xiao, exinvestigador de Google DeepMind, comparó esta capacidad con la búsqueda del "Santo Grial" en robótica: un sistema que aprenda de una sola demostración, similar a cómo los modelos de lenguaje como GPT-3 sorprendieron al resolver tareas con pocos ejemplos.

Generalist destacó que GEN-1.5 no solo replica movimientos, sino que demuestra una forma de inteligencia emergente. A diferencia de los robots tradicionales, que fallan ante cambios mínimos en el entorno, este modelo muestra flexibilidad al ajustar su enfoque según obstáculos imprevistos, como mover un papel que cubre un recipiente o usar ambas manos para abrir un frasco. La empresa atribuye este comportamiento a la abundancia de datos de operaciones humanas reales, que incluyen errores y correcciones, permitiendo al modelo aprender patrones de recuperación.

El modelo procesa información de múltiples fuentes, como vídeo, sensores y lenguaje, en una ventana de contexto de 30 segundos. Genera trayectorias de movimiento a 100 Hz y ajusta su acción en tiempo real. Generalist no reveló detalles técnicos como el tamaño exacto del modelo o la proporción de parámetros preentrenados, pero confirmó que GEN-1.5 se desarrolló durante más de ocho meses de entrenamiento continuo, partiendo de GEN-1.

Generalist, fundada en 2024 por investigadores de Google DeepMind, Boston Dynamics y OpenAI, se enfoca en entrenar una inteligencia física escalable para distintos tipos de robots, en lugar de desarrollar un modelo específico para un hardware concreto. La empresa ha acumulado más de 500.000 horas de datos de operaciones reales, recolectados mediante dispositivos portátiles de bajo costo que simulan las acciones de un robot. Según la compañía, su sistema puede procesar en un día el equivalente a 6,85 años de experiencia humana en operaciones.

El enfoque de Generalist contrasta con el de otras empresas del sector, que suelen basarse en datos sintéticos o simulaciones. La startup argumenta que los modelos de lenguaje y visión existentes no son suficientes para la robótica, ya que requieren una comprensión profunda de las leyes físicas. Por ello, GEN-1.5 se entrenó principalmente con datos de operaciones reales, sin depender de modelos preexistentes como Gemini o GPT.

El avance ha generado interés en el sector inversor. En junio de 2025, Generalist cerró una ronda de financiación de 400 millones de dólares, elevando su valoración a 2.000 millones de dólares. Entre los inversores se incluyen Radical Ventures, NVIDIA, Bezos Expeditions y 8VC. Los fondos destacaron el potencial de la "mano de datos" de Generalist y su capacidad para crear un ciclo de retroalimentación entre datos y modelos.

Aunque los resultados son prometedores, persisten incertidumbres. Las pruebas actuales se limitan a tareas simples, y la efectividad del modelo en entornos complejos o con objetos altamente deformables sigue sin verificarse. Además, Generalist no ha publicado detalles técnicos suficientes para que terceros repliquen los resultados. Jim Fan, responsable de robótica en NVIDIA, advirtió que el éxito de una sola demostración depende de cuán cercana sea la tarea a los datos de entrenamiento previos.

Según GeekPark, el lanzamiento de GEN-1.5 marca un hito en la búsqueda de una IA física escalable, comparable al impacto inicial de GPT-3 en el campo del lenguaje. La capacidad de reducir drásticamente el tiempo y los recursos necesarios para enseñar nuevas tareas a los robots podría transformar la industria, aunque aún queda camino por recorrer antes de lograr implementaciones comerciales robustas.