Google presenta Gemini Robotics ER 2, su modelo de “razonamiento incorporado” para robótica más avanzado hasta la fecha, diseñado para ayudar a los robots a comprender mejor el mundo físico, interactuar con personas y planificar y ejecutar tareas complejas de varios pasos en tiempo real.
Estas son algunas de las principales novedades:
Comprensión de tareas en tiempo real: ER 2 utiliza video continuo para seguir el progreso de una tarea mientras ocurre, identificar con precisión cuándo se completa y ajustar o volver a intentar pasos específicos si algo sale mal.
Del razonamiento a la acción: el modelo puede coordinar modelos de acción y APIs de robótica mientras determina qué hacer a continuación, lo que permite a los robots completar tareas más largas y de varios pasos con menos pausas.
Una mejor comprensión del mundo físico: ER 2 mejora la capacidad de los robots para detectar en tiempo real si una acción tuvo éxito o falló, interpretar distintos tipos de instrumentos y responder preguntas sobre lo que ocurre a su alrededor.
Interacciones más seguras con las personas: ER 2 mejora la percepción espacial y el seguimiento de instrucciones de seguridad, permitiendo que los robots detecten cuando una persona está cerca, se detengan cuando sea necesario y retomen la tarea una vez que el área esté despejada.
Gemini Robotics ER 2 ya está disponible para desarrolladores a través de la API de Gemini y Google AI Studio.