Tecnologia

Profundice en las diferencias entre la conducción autónoma total de Tesla y el controlador Waymo.

[ad_1]


Apoye el trabajo de CleanTechnica a través de Suscripción a subpila o en la barra–


En un artículo anterior sobre Waymo se anunció que ingresaría a cuatro ciudades más: Filadelfia, Pittsburgh, Baltimore y St. Louis. Uno de nuestros lectores dejó algunos comentarios excelentes: Ahora, permítanme decirles que no mencioné a Tesla en el artículo, pero ha habido un debate de larga data entre los enfoques de las dos compañías. ¿Y qué enfoque es mejor? El lector “Matthew2312” hace un gran trabajo al explicar algunas de las principales diferencias entre los dos enfoques, además de “cámara versus lidar + cámara”. A continuación se presentan sus dos opiniones. —Zack Shahan


La gente no entiende los desafíos del escalamiento. Creen que se trata del vehículo. Pero esa es la parte más fácil. La infraestructura de capacitación TPU patentada de Google es el principal motor tecnológico detrás de la explosiva escalabilidad de Waymo.

Waymo ha adoptado el manual de formación Gemini para la conducción autónoma. Utilizando las cápsulas de TPU de Google utilizadas para entrenar a Gemini, Waymo cambió al único “modelo de la Fundación Waymo” a gran escala; este modelo es “genérico”, en lugar de entrenar el modelo específicamente para Phoenix y luego volver a entrenarlo durante meses para comprender Miami. Entrenaron un modelo grande con todos sus datos. Waymo ha construido todo su conjunto de capacitación en JAX, el mismo marco de aprendizaje automático que Google DeepMind creó para construir Gemini. Debido a que los dos comparten el ecosistema JAX/TPU, las optimizaciones realizadas para Gemini se pueden migrar rápidamente al controlador Waymo.

Ventajas de la simulación

Escalar una nueva ciudad depende en gran medida de la simulación. Una versión interna y mucho más compleja del simulador Waymax disponible públicamente. Funciona con la infraestructura Gemini TPU, lo que les permite “monitorear” ciudades como Houston por seguridad. antes de enviar una gran flota allí y reducir los tiempos de pruebas físicas a meses. Aquí también están en juego otras cosas, como una roja “Júpiter” de conmutadores ópticos que permite que millas de chips se comuniquen entre sí increíblemente rápido.

Tesla adoptó un enfoque completamente diferente al de Waymo. Google ahora utiliza Motion LM como una característica central de su Foundation Model. En lugar de predecir la física (coordenadas x, y, z), este modelo trata la conducción como un lenguaje. [As an aside, Google’s next step is a model design called EMMA (End-to-End Multimodal Model for Autonomous Driving) which is still experimental.]

Lo que todos pueden ver en los comentarios básicos anteriores es que los enfoques de Tesla y Google son completamente diferentes. No se trata de “LiDAR vs Vision”, sino de un enfoque profundo y profundamente diferente de cómo la IA maneja los problemas de conducción autónoma. Los sistemas Motion LM versus NN Reflex no son solo manzanas versus peras. Pero es una manzana y una pelota de béisbol. El fallo del Dojo ralentizó significativamente las capacidades de simulación de Tesla. (Ahora ha sido reemplazada por NVIDIA). Mientras tanto, el cambio a un modelo basado en JAX y Waymax sirvió como un gran catalizador para Waymo hace dos años. La rápida expansión que estamos viendo hoy es inimaginable.


Por interés, le pedí a Gemini que explicara la diferencia entre los enfoques Motion LM y NN. Esto es lo que decía:

Has dado en el clavo sobre las diferencias filosóficas. Por eso el punto Tu “lenguaje y reflexión” es, por tanto, un diferenciador importante:

A. Enfoque “reflejo” (Tesla)
* Filosofía: “Conducir es un proceso biológico de visión y reacción”.
* Mecanismo: Neural Net (de extremo a extremo) toma cuadros de video y los géneros continuamente. (Ángulo de dirección: 14,2°)
* Debilidades: Probables y difíciles de depurar. Si el coche choca contra un obstáculo No puedes preguntar “¿por qué?” La respuesta es “las neuronas se activan de esa manera”. Se necesita mucha información para corregir un error, como entrenar a un perro mediante la repetición.

B. Enfoque de “lenguaje” (Waymo / MotionLM)
* Filosofía: “Conducir es una negociación social”.
* Mecánica: El mundo se divide en “tokens” (discursos).
*Información: “Peatón en la acera”
* predicción MotionLM: “Rendimiento” (no ‘12% más lento’ sino un concepto diferente de rendimiento)
* Puntos fuertes: Permite el razonamiento. El coche puede efectivamente “hablar consigo mismo” sobre la escena del crimen. “Si yo Otros autos lo harán – Esto hace que el sistema sea más robusto en situaciones complejas con múltiples agentes (como una parada caótica de 4 vías) donde la “respuesta” no es suficiente; se necesita “intención”.


Cosas interesantes, buenos puntos, lo que significa todo esto para la expansión autónoma de estas dos empresas, ya veremos….


Regístrese para la Subpila semanal de CleanTechnica para el análisis en profundidad y el resumen de alto nivel de Zach y Scott. Regístrese para Nuestro boletín diario y Síguenos en Google Noticias–


anuncio


¿Hay consejos para CleanTechnica o no? ¿Quieres anunciarte? ¿Quieres recomendar un invitado para nuestro podcast CleanTech Talk? Contáctenos aquí


Suscríbete para recibir nuestro boletín diario de 15 nuevas historias sobre tecnologías limpias al día– o solicitar membresía Nuestros destacados semanales Si cada día es demasiado frecuente



CleanTechnica Utilice enlaces de afiliados. Consulta nuestra política aquí.

Política de comentarios CleanTechnica


[ad_2]