Bloomberg — Mientras Google, de Alphabet Inc. (GOOGL), comenzó a desplegar Gemini 4 Argon, su esperado modelo insignia de inteligencia artificial, pero la compañía enfrenta dudas internas sobre su desempeño en áreas clave, como la programación.
Google presentó el modelo el miércoles a un pequeño grupo de socios de confianza en ciberseguridad y anunció que ampliará el acceso tras realizar pruebas adicionales, comenzando con los suscriptores de pago. La compañía afirmó que Gemini 4 obtuvo puntuaciones destacadas en varias pruebas de referencia, superando incluso al modelo Astra de OpenAI en una prueba que mide las habilidades de seguridad.
Ver más: Googlebook: características y precio de la nueva PC de Google que busca competir con Apple
Sin embargo, algunos expertos afirman que esas métricas no reflejan la realidad completa. Si bien Gemini 4 ha tenido un buen desempeño en las pruebas comparativas más utilizadas para evaluar la eficacia de los modelos, su rendimiento disminuye cuando los empleados lo utilizan en la práctica, según personas con acceso directo al proyecto. El modelo tiene dificultades para gestionar ciertas tareas de codificación, indicaron estas personas, quienes solicitaron el anonimato para tratar un asunto interno.
Las acciones de Alphabet subieron cerca de un 1,7% en las operaciones posteriores al cierre tras el anuncio de la compañía. Al final de la sesión regular, redujeron las ganancias iniciales del miércoles después de que Bloomberg informara sobre el escepticismo de los empleados respecto al modelo.
Alphabet Inc
Cómo Gemini 4 busca recuperar terreno frente a OpenAI y Anthropic
Google se ha esforzado recientemente por desarrollar modelos que puedan competir con OpenAI y Anthropic PBC. La compañía tenía previsto lanzar una versión diferente en junio, denominada Gemini 3.5 Pro, pero abandonó el proyecto, según informaron fuentes cercanas.
Google afirmó que sería inexacto decir que Gemini 4 tiene un rendimiento inferior en áreas como la programación. La compañía remitió a Bloomberg a los comentarios realizados la semana pasada por Koray Kavukcuoglu, director de Google DeepMind, quien se mostró satisfecho con el rendimiento del modelo.
“Tengo la máxima confianza en el equipo”, declaró Kavukcuoglu en una conferencia organizada por el sitio web de noticias tecnológicas The Information. “Para mí, es una certeza que siempre estaremos a la vanguardia”.
En Google existe un amplio abanico de opiniones. Algunos empleados creen que los modelos Fable de Anthropic y Astra de OpenAI mejoran a un ritmo mayor que Gemini. Consideran que Gemini 4, incluso en su mejor versión, seguirá estando por detrás de esos modelos en algunos aspectos. Otros empleados, en cambio, creen que la próxima versión ya ha alcanzado el nivel de los principales laboratorios de IA.
Un empleado de Google familiarizado con el desarrollo de modelos afirmó que existe un “amplio consenso” a nivel interno en la empresa en cuanto a que Gemini 4 se encuentra a la vanguardia. Esta persona señaló que la empresa había llevado a cabo rigurosas pruebas de los modelos y negó que estos tuvieran dificultades con tareas de programación complejas y propias del mundo real.
Google necesita urgentemente que Gemini 4 tenga éxito. Las versiones de este modelo sustentan casi todos los productos que comercializa la empresa, desde las respuestas de IA que aparecen en los resultados de Búsqueda —la principal fuente de ingresos de Google— hasta Maps, Gmail y Chrome. Cada uno de estos productos cuenta con más de mil millones de usuarios, una ventaja de distribución de la que carecen algunos de los competidores de la empresa.
Ver más: Google se suma a OpenAI, Anthropic y Meta al revelar hackeos de sistemas de IA
Pero OpenAI y Anthropic están dejando de vender modelos para centrarse en el desarrollo de sus propios productos, incluyendo agentes de programación. Si no logran ofrecer un modelo de vanguardia, los competidores de Google tendrán más tiempo para convencer a consumidores, desarrolladores y empresas de que el futuro de las búsquedas y el software debería desarrollarse en sus plataformas.
En respuesta a las preguntas de Bloomberg, Google afirmó que, aunque su último modelo Pro se lanzó en febrero, la empresa ha experimentado desde entonces un crecimiento en sus productos de IA, entre los que se incluyen la versión empresarial de Gemini, así como su aplicación de chatbot para consumidores y el Modo IA en la Búsqueda de Google, habiendo superado los mil millones de usuarios los dos últimos.
¿Qué pasó con Gemini 3.5 Pro de Google?
En noviembre pasado, Google presentó Gemini 3, un modelo muy bien recibido que se consideró un punto de inflexión en los esfuerzos de la compañía por mantenerse al día con OpenAI y Anthropic. En mayo, durante su conferencia I/O, Google anunció una nueva versión, Gemini 3.5 Pro, y se comprometió a lanzarla al mes siguiente. Sin embargo, ese plazo no se cumplió y, según fuentes cercanas al asunto, la compañía ha abandonado el desarrollo de la versión 3.5 Pro.
Además de obstaculizar las ambiciones de Google en el campo de la IA, es probable que la decisión le haya costado caro a la compañía en tiempo y dinero. Según Mandeep Singh, analista de Bloomberg Intelligence, el entrenamiento necesario para desarrollar un modelo de este tipo puede costar hasta 400 millones de dólares. El uso de investigadores de IA altamente remunerados podría incrementar aún más el precio.
Ver más: OpenAI trabaja con Anthropic y Google DeepMind para abordar los riesgos de seguridad de la IA
Ahora Google se enfrenta a diversos desafíos con Gemini 4. Sus capacidades de codificación son irregulares, según personas familiarizadas con las evaluaciones internas del modelo. Gemini no es particularmente hábil en el diseño de interfaz, que define la apariencia y la experiencia de usuario de las aplicaciones y los sitios web, comentó una fuente. Esto representa un revés potencialmente grave, ya que Google ha tenido dificultades para competir en el mercado altamente competitivo de herramientas de codificación de IA.
Además, según una persona familiarizada con su desarrollo, se trata de un modelo muy grande. Por lo general, los modelos grandes son costosos de mantener, lo que podría ejercer presión sobre los márgenes de Google.
¿Por qué persisten dudas internas sobre Gemini 4?
Según los expertos, Google podría estar sufriendo la tendencia del sector a centrarse en los benchmarks, un fenómeno conocido como “benchmaxxing”, en el que los ingenieros se concentran más en obtener una buena puntuación que en crear un producto que funcione correctamente. Los laboratorios de IA suelen actuar así porque los clientes a menudo juzgan los modelos por sus puntuaciones en los benchmarks. Gemini 4 parece verse afectado por este proceso, según dos personas familiarizadas con el modelo.
Edwin Chen, fundador de la startup de IA Surge AI, afirmó que basarse en puntos de referencia puede llevar a los laboratorios a centrarse en la creación de modelos que escriban código en un lenguaje específico, en lugar de crear aplicaciones fáciles de usar o bien diseñadas.
“Una analogía sería: ‘Sí, mi hijo sacó una puntuación excelente en el SAT’, pero el SAT no se traduce en un desempeño en el mundo real”, dijo Chen. “Es un problema increíblemente pernicioso”.
Según una persona familiarizada con el tema, el modelo Géminis 4 posee puntos fuertes, destacando su capacidad para interpretar información más allá del texto, como la extracción de metadatos de vídeo. Asimismo, resaltó su seguridad, su ciberseguridad y su habilidad para comunicarse de forma clara y natural.
Ver más: Startup de IA busca arrebatar a Google los datos de Spirit con una oferta de US$12,5 millones
La frustración dentro de Google es palpable. Los investigadores entrevistados para un artículo anterior de Bloomberg culparon a una burocracia desmesurada que intenta integrar la tecnología en prácticamente todo lo que Google produce, y dijeron que los cambios en los mandatos y las prioridades han dificultado la tarea de centrarse en una estrategia coherente.
Mientras tanto, una oleada de destacados investigadores de IA ha abandonado Google, entre ellos el legendario ingeniero Jeff Dean, el premio Nobel John Jumper y Noam Shazeer, quien contribuyó a inventar la tecnología que sustenta gran parte del auge de la IA. En agosto, Demis Hassabis, quien durante mucho tiempo lideró la investigación en IA de la compañía, asumió un nuevo cargo como presidente y cedió las operaciones diarias de DeepMind a Kavukcuoglu, un antiguo colaborador.
Google anunció el miércoles que Gemini 4 está diseñado para tareas largas y complejas en ingeniería de software, finanzas, derecho y ciberseguridad. Según Google, puede generar respuestas más extensas que su predecesor: hasta un millón de tokens, o aproximadamente 750 000 palabras, de una sola vez.
Mientras la empresa se esfuerza por ponerse al día, sus rivales siguen avanzando a pasos agigantados a pesar de los rumores de una ralentización en el desarrollo de algunos modelos de vanguardia tras una serie de incidentes en los que agentes de IA piratearon organizaciones externas . A principios de este mes, Meta Platforms Inc. (META) lanzó Muse, un agente de IA que, según afirma, puede realizar tareas cotidianas como comprar en línea y reservar citas. La aplicación rápidamente se posicionó en la cima de las listas de descargas.
--Con la colaboración de Ed Ludlow.
Lea más en Bloomberg.com













