Fuga de Google: Gemini 4 supuestamente tiene dificultades con parte de la programación. La empresa lo niega

  • Parte de los empleados de Google supuestamente ve una discrepancia entre los resultados de Gemini 4 en las pruebas y en el trabajo
  • Las objeciones se refieren a algunas tareas de programación; Google rechaza la evaluación
  • Gemini 4 Argon también aumenta el límite de salida hasta 1 millón de tokens

Sdílejte:
Jakub Kárník
Jakub Kárník
2. 10. 2026 18:00
Ilustrační náhled: Gemini 4 reportedly 'struggles' despite benchmark scores, some say

Una puntuación alta en un benchmark y un asistente de programación fiable no tienen por qué ser lo mismo. Precisamente tal discrepancia sugiere una filtración de evaluaciones internas del nuevo Gemini 4, según informa Bloomberg. Algunos empleados de Google, según el informe, se encontraron con tareas de programación en las que el modelo no se desempeña tan bien como sus resultados en las pruebas sugerirían. Google ha refutado esta evaluación.

En las pruebas, por delante de la competencia; dentro de Google, sin consenso

Durante la presentación de Gemini 4 Argon, Google mostró resultados en los que la novedad superaba a la competencia en varias áreas clave, incluyendo GPT-6 Astra de OpenAI. Sin embargo, las evaluaciones filtradas muestran una visión dividida dentro de la empresa. Uno de los empleados habla de un amplio consenso de que Gemini pertenece a la vanguardia tecnológica. Otros temen que siga rezagándose respecto a los modelos de Anthropic y OpenAI.

Para aquellos interesados en un asistente de escritura de código, esta es una disputa más significativa que la clasificación en sí. La puntuación resultante puede facilitar una primera orientación, pero por sí misma no dice qué tan bien el modelo manejará su tarea específica. Sin embargo, ni siquiera las diferentes opiniones de los empleados son suficientes para concluir que el nuevo Gemini es una opción generalmente más débil para la programación.

Una salida más larga también tiene un precio concreto

Además del debate sobre la calidad, Argon trae un cambio concreto: el límite de salida generada aumenta hasta 1 millón de tokens. Este es el espacio para el contenido que el modelo crea. Google también destaca las capacidades de la novedad en defensa cibernética.

Un límite superior más alto puede ser útil para salidas extensas donde la longitud es un problema. Sin embargo, por sí solo no resuelve la corrección del código generado, que es el centro de la disputa actual.

¿En qué tareas de programación cree que la IA falla con mayor frecuencia?

Fuentes: 9to5google.com

Sobre el autor

Jakub Kárník

Jakub je znám svou nekonečnou zvědavostí a vášní pro nejnovější technologie. Jeho láska k mobilním telefonům začala s iPhonem 3G, ale dnes se spoléhá na… Más sobre el autor

Jakub Kárník
Sdílejte: