Google está actualizando su chatbot Gemini con un nuevo modelo de imagen de IA que brinda a los usuarios un control más fino sobre la edición de fotos, un paso destinado a ponerse al día con las populares herramientas de imagen de Openi y atraer a los usuarios de ChatGPT.
La actualización, llamada Gemini 2.5 Flash Image, se despliega a partir del martes a todos los usuarios en la aplicación Gemini, así como a los desarrolladores a través de las plataformas Gemini API, Google AI Studio y Vertex AI.
El nuevo modelo de imagen de IA de Gemini está diseñado para hacer ediciones más precisas a las imágenes, basadas en las solicitudes de lenguaje natural de los usuarios, al tiempo que preservan la consistencia de caras, animales y otros detalles, algo con lo que la mayoría de las herramientas rivales luchan. Por ejemplo, solicite a ChatGpt o el Grok de Xai que cambien el color de la camisa de alguien en una foto, y el resultado puede incluir una cara distorsionada o un fondo alterado.

La nueva herramienta de Google ya ha llamado la atención. En las últimas semanas, los usuarios de las redes sociales se entusiasmaron con un impresionante editor de imágenes de IA en la plataforma de evaluación de crowdsourced, Lmarena. El modelo apareció a los usuarios de forma anónima bajo el seudónimo «Nano-Banana».
Google dice que está detrás del modelo (si ya no era obvio de todas las sugerencias relacionadas con el plátano), que es realmente la capacidad de imagen nativa dentro de su modelo de IA Flash Gemini 2.5 insignia. Google dice que el modelo de imagen es de última generación en Lmarena y otros puntos de referencia.

«Realmente estamos impulsando la calidad visual hacia adelante, así como la capacidad del modelo para seguir las instrucciones», dijo Nicole Brichtova, un líder de productos en los modelos de generación visual en Google Deepmind, en una entrevista con TechCrunch.
«Esta actualización hace un trabajo mucho mejor que hace las ediciones de manera más perfecta, y las salidas del modelo son utilizables para lo que quieras usarlos», dijo Brichtova.
Los modelos de imagen de IA se han convertido en un campo de batalla crítico para Big Tech. Cuando Operai lanzó el generador de imágenes nativo de GPT-4O en marzo, impulsó el uso de Chatgpt por las nubes gracias a un frenesí de memes de estudio de estudio de estudio de IA que, según el CEO de OpenAi, Sam Altman, dejaron la GPU de la compañía «derretido».
Para mantenerse al día con Openai y Google, Meta anunció la semana pasada que licenciaría modelos de imagen AI de la startup MidJourney. Mientras tanto, los laboratorios alemanes de bosque de unicornio alemanes respaldados por A16Z continúan dominando los puntos de referencia con sus modelos de imagen Flux AI.
Quizás el impresionante editor de imágenes de IA de Gemini pueda ayudar a Google a cerrar su brecha de usuario con OpenAI. ChatGPT ahora registra a más de 700 millones de usuarios semanales. En la llamada de ganancias de Google en julio, el CEO del gigante tecnológico, Sundar Pichai, reveló que Géminis tenía 450 millones mensual Usuarios: lo que implica que los usuarios semanales son aún más bajos.
Brichtova dice que Google diseñó específicamente el modelo de imagen con casos de uso del consumidor en mente, como ayudar a los usuarios a visualizar sus proyectos de hogar y jardín. El modelo también tiene un mejor «conocimiento mundial» y puede combinar múltiples referencias en un solo mensaje; Por ejemplo, fusionar una imagen de un sofá, una foto de la sala de estar y una paleta de colores en un renderizado cohesivo.

Si bien el nuevo generador de imágenes AI de Gemini facilita a los usuarios hacer y editar imágenes realistas, la compañía tiene salvaguardas que limitan lo que los usuarios pueden crear. Google ha tenido problemas con las salvaguardas del generador de imágenes AI en el pasado. En un momento, la compañía se disculpó por Gemini que generó imágenes de personas históricamente inexactas, y retiró el generador de imágenes AI por completo.
Ahora, Google siente que ha logrado un mejor equilibrio.
«Queremos dar a los usuarios un control creativo para que puedan obtener de los modelos lo que quieren», dijo Brichtova. «Pero no es como si nada vaya».
La sección de IA generativa de los términos de servicio de Google prohíbe a los usuarios generar «imágenes íntimas no consensuadas». Esos mismos tipos de salvaguardas no parecen existir para Grok, lo que permitió a los usuarios crear imágenes explícitas generadas por IA que se asemejan a celebridades, como Taylor Swift.
Para abordar el aumento de las imágenes de Deepfake, lo que puede dificultar que los usuarios discernan lo que es real en línea, Brichtova dice que Google aplica marcas de agua visuales a las imágenes generadas por IA, así como a los identificadores en sus metadatos. Sin embargo, alguien que pasa más allá de una imagen en las redes sociales puede no buscar tales identificadores.
