Agora você pode enviar e editar fotos no Gemini.

Resumo:

  • Agora você pode enviar e editar fotos no Gemini gratuitamente. Esse recurso está sendo implementado gradualmente para todos os usuários, a partir de hoje.
  • Os usuários também podem criar e editar imagens de IA no Gemini por meio de prompts de texto conversacionais.
  • O Google confirma que todas as imagens geradas por IA no Gemini terão uma marca d'água visível e uma marca d'água digital SynthID invisível.

Por fim, o Google está introduzindo a capacidade de editar fotos no Gemini por meio de prompts de texto. Agora você pode enviar e editar fotos existentes no Gemini por meio de bate-papos de texto. Além disso, você pode criar imagens de IA com o Gemini e duplicá-las para modificar a imagem. O recurso de edição de fotos do Gemini está sendo implementado gradualmente para todos os usuários, a partir de hoje. Este novo recurso aprimora a experiência do usuário e fornece ferramentas criativas poderosas.

O Google foi o primeiro a oferecer edição nativa de imagens usando o modelo Gemini 2.0 Flash no AI Studio. Testei o modelo em fevereiro e fiquei surpreso com a facilidade de editar imagens de forma conversacional. Em resposta ao modelo nativo de geração de imagens do Google, a OpenAI também introduziu a edição e geração de imagens nativas no ChatGPT.

Isso levou à rápida disseminação da tendência Ghibli e aumentou o uso do ChatGPT. Agora, o Google trouxe recursos nativos de edição de imagens para seu aplicativo para o consumidor, o Gemini. Observe que você pode editar imagens tanto no aplicativo móvel Gemini quanto na web. Esse recurso torna o Gemini um forte concorrente no campo da IA ​​generativa.

Após comparar a edição de imagens nativa entre o ChatGPT e o Gemini , posso afirmar que o Gemini é muito superior na manutenção da consistência de personagens/cenas entre gerações. O ChatGPT altera a imagem geral após cada geração, enquanto o Gemini se mantém notavelmente consistente. No entanto, para a criação de imagens, o ChatGPT supera o Gemini. Isso reflete as diferenças nas arquiteturas de modelo utilizadas.

Agora precisamos saber se o Google ainda está usando o modelo baseado em difusão do Imagen 3 para gerar imagens ou usando os recursos nativos de geração de imagens dos modelos Gemini. A propósito, o OpenAI usa o modelo de IA GPT-4o para criar e modificar imagens. Este desenvolvimento ilustra a competição contínua no campo da inteligência artificial.

Além disso, o Google diz que uma marca d'água digital invisível SynthID é incorporada em todas as imagens criadas ou editadas com o Gemini. Além disso, o Google também adicionará uma marca d'água visível a todas as imagens criadas com o Gemini. Esta medida visa aumentar a transparência e a responsabilização no uso da inteligência artificial.

Comentários estão fechados.