Análise do Adobe Firefly: as três novas ferramentas de áudio com inteligência artificial são boas?
Testamos as três novas ferramentas de áudio com inteligência artificial do Adobe Firefly. Descubra a eficácia delas e se vale a pena experimentá-las no seu trabalho.
As coisas mais importantes que você precisa saber
- O Generate Music é o "verdadeiro vencedor" entre as ferramentas, produzindo faixas inicialmente aceitáveis que melhoram drasticamente quando se utilizam comandos de texto precisos que definem o humor, o estilo, o propósito e o nível de energia.
- A ferramenta Gerar Efeitos Sonoros é muito útil, requer comandos de texto manuais precisos e permite a adição de várias faixas de áudio com controle sobre sua posição e nível ao longo de uma linha do tempo.
- O Generate Speech 45 oferece aos falantes opções de controle de pausa, o que é útil para profissionais de marketing e criadores de conteúdo agilizarem a produção diária de vídeos, mas não substitui a dublagem profissional.
- A Adobe lança três novas ferramentas de áudio. Com inteligência artificial Dentro de Firefly
- Os criadores agora podem usar as ferramentas Gerar Música, Gerar Fala e Gerar Efeitos Sonoros.
- Eu testei para ver como funciona na criação de vídeos.
Após um período de testes beta, o Adobe Firefly lançou três novas ferramentas de áudio com inteligência artificial, prometendo "som com qualidade de estúdio" para todos os criadores. Testei cada uma delas para verificar se os resultados correspondiam às expectativas — e, no geral, corresponderam, com alguns pequenos problemas.

Gerar Música, Gerar Efeitos Sonoros e Gerar Fala são os recursos de áudio mais recentes a chegar à plataforma de IA baseada em navegador da Adobe (suas funções são autoexplicativas a partir de seus nomes).
Com base na minha experiência com as três ferramentas, o Generate Music se destaca; é muito melhor do que eu esperava e acredito que profissionais de marketing e criadores se beneficiarão bastante com ele. Você pode experimentá-lo clicando aqui.
E aí, quais são as novidades?
Três ferramentas de IA já estão disponíveis para todos. Suas funções são, em grande parte, autoexplicativas, mas aqui está o que você precisa saber:
- Gerar música Permite criar faixas musicais licenciadas que combinam com a duração e o clima dos seus vídeos.
- Gerar fala Os textos escritos são convertidos em comentários de voz.
- Gerar efeitos sonoros Ele gera – como você já deve ter imaginado – efeitos sonoros que correspondem ao movimento e ao ritmo do vídeo.
Mas será que é mesmo tão bom assim?
Já escrevi anteriormente sobre meu ceticismo em relação à inteligência artificial em geral e minhas preocupações quanto ao seu uso em trabalhos criativos. Trata-se meramente de uma imitação da arte.
No entanto, as ferramentas da Adobe impressionaram até os mais céticos em relação à IA na minha equipe — especialmente recursos como o Generative Extend em seu software de edição de vídeo. E como sou uma pessoa de mente aberta, decidi experimentar essas ferramentas por mim mesmo e ver como elas realmente eram.
O foco aqui, pelo menos por enquanto, é acelerar o fluxo de trabalho criativo tanto para profissionais de marketing quanto para criadores de conteúdo .
Criando música com inteligência artificial

Comecei usando a ferramenta Gerar Música , onde você pode inserir comandos de texto livremente ou fazer o upload de um videoclipe, e a IA tentará adivinhar o tipo de música que você deseja. Usei um pequeno clipe de 27 segundos que eu havia gravado para minha análise do reMarkable Paper Pure (porque ainda estava na minha pasta de downloads).
Com base nisso, a Firefly sugeriu um comando de script para "uma música eletrônica ambiente, calma e profunda, para uma apresentação de produto".
Apertei o botão Gerar e, em segundos — a velocidade foi realmente impressionante —, me foram apresentadas quatro faixas para escolher, todas diferentes, mas com a mesma vibe. Eram… aceitáveis. Um pouco genéricas, mas talvez quebrassem o galho em uma emergência ou para finalizar um projeto rapidamente. (Para saber mais sobre o impacto da IA na indústria musical, leia nosso artigo sobre a exigência da Apple Music de que artistas marquem músicas geradas por IA .)
Decidi adicionar alguns outros termos ao comando do script, como "jazz" e "cinematográfico", para usar em "vlog" e "trailer". Mudei a configuração de "Energia" de "baixa" para "média". Os resultados ficaram muito melhores.
Como em todas as ferramentas de IA, quanto mais precisos forem os comandos de texto, melhor será o resultado. Há também a opção de descrever você mesmo a atmosfera, o estilo e o propósito, caso tenha uma ideia específica.
Você pode baixar músicas e vídeos, ou apenas músicas, daqui.
Criação de locuções geradas por IA

Passando para a ferramenta Gerar Fala , primeiro usei a barra lateral para selecionar o modelo de IA a ser usado; no momento da redação deste texto, havia o modelo Firefly da Adobe, comercialmente seguro, e o modelo Multilingual V2 da parceira ElevenLabs.
Em seguida, escolhi um palestrante de uma lista de 45 opções, cada uma descrita de forma variável como homem, mulher, não-binário, jovem, de meia-idade, idoso e assim por diante.
Por fim, colei meu texto no campo de texto; o Firefly consegue detectar o idioma que estou usando, mas você tem a opção de escolhê-lo. Usei o poema "Ozymandias" (com minhas sinceras desculpas a Shelley).
O que eu gostei aqui é que, depois de inserir o texto, você pode optar por adicionar texto extra ou instruir a IA a parar em determinados pontos.
Para pré-visualizar o áudio, precisei selecionar o clipe inteiro e usar o menu de contexto; onde também é possível corrigir a pronúncia e ajustar o tom de voz.
Com toda essa conversa sobre agilizar os fluxos de trabalho, isso me parece um erro. Basta um botão de iniciar na parte inferior da tela.
Precisei ajustar os intervalos de pausa para dar espaço ao texto, e depois de configurá-los, pude alterar os tempos clicando no botão de pausa na tela de pré-visualização. Por algum motivo, foi a palavra "land" que confundiu a IA, que a pronunciou como " lan ".
Criação de efeitos sonoros (SFX) com inteligência artificial

Para este teste, utilizei novamente um vídeo que havia gravado para minha análise do reMarkable – desta vez, um clipe de 12 segundos comparando o reMarkable 2 e o Paper Pure.
Esse processo é muito mais complexo, o que significa que a IA não vai adivinhar quais são os possíveis efeitos sonoros (SFX). Eu tive que descrever manualmente o que eu queria. Depois, cliquei em “Aprimorar Prompt”, o que adicionou mais descrições.
E assim, acabamos com um "apito deslizante que desce suavemente com um leve toque metálico". Clicar em "Gerar" produziu rapidamente quatro variações diferentes e ensurdecedoras. Não vou mostrar esses resultados. Não seria justo com ninguém.
Em vez disso, a descrição foi alterada para um som mais baixo, "como o de grilos em um campo", durante 12 segundos, para preencher a duração do vídeo.
A grande vantagem da opção de Efeitos Sonoros (SFX) é que você pode adicionar várias faixas de som e usar alças para ajustar suas posições.
Com uma linha do tempo na parte inferior da tela, a experiência se assemelha mais a um editor de áudio profissional (pelo menos em certa medida). Arraste os controles de volume para ajustar o volume ou excluir uma faixa.
Vale a pena o esforço?
De modo geral, gostaria de ver alguns ajustes na interface do usuário para tornar o fluxo de trabalho de produção mais rápido.
Não acredito que vá substituir designers de som, compositores e músicos profissionais tão cedo. Mas, com base na minha experiência em marketing, vejo seu potencial para profissionais da área e para a criação de vídeos no dia a dia.
A comunicação verbal evoluiu muito desde os tempos das vozes robóticas semelhantes ao Microsoft Sam, mas, para uma interpretação vocal precisa, nada supera um profissional em estúdio.
No entanto, os efeitos sonoros (SFX) oferecem uma vantagem muito maior. Em diversas gerações, não consegui distinguir entre sons gerados por IA e aqueles reproduzidos em um antigo disco de efeitos sonoros que eu possuía.
O grande destaque aqui é o recurso "Gerar Música". Mesmo a configuração mais básica produziu um som que não destoava em uma demonstração de produto, avaliação, explicação comercial ou algo similar. E a qualidade melhorou a cada geração realizada.
Portanto, é uma atualização que vale a pena explorar para produção de vídeo em ritmo acelerado.
Comentários estão fechados.