Desde o fim de julho de 2026 é possível descrever uma cena em uma frase e receber até 20 segundos de vídeo com áudio sincronizado — diálogo, efeitos e som ambiente — sem gravar nada. O FLUX 3, da Black Forest Labs, colocou isso de pé num modelo só, e desde 5 de agosto está disponível por API em 1080p. A pergunta que interessa para quem vende não é se a tecnologia impressiona. É o que ela já resolve no seu vídeo de produto — e o que ela ainda entrega errado.
Nós produzimos vídeos com IA há meses, para a agência e para clientes. O que vem abaixo é a lista honesta: onde ela economiza semanas e onde ela ainda queima o material.
O que mudou de verdade
Três coisas saíram do laboratório em 2026. A primeira é o áudio nativo: até então, som e imagem eram gerados em ferramentas diferentes e sincronizados na mão; agora saem juntos, com passos, vidro quebrando e voz na mesma passada. A segunda é a consistência de personagem entre cenas, que sempre foi o calcanhar do vídeo por IA — a mesma pessoa mudava de rosto a cada corte. A terceira é o encadeamento de cenas, que permite montar uma sequência com continuidade em vez de clipes soltos.
Junto disso apareceu uma camada de logística: ferramentas que escolhem sozinhas qual modelo usar conforme a prioridade — qualidade, velocidade ou custo. Para uma agência que produz volume, isso importa mais do que parece: teste sai no modelo barato, entrega final no caro.
Onde já funciona bem
- Ambientação e b-roll. A cena de apoio — a rua, o escritório, a mesa posta, a fábrica — sai convincente e custa quase nada perto de uma diária de filmagem.
- Produto em cena. Colocar o produto num ambiente que não existe ou que seria caro montar. Aqui o resultado é forte, principalmente combinando com o modelo 3D real do produto.
- Variações para teste. Gerar cinco aberturas diferentes do mesmo anúncio e descobrir qual segura o espectador. Isso era proibitivo antes; hoje é uma tarde.
- Porta-voz curto. Oito, dez segundos de alguém falando para a câmera funcionam — desde que o roteiro seja curto e a cena, limpa.
O que ainda sai errado (e a gente já apanhou disso)
- Texto na tela vira garrancho. Qualquer letra que a IA precise desenhar — placa, rótulo, interface de aplicativo, legenda — sai embaralhada. Solução: todo texto entra depois, por composição, não pela IA.
- Logo é recriado, não copiado. Numa parede ao fundo, costuma sair fiel. Numa camiseta, num crachá, num copo, a IA redesenha o logo com liberdade — e o cliente percebe na hora. Nesses casos, carimbamos o logo real por cima.
- A voz erra a entonação. A locução sintética acerta a pronúncia e erra a intenção: ênfase na palavra errada, pergunta que soa afirmação. Regerar é barato; revisar de ouvido é obrigatório. Palavras que a IA insiste em ler em inglês a gente escreve foneticamente no roteiro.
- Continuidade entre clipes. Mesmo com os modelos novos, personagem só se mantém igual se a descrição for idêntica e específica em todos os prompts. Mudou uma palavra, mudou o rosto.
- Mãos, reflexos e objetos pequenos. Melhorou muito, mas ainda é onde a cena denuncia que é sintética.
O fluxo que funciona na prática
- Aprovar a imagem antes de animar. Gera-se a cena estática primeiro, ajusta enquadramento, marca e figurino ali — e só depois transforma em vídeo. Corrigir num quadro é barato; corrigir em 20 segundos, não.
- Separar o que é IA do que é programático. Cena, ambiente e pessoas na IA; texto, interface, gráfico e logo por composição. É o híbrido que dá acabamento profissional.
- Trilha por baixo, voz na frente. A música entra na mixagem, bem abaixo da locução, sem regerar o take que já ficou bom.
- Regenerar em vez de consertar. Quando o take sai quase certo, a tentação é retocar. Sai mais rápido e melhor pedir outro.
Quando não usar IA no vídeo
Tem material que não deve ser sintético, e não é questão de qualidade. Depoimento de cliente, antes e depois, e a pessoa real da marca precisam ser reais — se o público descobre que a "cliente satisfeita" foi gerada, o estrago passa longe de estético. O mesmo vale para qualquer coisa que funcione como prova: resultado de tratamento, imagem de imóvel que existe, foto de equipe. E, quando a peça é claramente uma ilustração gerada, dizer isso na legenda custa nada e evita a conversa desagradável depois.
O que muda no orçamento
O custo saiu de onde estava. Antes, a maior linha era produção: diária, equipe, equipamento, locação. Agora a maior linha é direção e revisão — decidir o que a cena tem que dizer, escrever o roteiro certo, escolher entre trinta takes o que não denuncia a origem e finalizar o acabamento. Continua sendo trabalho humano, e é ele que separa um vídeo que vende de um vídeo que apenas impressiona por dez segundos.
É assim que fazemos produção de vídeos promocionais: IA onde ela é boa, composição onde ela falha, e um roteiro que existe antes de qualquer geração. Se você quer entender por que o formato curto rende mais, escrevemos sobre isso em por que vídeo vende mais.
Fontes
Os recursos e datas do FLUX 3 (vídeo de até 20 segundos com áudio nativo sincronizado, consistência de personagem, disponibilidade geral por API em 1080p a partir de 5 de agosto de 2026) são do anúncio da Black Forest Labs. O tema chegou até nós pela newsletter Café com AI. O resto vem da nossa própria produção.


