Modelos de difusão — novas provas feitas por pesquisadores do MIT apontam que, ao crescerem em tamanho e volume de dados, esses modelos conseguem recriar imagens mesmo sem ter acesso aos originais, o que esvazia trilhas de autoria e complica disputas sobre copyright, auditoria e governança.
- Flash resumo: testes com ensembles e remoção ponto a ponto mostraram que, em datasets maiores, a saída dos modelos muda pouco — fenômeno descrito como “atribuição decai”.
Como os testes demonstraram a perda de atribuibilidade
Os experimentos usaram uma técnica de ablação aplicada a uma arquitetura de “diffusion ensemble”: diversos componentes treinados em pedaços distintos de dados foram trocados para medir a influência de cada entrada.
Foram treinados 24 ensembles em conjuntos variando de 256 até mais de 160.000 imagens, extraídas de sete bases públicas como ArtBench, CIFAR-10, Fashion-MNIST, CelebA e MetFaces.
"Se você remove um pedaço de dado e a saída do modelo não muda, então esse pedaço de dado não afetou a saída." — Zheng Dai
Impacto prático: reprodução, leis e remuneração
Em exemplos práticos, um modelo reimaginou uma pintura famosa mesmo quando artistas específicos foram retirados do treino, e a variedade de imagens geradas manteve-se quase idêntica, reduzindo o raio de atribuibilidade medida por pixel e semântica.
O resultado expõe um dilema legal: casos já em curso contra criadores de modelos apontam que, apesar de imagens geradas poderem lembrar obras protegidas, estabelecer um nexo direto entre saída e arquivo de treino pode ser "praticamente impossível".
O que você acha? O que você acha dessa polêmica? Para acompanhar mais, acesse nossa editoria.
Perguntas Frequentes
O que os pesquisadores do MIT descobriram sobre modelos de difusão e atribuição?
Os pesquisadores do MIT identificaram o fenômeno chamado "attribution decay", em que modelos de difusão, à medida que aumentam o volume de treino, perdem a dependência de exemplos individuais. Em testes com 24 ensembles e conjuntos de 256 a 160.000+ imagens, a remoção de dados quase não alterou as saídas.
Como os testes foram feitos para medir a influência de imagens individuais?
O método aplicou ablação a uma arquitetura de diffusion ensemble: componentes treinados em diferentes partes do dataset foram substituídos para observar mudanças. Nos experimentos, conjuntos de sete bases públicas — incluindo CelebA e MetFaces — permitiram comparar variações pixel a pixel e por significado semântico.
Quais as implicações para processos contra empresas como Stability AI e Midjourney?
O que significa isso para artistas que buscam remuneração por trabalhos supostamente replicados?
Para artistas, a perda de atribuibilidade sugere que reproduções visuais próximas a trabalhos protegidos podem não ser rastreáveis a um arquivo de treino único, dificultando pedidos de compensação. A pesquisa recomenda revisar modelos e práticas da indústria para evidenciar que saídas não são derivados diretos.
Como a descoberta afeta políticas públicas e auditoria de IA?
A descoberta de atribuição decai influencia debates regulatórios: atribuir responsabilidade, auditar modelos e implementar "machine unlearning" ficam mais complexos quando a remoção de um item de treino não altera o comportamento. Isso tem implicações para normas de transparência e conformidade técnica.
Leticia Rodrigues