Transcrição do Episódio 0:00 [música de introdução] Diretamente da maior comunidade Ciência de Dados do Brasil, a gente traz o Data Hackers News, as notícias mais quentes da área de dados AI e tecnologia, direto do podcast Data Hackers. 0:18 Eu sou Monique Femme e junto comigo eu trago ele, Paulo Vasconcelos, pra gente falar as notícias que estão bombando essa semana. E aí Paulo, como que cê tá? Fala Monique, fala pessoal, beleza? 0:29 Mais uma semana começando aí de notícias aí, sem, sem falhar uma semana, né Monique, Data Hackers News aí trazendo as novidades que acontecem na área de tecnologia, de dados, inteligência artificial. 0:38 [música de introdução] E Monique, já temos aqui uma notícia legal pra gente começar a falar, que descobriram, né, que a IA ética da Adobe não é tão ética assim, né? O quê? 0:56 Aquela famosa Firefly, né, que foi uma IA que eles lançaram o ano passado, descobriram que ela utiliza dados do Midjourney no seu, no seu treinamento, que é dado comercial, que não f-- tecnicamente não era pra, pra ser utilizado para treinar outros modelos, né. 1:11 E aí, que que cê soube dessa, dessa treta aí? Olha Paulo, depois da notícia da inteligência artificial indiana da Amazon, da semana passada, eu literalmente não acredito em mais nada, depois, [riso] 1:26 depois que eu li essa notícia da Adobe, mas eu vou dar o, um contexto aí pra vocês, né. 1:31 No ano passado, teve o lançamento ali do, do Firefly, que é um software da Adobe, que tinha essa questão de geração de imagem, através de inteligência artificial generativa, onde eles tinham um discurso ali, que eles utilizavam ali o Adobe Stock, que é o banco de imagens próprio deles, e que eles também utilizavam ali algumas imagens públicas de licença aberta e também de domínio, que tinha domínios expirados ali, até por umas questões relacionadas ao direito autoral. 2:03 Domínio público, né? É, o Creative Commons. Eles até tinham esse discurso de: "ah, se você é um artista e não quer aparecer, pode dar opt out ali, né". Então, tinha todo esse discurso também, né? Exatamente, né. 2:15 E a gente já falou aqui também, né, que, é, a própria concorrente ali deles, né, que é o Midjourney, o PA e o Dall-E, tinham também ali processos, né, e existe alguns processos, algumas discussões relacionadas até mesmo com o direito autoral, né. 2:28 Uhum! 2:28 E o que era um sonho para alguns, virou ali um pesadelo, porque a Adobe tinha ali esse discurso entre os seus concorrentes, de que ele utilizava uma inteligência artificial ética, até por conta aí, dessa utilização desses bancos de dados, né. 2:47 Mas olhando ali pro sonho que virou um pesadelo, através ali de um canal do Discord, alguns desses desenvolvedores não estavam de acordo com esse discurso da Adobe, porque muitos deles ou alguns deles, utilizavam ali também bancos de dados do próprio Midjourney pra poder alimentar o modelo. 3:09 Ou seja, né Paulo, a inteligência artificial ética não era tão ética assim, né? 3:14 Pois é, e esse aí é um desafio nessa questão de treinamento de dado, né, e vai ter outra notícia que é relacionada a isso também, de usar dados de terceiro, dados de copyright nos seus modelos, né. 3:24 E acho que é uma coisa que vai, vai, vira e mexe, vai e volta, porque o próprio Sam Altman falou que se não fosse dados copyrighted, né, se não fossem dados com direito autoral, não teria poss-- não seria possível fazer no ChatGPT, por exemplo, né. 3:39 E ele falou isso naquela época até que a, que saiu a notícia que a New York Times tava processando, né, a OpenAI e a Microsoft. Isso. Foi nessa época que ele fa-falou isso. 3:50 E essas IAs aí que geram texto, que geram imagem, na verdade, Midjourney também já sofreu também, tomou pancada por conta de direito autoral. 3:58 Se eu não me engano, o Shutterstock, acho que o Shutterstock que fez uma, que pr-- tá processando o Midjourney também por uso de imagem, porque durante, quando alguém foi fazer um teste lá com a imagem, tinha uma marca d'água do Shutterstock, alguma coisa do tipo assim, e que identificaram que pode ter sido treinado com dados da plataforma. 4:16 Então assim, eu acho que vai ter um bom caminho ainda, e pra você saber se o seu, o seu dado, né, o seu dado comercial tá sendo utilizado pra treinar IAs do concorrente, né, que até descobrirem alguma coisa, com certeza todos eles tão fazendo isso. 4:30 Com certeza, todos eles tão, tão fazendo algum tipo de usar dados dos outros pra treinar suas próprias IAs. 4:34 É, Paulo, e acho que o que ficou mais feio também, foi porque a gente vai deixar aqui a novela mexicana, porque é uma notícia bem extensa, em que alguns desses desenvolvedores, eles até alegaram receber uma bonificação por ter entregue esse modelo. 4:49 Então- Nossa! O que ficou, é, é literalmente um pesadelo, ficou muito mal. Ficou mal. Né? [riso] Pelo menos o Midjourney não fala que, não finge que é ético, né? 5:00 Ele fala, [riso] tu coloca lá: "desenha aqui, cria uma imagem aqui no estilo desse artista aqui", ele: "beleza, toma aí, meu filho". [riso] É isso aí, né? 5:08 E se acontecer alguma coisa, pelo menos todo mundo foi transparente, né? Você utilizou porque você quis. Exatamente. Ninguém fingiu ser ninguém. 5:16 [riso] Mas é muito engraçado, porque depois, é, existe ali até um, al-alguns quesitos, né, que são colocados de que são utilizados desses concorrentes, né. 5:26 A-ali foi citado o Midjourney, mas existe a possibilidade deles terem utilizado, é, bases de outros concorrentes, né, e eles até alegam ali que tarem utilizando ali uma média de 5%, né, do que eles utilizam, mas tão utilizando. 5:39 Mas é muito engraçado, né Paulo, porque apesar disso tudo, eu vou fazer até uma piada aqui infeliz, né, de que es-- já dizia, né, um poeta sertanejo, né: "Fala mal de mim pra vários amigos meus, mas fica aí cuspindo no prato que você comeu, né?" 5:58 [riso] Caraca. [riso] Mas é, e assim, isso me faz per-- o que me faz pensar nisso tudo, é tipo assim, o quanto de re-- IA responsável mesmo, né? 6:07 Porque assim, uma parada das empresas falar, tipo, OpenAI fala: "a gente faz IA responsável". A Adobe fala: "nossa, a gente aqui segue a ética da, da IA". 6:15 Só que aí tu vê, tipo assim, as ações que não, não condizem com o que eles falam, né. Então, sei lá, cê tem Microsoft, OpenAI demitindo gente do time de Responsible AI. 6:24 Cê tem, tipo, IA que fala que é ética sendo treinada em dado dos outros. Então assim, eu acho que é, vamo lá, capitalismo né galera? 6:33 Tipo, é, eles vão falar que é Responsible AI pra conseguir mais gente ali, mas eu acho que não tão olhando com tanta, tanta vontade isso não. 6:41 É, e a gente, só pra finalizar aqui, há duas semanas atrás, a gente até comentou ali sobre a questão da, do modelo da própria OpenAI, né, de geração de voz. É. 6:51 Que não foi divulgada, até por algumas questões ali do próprios Estados Unidos, né? Por liberação de voz. Eleição no mundo todo. Eleição do mundo todo. 7:01 Então a gente vê, querendo ou não, que a gente ainda tá numa, numa busca ainda de regulamentação e que tudo é muito novo também, então não tem como a gente dizer que tudo é 100% legalizado, né, Paulo? Exatamente. 7:13 Vamo ver o que vai acontecer. É isso aí. 7:15 [música de encerramento][música de introdução] Paulo, falando aí sobre essa questão de modelos, o YouTube não quer que a Open-- a OpenAI treinando modelos em seus vídeos. 7:37 Por que que essa polêmica agora, hein? Pois é, né? 7:40 Ooo-- essa, o CEO da, do YouTube, ele falou isso, né, principalmente sobre, sobre OpenAI, especificamente sobre o Sora, né, sobre o Sora, né, que é aquela IA que gera vídeo lá, esse-- qualidade absurda lá da, da, da OpenAI. 7:57 O que acontece? Vamo voltar um pouquinho. Teve algumas semanas atrás que a CTO do, da OpenAI, ela deu uma entrevista, não lembro se foi pra Bloomberg, se foi pra New York Times, não lembro pra quem foi exatamente. 8:08 Elaaa, então a C-a CTO, né, a Mira Murati do, do, da OpenAI, e-e-ela ficou numa saia justa, porque a, a entrevistadora perguntou pra ela assim: "Ai, que dados vocês treinaram o Sora?" E ela sambou. 8:20 Nossa, mas ela sambou, coitada. Bonito pra responder. Eu vi esse vídeo, eu vi. Cê viu? E ela fala assim: "Não, é, foi treinado em dado, em dado público, dado disponível na internet". 8:31 Aí a mulher começou a baixar, tipo assim, cara, dados público é, possa dados de rede social, dado de plataforma. 8:37 Só que aí ela se esquivou muito da, da-- sabe quando você, tipo assim, cê tá tentando esquivar, mas aí cê já se entrega, né? Cê- Sei, sei. Já denuncia que você tá fazendo alguma coisa, é, alguma coisa errado. 8:48 Então acho que foi u-um pouco disso, porque o que isso gerou foi essa fala do, do, do CEO da, da, do YouTube, que ele fala: "Olha só, se a OpenAI que tá usando dado público pra treinar esse modelo", e algumas pessoas têm a hipótese que um-- alguns desses dados são vídeos do YouTube, né, porque são-- cê vê que muitos vídeos ali têm até essa estrutura, né, de parece que um formato de vídeo de YouTube mesmo, um vídeo que a gente vê ali de, hã, shut-- é, stock video e tudo mais. 9:12 Isso. Ele falou: "Olha, a gente não quer, porque senão isso vai ser uma grande, uma grandeee violação dos nossos termos de uso, né?" 9:19 Então, assim, é, o que eu v-- o que eu vejo, né, d-disso tudo, dessa, desse, dessa fala dele: um, tá coçando, né, tá bate-- a, a água tá batendo neles lá, tipo do, de, de relevância do modelo da OpenAI, e ele tenta colocar isso. 9:33 Mas assim, a gente sabe que também o Google não é livre de ter usa-usar dados de terceiro pra fazer treinamento dos seus modelos ali também, né? 9:41 Então é assim, é meio que uma briga dos dois, de, de, das empresas falando assim: "Ah, eu não quero que cê treine no, no meu dado, mas eu também vou treinar no seu aqui, né, vou tentar, a-até ser descoberto aqui, eu vou continuar treinando no, no, no seu dado ali". 9:54 Porque é claro, essas plataformas elas têm muito dado mesmo, né? 9:57 Tanto que agora recentemente, não sei se cê lembra disso, Monique, teve umas semanas atrás, que a Google fez um, um-- fechou um negócio com o Reddit pra ter acesso aos dados da plataforma. Isso uma, uma coisa que- Sim! 10:08 ...aumentou muito, deu uma inflada legal no IPO deles lá, que eles pagaram uma grana. 10:13 Eu tô até verificando aqui qual é exatamente o valor do, do, hã, sessenta milhões de dólares, foi o valor que, desse acordo que eles fizeram pro, o Google ter acesso aos dados da plataforma do Reddit para treinar modelo de machine learning, né. 10:25 Então assim, um tá querendo evitar que o outro treine no, nos seus dados. 10:28 A gente sabe que tem muita IA aí que é treinado com da-- com output do ChatGPT também, né, pega o resultado do ChatGPT e treina o seu próprio modelo. 10:35 E, mas a gen-- é, é o mesmo problema ali da, da, da Open-- da, da Adobe. Só descobriu porque teve um, um, um desenvolvedor lá que falou que, que estão usando esse dado. 10:46 A menos que a gente consiga uma prova, sei lá, que não dá pra-- irrefutável. [riso] A gente não vai saber se, se eles usam ou não, né, esse da-- vídeo do YouTube pra fazer esses dados, por exemplo. 10:55 Mas aquela coisa, né, Paulo, é uma briga entre as concorrentes, né? É todo mundo querendo tá na, à frente, mas ao mesmo tempo utilizando a base da mesma tecnologia, né? 11:05 Uma hora não tem como, elas vão ter que se conversar entre si, né? Não sei se você concorda com isso, mas eu vejo assim que é uma briga, tipo, perda de tempo, né? 11:14 Em algum momento vai ter que ter essa conversa, em algum momento vai ter essa utilização, né? Ou não? É, eu acho que assim, eles falam, tem muito essa fala porque se descobre, vai ter uma batalha judicial forte, né? 11:24 Você treinar, com certeza descobrir que, sei lá, o Sora, que é um dos modelo mais, hã, que ficou em alta assim do, do, do OpenAI, cê descobre que ele treina com dado proprietário, né, dado copyrighted, que aí você também tem, né, os da, da plataforma dos creators, né, que fazem upload ali, que sobem dados pra-- sobem seus vídeos pra plataforma também. 11:43 É, isso tudo tem todo o impacto jurídico, né? E assim, a OpenAI não é uma empresa que dá lucro, né? 11:48 Não é uma empresa que, tipo assim, pode ficar tomando muita pancada judicial assim, é, absurda, que pode acabar com o negócio dela, embora ela seja subsidiada bastante pela Microsoft ali também, né? 11:59 Mas vamo acompanhar aí as, o próximo capítulo dessa novela aí. É, vamo acompanhar. 12:06 [música de encerramento]Bora Monique pra nossa última notícia aqui dessa semana, que é o lançamento do Udio, né, uma IA que gera música ali a partir de prompts, né, de texto, que aí é uma grande concorrente do Suno AI, que foi lançado na semana passada e fez bastante barulho ali no, no Twitter, vi muita gente compartilhando algumas notícias e mais um concorrente aí, tem xerife novo na cidade, né? 12:36 Olha, Paulo, eu tô achando que a ordem dos fatores altera sim o resultado, porque o Suno do mês passado, ele saiu na frente ali em lançamento como uma plataforma de criação de música gerada por inteligência artificial, né? 12:48 Teve outras ali atualizações, mas o que acabou impressionando o mercado foi que o Udio também tem ali uma abordagem supersimples ali na criação de música, e ele também conta com investimento de artistas conhecidos como o Will.I.Am e o CTO do Instagram. 13:03 Os fundadores do Udio ainda não explicaram como, mas eles estimam que futuramente os músicos possam criar suas músicas através da plataforma e também monetizar. E aí, o que cê acha sobre, sobre essa ferramenta, hein? 13:18 Pô, bem legal, né? Tipo, mais um concorrente aí, porque realmente o que tinha mais forte... Tinha outras plataformas de geração de música, né, como tem uma chamada MusicFX, tem, ti-tem o Stable Audio, né- Tem isso. 13:30 Que é um open source. 13:31 É, mas o Suno, ele é uma empresa, é, ele lançou semana passada, mês passado, uma versão que é V3, né, mas ela já é uma empresa um pouco antiguinha, mas não tinha um concorrente grande assim, né, pra bater de frente com ele. 13:44 E é legal ver assim o Udio, né, o Udio chegar pra tra-trazer um pouco de barulho também, né, igual cê falou, cara, tem o Will.I.Am ali, tem o Se-- o Michael Krieger, que é o co-founder do Instagram, e tem uma, um-- embora eles tenham levantado só, entre aspas, né, dez, dez milhões, a gente tá falando de uma empresa que foi, foi criada em dezembro de do-- é, de 2023. 14:04 Olha! E é uma empresa que tá sendo, é, financiada pela A16Z, que é uma gigante aí do, dos mercados de venture capitalist. 14:12 E assim, eu testei, realmente ele tá disponível pra usar, pessoal, quem quiser usar é Udio, U-D-I-O, ponto com, e o resultado tá muito bacana. 14:22 Dá pra você gerar umas músicas de trinta segundos ali, né, mas parece que dá pra-- vai dar pra você gerar um pouco mais longa, e a qualidade é sensacional. Eu achei muito bacana. 14:31 Tem gente que tá fazendo até, descobriu que ela tem funcionalidade de fazer tipo cena de stand-up. Olha! O pessoal bota ele pra-- criar uma cena de stand-up, ele, aí bota aquelas risadinhas de fundo. 14:40 Eu achei muito interessante. [risos] Muito interessante. E acho que assim, é, é mais uma ferramenta pra ajudar na questão da criatividade, né? Você dá escala pra criatividade. 14:50 Acho que muitos músicos vão poder fazer o uso desse tipo de tecnologia, mas principalmente pessoas também que não têm o dom artístico musical, né, eu, por exemplo, não tenho. Olha. 14:59 É, mas se eu quiser fazer um videozinho ali, botar uma musiquinha de fundo diferente, eu posso fazer também isso, né? Então achei muito bacana ter o lançamento do, do Udio. 15:07 A gente pode até pedir pro nosso, pro nosso querido Leo, né, Paulo, poder gerar as músicas desse episódio com o próprio Udio, né? 15:16 Pois é, a música aí, que cês tão ouvindo aí, ó, já é música tu-tudo gerado pelo Udio, pessoal. Não tem nada de cantor aí de verdade, não. [risos] Tá vendo? 15:23 [risos] [música de transição] Mas é muito legal, né, porque uma das propostas da própria plataforma é que você tenha essa facilidade ali, é, através de um prompt de texto, você gerar qualquer tipo de som, né, qualquer tipo de música. 15:43 Existe ali uma, algumas discussões, mas acho que não só pro Udio, mas também todas as plataformas que geram essa questão de música, que a gente vem falando aqui sobre essa questão do direito autoral, mas eu acho que já é uma grande evolução ali pro que se pode vir ali como possibilidades, né, até o-os próprios cofundadores e fundadores aí da plataforma já tão pensando numa forma de monetizar. 16:04 Eu acho que acredito também nessa forma de regulamentar esse tipo de, de plataforma, mas a gente já começa a ver, é, você que falou sobre essa questão da criatividade, né, a possibilidade que pessoas que são normais como nós, né, que não têm ali todo o know-how de sonoplastia e tudo mais, podendo gerar, é, produtos em tão pouco tempo, de maneira tão fácil, né, Paulo? 16:26 Não, pois é, depois dá uma olhada ali, pessoal, vai lá no site do Udio depois e dá uma olhada só nos exemplos que, que tem ali. São muito maneiros, cara. 16:33 Não só a questão da qualidade musical, mas a voz também, o tempo, né, o ritmo da, da música fazendo sentido. 16:39 Um exemplo que tinha, ó, é, se não me engano, o, o Suno, até a versão três que eles lançaram, se tu pedia, se tu pedisse pra ele gerar um jazz, ele esquecia totalmente o tempo- Olha! 16:51 Do, do, do jazz ali, não respeitava, fazia uma música que era, parecia jazz, mas não era jazz. E aqui o do, 16:57 não sei se fo-- a pro-- de propósito, mas a primeira categoria que tem aqui no Udio é o jazz mesmo, música que eles geraram no jazz. Então ficou muito bacana. Eu, olha só, eu apostaria dinheiro- Olha! 17:07 Que as mús-- que, que esse modelo aqui foi treinado em corredar do copyright, tá? [risos] Eu duvido que tenhas a música open source, música creative commons. 17:16 Eu, eu sou, eu, eu truco demais isso daí, tanto a Suno quanto a Udio aqui. Que legal! 17:22 Mas se, se treinou já nas músicas do Will.I.Am ali, do Black Eyed Peas, então já, já, já tem uma, uma qualidade boa de música pra treinar, né? [risos] Que legal. 17:29 E cê falou aí do Suno, eu assisti até uns vídeos ali do, da galera utilizando o Suno, e tem um específico de uma pessoa que ele mostra como utilizar. 17:38 Aí no, tem um momento que ele vai gerar, ele pede uma música e de repente vem um reggae. [risos] Reggae. 17:44 E aí ele fala assim: "Ah, a plataforma é maravilhosa, mas teve esse errinho aqui, mas a gente segue, segue testando, né?" [risos] Pois é, pois é. Então muito bacana aí essa, essa novidade. 17:54 [música de transição] Bom, essas são as notícias que você ouviu essa semana, mas tem muito mais lá no DataHackers.news. 18:13 Se você ainda não acessou nossa newsletter semanal, vai lá, DataHackers.news, e toda segunda-feira chega notícia fresquinha e tudo que tá rolando dentro da área de dados. 18:23 Cê também pode acompanhar as atualizações do State of Data, que ainda tá no ar, e logo mais a gente libera pra vocês aí a base de dados. Bora se despedir, Paulo? Vambora. É isso aí, pessoal. 18:33 Obrigado aí pela presença mais uma vez. Compartilha o Data Hackers aí com as pessoas do seu trabalho, com as pess-- com seus colegas aí. 18:39 Se não segue a gente aí no Spotify, no Apple Podcast, no seu player de podcast favorito, já faz esse favor aí, dá aquelas cinco estrelas pra gente também, pra dar aquela fortalecida. E é isso aí, que é isso. 18:48 Semana que vem tem mais. Valeu. Valeu. Até mais. Tchau, tchau. 19:03 [música de encerramento] Esse podcast foi editado por Aerolitos, edição inteligente. [música de encerramento]