Transcrição do Episódio 0:00 [música de introdução] Diretamente da maior comunidade de ciência de dados do Brasil, a gente traz o Data Hackers News, as notícias mais quentes da área de dados AI e tecnologia, direto do podcast Data Hackers. 0:18 Eu sou Monique Femme e junto comigo eu trago ele, Paulo Vasconcelos, pra gente contar as notícias que estão bombando essa semana. E aí Paulo, como que cê tá? Salve, salve pessoal, beleza? 0:30 E aí, Monique, tudo certinho com você também? Tudo joia. Aqui tudo bem, né? Mais uma semana aí de, de notícias aí, de novidade que a gente teve, né? 0:37 Uma sem-- novidade muito esperada semana, semana passada aí na área de, é, de inteligência artificial, que a gente vai trazer aqui pra vocês, tão bem, bem animados. 0:45 É, mas ô Monique, pra começar, né, a gente tem novidade de, na, nem novidade, é a volta de conteúdo pros Data Hackers aí, né, pra quem gosta de aprender, quem gosta de se especializar e aprender uma nova ferramenta, vai ter a chance aí de, é, consumir um criado pelo Data Hackers aí, né? 1:02 É, e a gente volta com força total agora no dia vinte e cinco, com o supletivo do Data Hackers. Então vocês que tão, já acompanham aí o supletivo, a gente já divulgou também na newsletter dessa semana. 1:15 Então cê tem a oportunidade de participar do primeiro supletivo desse ano, né, que é a sequência de su-- dos supletivos que já acontece aí pra voc-- com vocês. Uhum! 1:24 E você que é apaixonado ali por dados, né, cê vai ter a possibilidade de criar ali alguns aplicativos de forma rápida e eficiente, com uma solução onde a gente vai trazer ali o Luciano Borba pra falar um pouquinho sobre o Streamlit, né Paulo? 1:42 Exatamente. Inclusive, Paulo, a gente, a gente não, né? Você aí, um homem voraz, até utilizou a própria solução pro próprio State of Data, né? Exato. 1:53 Não, o Streamlit é uma ferramenta aí que é muito comum na caixa, na caixinha de ferramentas do cientista de dados, né? 2:01 Principalmente quando a gente precisa prototipar alguma coisa, fazer um, demonstrar uma análise ou coisa do tipo. É uma ferramenta poderosíssima aí, que a gente usa no dia a dia de trabalho mesmo. 2:12 O State of Data lá, o site lá do relatório foi feito no Streamlit. 2:16 Eu tive que modificar um pouquinho algumas coisas do, da biblioteca, colocar algumas coisas novas, mas pu-- é, a base dele ali é o Streamlit, pela facilidade de você prototipar, de criar esses componentes e tudo mais. 2:26 E aí a gente vai trazer pra comunidade um supletivão, né Monique, uma aulona que a gente vai fazer com vocês. É, na verdade, é, quem conduz essa iniciativa, né, de forma bem voluntária mesmo, é o Rodrigo Teoria, né? 2:40 Participante antigaço da comunidade ali, que ele é o cabeça dessa iniciativa, ele compartilha com-- ele traz o pessoal. 2:49 Então, é, ele tá trazendo ali essa, essa, ali no canal Data Hackers, ele que vai tá puxando essas iniciativas também. E ele vai trazer, né, um especialista pra falar um pouquinho sobre a ferramenta em si, né. 2:59 Então galera, gratuito, a gente não vai tentar te empurrar um curso no final do, do vídeo. [risos] Tá ali disponível pra você poder consumir depois. 3:06 E é uma baita oportunidade de aprender a usar uma das ferramentas quentíssima do mercado, né? É isso mesmo. Então já marca aí na sua agenda. A gente também vai deixar aqui o link pra você participar. 3:16 Vai ser lá no YouTube do Data Hackers. É no dia 25 de abril, às oito da noite, tá? Então vai lá, já ativa o sininho pra ser notificado e você também pode assistir depois lá no YouTube do Data Hackers, viu? 3:29 A gente conta aí com a presença de cada um de vocês. Exatamente. E a gente deixa o link aqui embaixo, né Monique, no, no, no, na descrição pro pessoal poder acessar aí, né? 3:37 E se você for direto no canal Data Hackers também, procura lá aí no YouTube Data Hackers, cê também vai ver as próximas live da gente, né? 3:43 Então fica aí o que a Monique já falou de se inscrever ali, botar o sininho, porque a gente não é amigo do algoritmo, a gente não cria conteúdo toda semana, mas sempre que a gente cria alguma coisa, é uma coisa relevante ali pra sua carreira. 3:54 Então fica aí de olho, ativa o sininho porque vem mais conteúdo legal aí, gratuito pra você também poder aproveitar. 4:10 [música de encerramento]Ó Paulo, e já puxando a primeira notícia aqui, a Microsoft demonstra uma nova tecnologia de inteligência artificial, que permite dar vida a fotos antigas e obras de arte de maneira muito realista. 4:25 Cê deve já tá vendo aí, tanto nas redes sociais, no Twitter, a foto da Monalisa, é, cantando rap, né? Mas tem um modelo aí, que a gente não sabe se é Vaza daqui, se é Vassa, né Paulo? 4:38 [risada] Que apresentou ali uma estrutura de inteligência artificial, que pode converter fotos de cabeças humanas em vídeos, onde ela pode não só simplesmente falar e cantar. Não é mesmo, Paulo? É isso aí, Monique. 4:53 Teve essa novidade ali que chegou, foi uma novidade mesmo, que ninguém esperava ali da Microsoft lançar, né, essa tecnologia. Meio, meio Harry Potter, né? Que tem ali aqueles- É. 5:03 Os jornais do Harry Potter que, é, se mexe, as figuras, né? Tem, tem uma, uma vibe fantástica ali também. Mas explicando um pouquinho pra quem não conhece, né? 5:12 Ou quem viu pela primeira vez essa tecnologia, esse tipo de tecnologia ele não é novo, tá? Tipo assim, esse tipo de habilidade de fazer uma foto falar, não é algo novo, já tem vários anos que isso é pesquisado. 5:23 Inclusive o termo, é, de pesquisa, a área de pesquisa disso se chama Talking Head, né, cabeça falante, por ser justamente sempre um avatarzinho de uma cabeça falando. 5:33 E recentemente a gente também teve uma da, do Alibaba, não sei se vocês vão lembrar que a gente anunciou aqui no, anunciou aqui no It Hackers News, que também foi uma IA feita ali pelo grupo Alibaba, que 5:44 você mandava uma foto, botava uma música, a foto cantava e tudo mais. Então a Microsoft, né, anunciou essa novidade deles ali nessa luta de, nessa briga de IAs de Head, Talking Heads, né? 5:56 E eu, uma vez, uma pessoa me perguntou, Monique, tipo assim: "Tá, mas pô, é maneiro, tipo, legal, isso aqui é divertido, mas pra que que isso serve, né? Pra que que eu uso isso no dia a dia, né?" 6:05 E a verdade é que isso tem várias aplicações, né? Uma delas, que o paper até explora também, fala muito da questão pra reuniões também, fazer avatares de reuniões. 6:14 Às vezes você não quer deixar sua câmera ligada, mas você pode ter uma foto do seu avatar que fica falando enquanto você tá falando. Olha! 6:19 E a tecnologia permite fazer isso, porque ela consegue fazer essa inferência, ou seja, ela consegue fazer essa geração em real time, e no, e em hardware, que a gente chama de hardware consumidor. 6:30 O que que é hardware consumidor? É placa, é sua placa de vídeo que você usa pra jogar o seu Fortnite aí, o seu CS. Com essa mesma placa de vídeo, você consegue usar essa tecnologia em real time pra gerar essa imagem sua. 6:42 Então é muito poderosa, essa é uma diferença grande. 6:44 Acho que eu diria que tem uma grande novidade, além da qualidade, né, da gerada das imagens, a, uma grande sacada que eu tive, uma grande contribuição que esse paper traz, é essa capacidade de fazer essa inferência, gerar isso em tempo muito, muito curto. 6:57 Geralmente isso é, a maioria das tecnologias demora minutos, alguns até horas, dependendo da quantidade do, do tamanho do, do vídeo. 7:03 E outras pessoas falam assim, de outras habilidades, né, outras aplicações, na verdade, disso, pode ser a própria questão de geração de avatares, é, sintéticos, avatares virtuais. 7:13 Então a gente, de novo aqui no, no Hackers News, a gente colocou, a gente, 7:17 a gente anunciou alguns meses atrás que a Meta tinha lançado uma série de influ-- avatares digitais, não sei se você vai lembrar disso, que é- Sim, sim. 7:25 Tipo assim, ah, tem lá, né, o Tom Brady lá, o Giselo, né, o ex-marido da Gisele lá, conheceu ele por Giselo. Olha. [risada] Que eles criavam avatares dele, avatares dele, tinha do Snoop Dogg lá como mestre de RPG. 7:37 Isso também é uma tecnologia que pode ser utilizada pra isso. 7:39 E outra que eu acho muito interessante também, é a própria questão de dublagem também, porque você pode utilizar isso pra dublar um vídeo que tá numa, numa linguagem, em outra também. 7:47 Então assim, a novidade é bem bacana, Monique, que surgiu essa tecnologia, com essa habilidade pra justamente falar assim, ser uma contribuição pra bateria diferente junto ali com o Alibaba, né, que a gente teve. 7:56 A parte ruim disso aqui é que assim como no, no paper do Alibaba, que é o, foi chamado de Emo, Emo? Acho que é Emo, se eu não me engano. Eles não liberaram o código, né, desse, desse modelo, eles não deixaram ele aberto. 8:09 De forma alguma, por exemplo, não, não é um serviço da Microsoft, não vai ser uma API que você pode chamar, não vai ser um modelo que eles vão disponibilizar open source, nada, não liberaram. 8:18 Eu imagino que é muito motivado pela questão política, que todo o planeta tá vivendo agora, esse ano tem eleição no mundo todo. É verdade. E é perigoso você utilizar esse tipo de tecnologia, né? 8:28 É, eles mesmo falam no paper que eles identificam que pode ser utilizado por, por mal, esse tipo de tecnologia. Concordo bastante com isso também, mas também pode ser muito, é, benéfica. 8:38 Então, quem sabe no futuro aí, um doidão não pega o paper, implementa na mão esse código aí, libera pra gente igual fizeram com o VALL-E, né, que é o, aquela IA da Microsoft de gerar música, de gerar, melhor, de, é, text to speech, né, gerar áudio com base em texto. 8:52 Então foi uma novidade aí, Monique, que teve essa semana, semana passada. Muito interessante, eu adorei os, os resultados ali com Monalisa cantando, cantando rap, mas a, até pes-- fotos de pessoas mesmo ali. 9:04 Cara, pessoas com expressões faciais nada robóticas, não, não tem aquele uncanny valley, que a gente chama, que quando tu vê uma imagem dessa se mexendo, tu fala: "Nossa, que coisa estranha, tá meio estranho isso daqui". 9:15 Então muito impressionante esse resultado e tô animado aí, tomara que surja uma opção open source aí pra gente poder aplicar no dia a dia também, né? É, vamo ver os avanços que tá por aí. 9:24 E até existe uma questão que a própria notícia coloca, né? É, isso mais como passos mais futuros, né? 9:31 De até que essas movimentações possam, de certa forma, emular e-emoções humanas e também aumentar a equidade educacional no que se diz ali em melhorias de acessibilidade ali com indivíduos que tenham dificuldades na comunicação muitas das vezes, né? 9:47 Uhum. Então, vamo aguardar aí os próximos passos, né? Tem essa questão também da ética, como você colocou, e como você já disse no início, né? 9:55 Ainda não, não é algo novo, mas o bom é a gente ver a evolução desses processos numa linha do tempo, né? Com certeza, exatamente. 10:02 Assim, isso é ciência, tipo, é, são passos, é, constantes, incrementais, que a gente vai evoluindo até conseguir chegar num momento ideal pra gente aplicar isso no dia a dia e tudo mais. É isso 10:19 E a segunda notícia que a gente traz, né, é que a Meta anuncia nova versão do Llama com integração do WhatsApp e Instagram. 10:28 E Paulo, já basta o Mark Zuckerberg ali dando algumas entrevistas recentemente, né, onde ele também expressou ali algumas preocupações sobre o futuro da inteligência artificial, comparando até mesmo as questões que se relaciona ali empresas que limitam a própria inovação. 10:44 Agora, a Meta acaba de lançar a mais recente versão ali de inteligência artificial voltada à IA generativa, que é de código aberto, que você já conhece, que é o Llama 3. 10:57 E com o lançamento do Llama 3, a Meta também tem como objetivo empurrar os limites ali das capacidades de inteligência artificial, ostentando melhorias significativas em relação aos seus modelos anteriores. 11:11 Além também, né, de promover melhor desempenho que os outros modelos concorrentes. E aí, Paulo, o que que traz essa versão aí do, do Llama 3 aí nesses últimos tempos? 11:23 Não, é, o Llama 3 era um dos modelos mais esperados aí do ano, né? 11:28 Acho que talvez até mais pela, esperar pela comunidade que o GPT-5 assim pra-- porque é um modelo open source, né, e é o, a gente tá falando de um modelo que tem uma empresa gigante ali por, por trás, que é, que é a Meta. 11:40 Ô Monique, já vou falar aqui, já vou deixar registrado aqui no podcast que eu tô passando um pano pra Meta que é sacanagem. Tô passando pano pro Mark Zuckerberg, pra Meta. 11:51 Cambridge Analytica, nem lembro o que que é, pode usar meus dados aí, nem lembro, sempre fui fã, porque cara, a, o impacto que eles tão trazendo pra a cena open source é impressionante com o lançamento do Llama. 12:04 A gente tá falando de um modelo open source, que cê pode usar de forma comercial, acadêmica, na pesquisa, né, tudo mais, que tem a ca-- é simplesmente o melhor modelo open source que bate de frente com o GPT-4, que é um modelo totalmente proprietário ali, né. 12:19 E essa, esse lançamento do, do Meta, né, claro que a Meta também não é boba, né, ela tá lançando muito dessas tecnologias, porque eles querem, é, alavancar as próprias tecnologias, os próprios produtos deles- É, exatamente. 12:32 Com ele, né? O caso que cê trouxe aqui é o próprio WhatsApp e o Instagram, além do Facebook e também o, o, a parte do metaverso também, né, da, da, da Meta. 12:43 Mas eu, eu vou te falar uma coisa, eu, eu tava no Twitter quando lança-- fizeram o anúncio desse, da nova versão do Llama e eu nunca vi um modelo explodir tão rápido de uso- Olha! Quanto foi esse, esse, o, essa versão. 12:57 O que que eu quero dizer com isso? Cara, sem, sem brincadeira. Quando foi, eles fizeram o anúncio, falaram assim: "Gente, já tá no Hugging Face". Que é tipo assim, é o hub dos modelos open source. É isso. 13:05 Já tá no Hugging Face. Aí cinco minuto depois a Amazon fala: "Gente, o Llama 3 já tá no, já tá na AWS, já pode usar no Bedrock". 13:12 Aí dois minuto depois tinha um, sei lá, Perplexity falando: "Galera, já tem API de, de Llama 3 se vocês quiserem usar". É muito rápido. 13:20 Ah, aí depois tem, sei lá, o You.com falou: "Galera, já tamo trabalhando aqui pra botar o Llama pra servi-- sendo nosso motor de busca, nos-- o nosso assistente". 13:29 Então o modelo, ele tipo assim, ele, essa versão do Llama, ele balançou mesmo assim o cenário, né, a comuni-a comunidade. Eu so-só, só vejo coisas boas nisso, né, de a, uma gra-- grande adoção desse tipo de tecnologia. 13:43 As pessoas vão começar a melhorar ela, né, como aconteceu com o Llama 2. 13:46 Lançou o Llama 2, o pessoal foi fazendo versão fine tunada, foi fazendo versões menores, versões mais eficientes, versão em C, com, com você podia utilizar. 13:55 Eu vi um cara colocando o Llama num Raspberry Pi, que é, né, o pessoal usa pra fazer automação, usa pra fazer robozinho. Então movimentou muito, assim, a indústria, né, a com-a comunidade. 14:07 Eu testei, tô impressionado com o resultado mesmo, tá realmente com qualidade de GPT-4 ali para o inglês. Para português, ainda tem o mesmo problema que todas essas IAs generativas open source têm. 14:17 É, não, você provavelmente, se você for aplicar no seu trabalho, aqui no Brasil, cê vai precisar fazer um fine tuning ali, precisar fazer um trabalho para ele identificar o, o nosso, o nosso idioma, né. 14:27 Mas aí foi essa a novidade, ô, ô Monique, né? Essa integração com WhatsApp. 14:32 Ah, um outro detalhe que eles fizeram também, né, que eu lembrei dessa questão do WhatsApp, foi que eles lançaram um outro paper que eles chamam de, que eu não vou lembrar o nome do paper exatamente, mas ele vai ser usado numa funcionalidade chamado Imagine, dentro do WhatsApp e dentro do Instagram, que é o quê? 14:46 Você vai poder gerar imagens através do WhatsApp e do Instagram. Olha! Só que qual a impress-- qual é o que eu fiquei impressionado? A imagem, ela é gerada e alterada em tempo real. Como é que é o negócio? Como assim? 14:59 [risos] Você quando usava um, né, você quando usava o Midjourney, você colocava o seu prompt, né: uma foto de uma menina segurando um balão vermelho. Isso. 15:08 Aí tu apertava o botão e esperava lá ele, ele, alguns segundos e tudo mais. Gerar a foto. 15:14 Esse, essa tecnologia, de novo, só acredito na minha mão, eu tô passando pano pra Meta, mas eu também não fiquei maluco, né, eu quero testar na minha mão. 15:20 Mas essa tecnologia deles, enquanto você tá escrevendo, vamos supor essa questão da menina segurando o balão, ele já tá, estaria criando a imagem com a qualidade usável, sabe? 15:29 Ele ia, ele vai alterando à medida que cê vai escrevendo. Então cê começa a escrever: uma menina. Ele já mostra uma menina. Ah, tá. Segurando, aí já mostra segurando. Aí um balão vermelho, ele já mostra o balão vermelho. 15:38 Isso em tempo- Real. 15:40 Bom, parecia ser tempo real, né, mas provavelmente deve ser tempo real por conta de uma, do produto que ele tá inserido, mas uma latência baixíssima que a gente não vê em DALL-E, não vê em Midjourney, não vê em Stable Diffusion e nem nada. 15:52 Então assim, os caras tão andando de bra-- de braçada na, no, no cenário open source, né. 15:57 Então, tô animado para as próximas novidades aí que vai ter, que o Marquinho já falou, o Marquinho, né, o meu amigo ali, o, o Marquinho, eu chamo ele- Brother, né? Eu, eu, eu chamo ele assim. 16:06 Cês fizeram um churrasco esse final de semana, né? Exato. Não, a gente é bom pra caramba. Ele falou que eles tão treinando um modelo ainda maior que esse, 16:15 hã, o lançamento do Llama agora, eles lançaram um modelo de oitentaOito bilhões de parâmetro, um pouquinho maior do que o que geralmente a gente vê, que geralmente é sete bilhões, né, mas esse ele foi de oito bilhões e lançaram de setenta bilhões de parâmetro, que é padrão deles ali. 16:29 Um detalhe é que o de oito bilhões de parâmetro, no vídeo de anúncio do Mark Zuckerberg, ele falou que o de oito bilhões de parâmetro do Llama 3, ele já é melhor do que o de setenta bilhões de parâmetro do Llama 2. Olha! 16:41 Isso é muito impressionante, que é um modelo muito menor, muito menor de nível de produção pra você utilizar no, pro, no trabalho, que tá com uma qualidade maior do que o seu antecessor, a versão mais poderosa. 16:51 Mas eles falaram que eles tão treinando um modelo de duzentos e quarenta bilhões de parâmetros. O quê? Então é um modelo que vai ser maior ainda e vai-- e, ele fo-comentou um pouco dos benchmarks ali, né? 17:03 Mas que falou que já tá impressionado, mas provavelmente no próximo, próximo mês, ou nos próximos meses, vai ter o lançamento desse, desse modelo. Imagino que pode ser por conta do GPT-5 também, tá? Olha! 17:14 Embora eles ali na, no, no benchmark, eles nem coloquem GPT-4 como um modelo ali pra eles, pra eles avaliarem, né? Imagino que é por conta do, de não ser open source, né? 17:25 Então eles só tão comparando com open source mesmo, que eu acho justo, não acho errado não, mas eu imagino que esses duzentos e quarenta bilhões pode servir pra fazer um barulho grande quando o GPT-5 for lançado, que deve tá próximo também, sabe? 17:35 Mas de outras notícias que eu li, Paulo, é, a própria Meta, talvez não apareça no benchmark, mas ele reporta que a própria Meta já tá fazendo alguns testes internos, inclusive com o modelo de setenta bilhões, né, de parâmetros, comparando ali até mesmo com, com, com outros fornecedores, principalmente fornecedores relacionados à própria OpenAI, né? 17:59 Uhum. Mas a gente não tem muitos detalhes do que que seria, na verdade, esses testes internos, né, então... É, esse é um detalhe, assim, que eles vão, não eles vão fazer, mas a própria comunidade vai fazer, né? 18:09 O Hugging Face, por exemplo, eles têm uma, que eles chamam de Arena LLM, né? Que é o quê? É basicamente, você pode entrar lá e participar dessa arena, que é o quê? 18:17 Cê digita uma pergunta e você recebe a resposta de duas LLMs, de duas IAs diferentes. Só que eles não falam pra você qual é a IA que gerou aquilo. Olha! Então ele pode ter, sei lá, o GPT-4 e pode ter o Llama. 18:29 E aí o que eles fazem em seguida, falam assim: "Cara, qual resposta você gostou mais?" 18:32 Então o que eles tão fazendo ééé, aí eles, com base no, no, na preferência do usuário, que é uma, uma métrica muito boa pra mim, que qual o usuário prefere, eles fazem um ranking das melhores, melhores LLMs, né? 18:45 Nesse caso ali, o, o Llama já tá em uma posição muito alta, se não me engano, ele já tá na-- ele já é o melhor modelo open source, de longe, né? 18:53 O, essa versão dele, mas a própria comunidade vai fazer bastante também essas, essas próprias comparações ali com modelos proprietários, né? É um playground, né, Paulo? 19:02 Não, isso aí, isso aí vai ser, vai ser ouro na mão do, de quem for mexer com, com esse modelo. Todo mundo vai ser beneficiado com isso. Que legal! 19:11 Não duvido que, sei lá, a própria, aqui do Brasil, a, a Maritaca, por exemplo, comece ou fazer alguns testes também ou comparar, né, o, o Sabiá lá, que é o modelo deles com, com o Llama também em português. 19:23 Então, mas bastante animado aí com esse lançamento. Open source me anima, né, Monique? Eu gosto bastante dessa, disso tudo. 19:29 [riso leve] E o próprio Zuckerberg também, só pra fechar aqui, nas últimas entrevistas que ele, que ele acabou dando e algumas eu acabei assistindo, ele fala, ele vem com esse discurso agora muito sobre essa questão, é, do código aberto, né? 19:41 Ele até faz algumas comparações até mesmo com o Google, até mesmo com a Apple, tal, é, sobre essa, essa questão de que o mercado de inteligência artificial acaba perdendo a partir do momento que a gente não tem uma contribuição da comunidade, né? 19:54 Uhum. Então vamo ver os próximos lançamentos e tudo que tá por detrás e o que tá pra acontecer. Exatamente. 20:04 [música de transição] É, pessoal, a gente passou aqui rapidinho aí com as notícias dessa semana, mas você pode acompanhar tudo que tá acontecendo dentro da área de dados, AI e tecnologia lá na nossa newsletter semanal. 20:18 Então vai lá no datahackers.news, inscreve na nossa newsletter semanal e toda segunda-feira você tem notícias fresquinhas e tudo que tá acontecendo na área de dados aí na sua caixa de entrada. 20:31 Fora que você também acaba acompanhando todas as atualizações do State of Data. E aí, Paulo, bora se despedir? Vambora! É isso aí, pessoal. Obrigado pela presença, pela participação. 20:39 Espero que cês tenham curtido aí as notícias dessa semana. Bastante novidade bacana. E semana que vem tamo de volta aí também, né, Monique? Valeu, até a próxima. Valeu, até mais. Fui. 20:50 [música de encerramento] Esse podcast foi editado por Aerolitos, edição inteligente. 21:08 [música de encerramento]