Transcrição do Episódio 0:00 [música techno] Diretamente da maior comunidade de ciência de dados do Brasil, a gente traz o Data Hackers News, as notícias mais quentes da área de dados AI e tecnologia, direto do podcast Data Hackers. 0:19 Eu sou Monique Femme e junto comigo eu trago ele, Paulo Vasconcelos, pra gente discutir as notícias dessa semana. E aí, Paulo, como que cê tá? [som de palmas] Fala Monique, e aí, pessoal! 0:30 Vamo que vamo pra mais uma semana aí de bastante movimentação na área, hein? Verdade, hein? E ó, que tem notícia polêmica, hein, Paulo. Tem, tem uma aí que me deixou triste, Monique. Me deixou triste sair notícias assim. 0:42 Olha! [riso] A inteligência artificial, o trabalho remoto tenta ajudar, mas a vida do ser humano não é fácil, né? [riso] É verdade. Mas bora pras notícias dessa semana. 0:55 [vinheta sonora] E vamos de primeira notícia porque a OpenAI e o Google pedem ao governo dos Estados Unidos para treinar modelos em conteúdos protegidos. 1:08 E parece que a febre da DeepSeek ainda não passou aí pros Estados Unidos, né, Paulo? [riso] Pois é, tá-- o, o medo do DeepSeek não passou, né? 1:18 O pessoal alugou um triplex na cabeça da, dos, dos americanos ali, porque eles viram que a vantagem competitiva que eles tinham não era tão grande assim, né? 1:27 Então, dá pra ver os movimentos aí, como esse aí que cê acabou de noticiar, Monique. Exatamente. É, mas vamo ver se realmente é a febre ou se é uma desculpa, né, Paulo. 1:36 Isso porque a OpenAI e o Google solicitaram ao governo dos Estados Unidos permissão pra usar material com direitos autorais no treinamento de inteligência artificial, sem precisar de autorização dos autores. 1:48 E pra justificar toda essa solicitação aí, a OpenAI também citou o crescimento da inteligência artificial chinesa e o risco estratégico, já que o Google também alertou que regras rígidas de copyrighting pode limitar o desenvolvimento de modelos de ponta. 2:04 A discussão agora acontece em meio aos processos enfrentados por empresas como a OpenAI e também o Google, por uso indevido de conteúdo protegido, incluindo também ações movidas pelo The New York Times e autores. 2:17 Vamo ver aí, né, Paulo, como que tá tudo isso, né? A gente não sabe se realmente é a desculpa do DeepSeek ou se o fato de querer utilizar conteúdo sem direitos autorais é o que vai deixar esses modelos melhores, né? 2:29 Pois é, a gente sabe que uma das maiores preocupações e discussões que tem na área, é justamente quando essas IAs big techs elas são treinadas em dados copyrighted, né? 2:38 Então, com dados que têm direitos autorais, como imagens de artistas, vídeos no YouTube, ou, por exemplo, músicas, notícias e coisa do tipo. 2:48 Tanto que as maiores ações movidas ali judicialmente contra a OpenAI e essas empresas, são justamente por conta disso, né? O New- o New York Times fez isso. 2:57 Teve, se eu não me engano, algumas gravadoras, a gente já no-noticiou no ano passado, não sei se vai lembrar, Monique. Exatamente. 3:02 Que também, hã, entraram com uma ação, porque descobriram que o modelo po-- podia ser treinado com-- ter sido treinado com dado deles, porque o modelo começou a regurgitar algumas músicas, né? Exato. 3:14 Algumas letras de, de músicas ali também. Eu acho que isso é, é uma grande pedra no sapato que, que eles têm. Mas assim, é, é estranho esse movimento, né? Eu sei que cê fala assim: "ah, fair use, né? 3:25 Uso justo" e tudo mais. Aí é papinho, a gente sabe que é papinho, né? [riso] E pô, quanto tempo até ele falar que vai tre-ele vai treinar o modelo dos nossos dados, né? Que a gente manda pra lá. Exato. Né? 3:35 Ah, o dado da sua empresa que cê manda pra cá, a gente vai treinar modelo, mas, mas confia. Exato. Né? Vai dar na-- vai dar nada, não. 3:41 Então, assim, eu acho que deveria ter, tipo assim, um incentivo, ou melhor, pra coletar esse dado de alguma forma, pagar pessoas que criam, criam esse dado de alguma forma, pensar em, em, em métodos de fazer isso ou gerar os próprios dados deles mesmo, né? 3:55 Algumas empresas de, de inteligência artificial, embora não seja claro como é que eles, como é que eles fazem, mas vou dar um exemplo aqui da Eleven Labs, por exemplo, que eles contratam uma cacetada de locutores, dubladores, pra criar textos pra eles treinarem os modelos de, de IA deles. 4:14 Claro, talvez tenha algum dado, dado de copyright ali, algum dado que foi treinado com alguma coisa, pode ser que sim, mas, é, é um caminho também pra sair dessa questão de, desse problema, né? 4:26 De treinar com dados proprietários, né? Então, assim, eu que-- eu quero muito acompanhar como é que vai ser o movimento, o movimento disso. 4:32 Se aprovado, isso vai causar um-- vai ganhar, dar uma grande vantagem pra OpenAI e pro Google, mas também vai aumentar muito a insegurança de pessoas nessa plataforma, né? 4:42 Insegura-- a segurança que já não é muito grande, agora vai ser menor ainda, né? É, e acho que o que mais preocupa aí é que essa solicitação tá sendo pedida ao governo dos Estados Unidos, né? 4:52 Então vamos dizer assim, é o órgão supremo aí. Exato. Então imagine você ter uma obra e de repente ela, ela é aprovada ali pelo governo de poder ser utilizada pra treinamento de um modelo, por exemplo, né? Exato. 5:04 Porque a grande discussão hoje que se envolve a questão do direito autoral, não só da, da proteção da obra daquela pessoa que se dedicou e que participou e fez todos os processos legíveis pra que aquela obra pudesse ser legível e autoral, né, como a gente coloca, é a discussão sobre onde que vai ficar essa fatia, né, do que deve ser recebido. 5:24 Então, quando a gente vai pra essa frente, será que realmente o direito autoral começa a perder ali a, a própria validade, né? 5:32 E esses autores que têm as suas obras ali cadastradas, seja obra musical, autoral ou até mesmo uma obra de arte, por exemplo, como que faz com tudo-- o que que vai acontecer, né? 5:43 Porque acho que abre vários precedentes aí pra várias discussões, né? Não, com certeza. E assim, a China a gente sabe que é o caminho totalmente contrário, né? Totalmente, caminho totalmente diferente, né? 5:54 Eles treinam mesmo. Exato. Tudo quanto é dado lá dentro. Então tem um, um, um controle bem grande ali, né? 6:01 Teve a notícia até acho que do The Verge, acho que eu vi ontem, acho que foi o The Verge ou TechCrunch, alguma coisa do tipo, que parece que o pessoal da China tá segurando o passaporte da galera do DeepSeek. Olha! 6:11 Então, tipo, vi uma notícia assim ontem. Então, é, são formas totalmente diferentes de conduzir pesquisas, conduzir a, os negócios lá, né? Exato. 6:20 Então eu acho que o que os Estados Unidos tá querendo fazer é tentar diminuir um pouquinho mesmo, mas ô Monique, sinceramente, eu acho que mesmo se eles tiverem acesso a esse tipo de, esse tipo de dado e tudo mais, não sei se isso vai ser a grande vantagem desse, dessas empresas, não, sabe? 6:34 Também. Mas vamos acompanhar pra ver aí todo esse embrólho, vamo dizer assim, pra ver o que vai acontecer nessa- Embrólho? Embrólho. Caraca, Monique. É, embrólho. Cê viu a, o Data Hackers também é cultura. [riso] Pois é. 6:48 É isso aí. [música de introdução] E vamo de segunda notícia, porque essa segunda notícia aqui, Paulo, vale até uma enquete nesse Data Hackers News, viu? Olha aí. 7:00 Isso porque o Google está pensando em voltar com as entrevistas presenciais para evitar trapaças com inteligência artificial. Dá pra acreditar num negócio desse? Francamente. Francamente, né? 7:13 A que ponto chegamos, né, Paulo? [riso] Pois é, retrocesso, cara. Brincadeira. 7:18 Pois é, mas essa notícia veio porque empresas de tecnologia, incluindo o Google, estão avaliando a volta das entrevistas presenciais, após detectarem que candidatos têm utilizado ferramentas de inteligência artificial pra trapacear em entrevistas técnicas realizadas remotamente. 7:36 Após startups especializadas oferecerem serviços que auxiliam candidatos, a gente já viu várias aí, né, a obter respostas automáticas durante o processo das entrevistas, os recrutadores têm observado alguns comportamentos estranhos, como por exemplo, pausas estratégicas ou até mesmo dificuldades pra explicar a lógica do código que foi apresentado supostamente nessa entrevista. 8:00 E pra mitigar esses problemas, o Google e outras empresas estão ali reconsiderando o formato das entrevistas presenciais, buscando também garantir a integridade do processo seletivo. 8:13 E aí, Paulo, olha, merece uma enquete, né? Coloca aqui nos comentários o que cê acha dessa notícia, né? 8:19 É, compartilha sua visão aí nos comentário-- mas vamo ali, que eu acho que eu posso adiantar pouquinho o que que a galera vai achar dessa, dessa notícia aí. 8:26 [riso] Ô Paulo, eu acho que vai ter que ter na, no próximo State of Data, qual que é o motivo de você voltar, né? 8:31 Ou questões de pre-- entrevistas presenciais, a gente vai ter que colocar como próxima enquete do State of Data do próximo ano, hein? É, pois é, pois é. 8:39 E assim, eu acho que, eu até compartilhei no LinkedIn sobre, sobre isso, né, é, eu acho que isso é uma forma errada de resolver o maior problema que é, que é um processo seletivo quebrado. Exato. 8:49 Então, a gente quando tá falando dessas etapas do processo seletivo, a etapa que é mais automatizada, segundo a notícia ali pelo, pelos candidatos, é a parte do, de desafio de programação, né? O famoso LeetCode, né? 9:03 Tem-- acho que tem outros que fazem, fazem isso também. Mas que é o quê? 9:06 Cê dá um problema de programação e a pessoa tem que responder aquele problema de programação fazendo a solução mais eficiente, com complexidade de tempo, de, de tempo e espaço, por exemplo. 9:15 E aí, esses problemas são altamente batidos. Esses modelos são treinados em cima desse, desses algoritmo pra justamente terem melhor performance, terem melhor, melhor solução e tudo mais. 9:26 Então assim, eu acho que você não resolve o problema de ter o-- assim, quer dizer, você resolve o problema da pessoa trapaceando, né? No ao vivo ali, a pessoa não vai trap-- não vai trapacear e tudo mais. 9:36 Mas eu acho que, tipo, senão, existe outras formas que poderiam ser feitas pra melhorar, melhorar esse, esse processo. 9:41 Talvez trazer casos de uso, talvez trazer, eu gosto muito de uma etapa chamada de system design, que você desenha uma solução e discute essa solução. 9:49 Se, é dado um problema pra você, cê tem que criar a solução, a arquitetura daquela solução. Então é muito bacana essas, essas etapas e consegue dar uma visão bem legal sobre o, a, o perfil da pessoa. 9:59 Talvez pro tamanho da Google, pro tamanho do, do, do, da volumetria deles, seja difícil fazer, é, seja difícil fazer isso. 10:05 E o outro grande problema que você tem com isso, é que você elimina a galera que não tá distribuída nos grandes centros, né? Ou na, ou nas cidades em que essas empresas possuem sede, né, possuem escritório. 10:17 No Brasil, por exemplo, o Google tem escritório, se eu não me engano, em Só-- eu sei que tem em Belo Horizonte, se não me engano, tem em São Paulo também, ou eu tô falando besteira? 10:24 Tem, um mega escritório aqui em São Paulo. Então tem dois escritórios no Brasil, a, a Google, mas tão distribuídos na região Sudeste, por exemplo. 10:31 Então cê elimina uma galera aí de outras regiões que tem profissionais excelentes, como o próprio State of Data já mostrou. 10:36 Então assim, como eu falei também no, no meu post ali, se a Google fazer isso mesmo, não vai faltar gente que vai querer trabalhar. Exato. Esse é o ponto. Não vai faltar gente pra trabalhar nessas big techs. 10:43 Talvez uma consultoria ou outra que quiser fazer isso ali daquela, daquela lista, talvez não, não tenha tanto sucesso assim, mas enfim. Mas vai ter gente pra trabalhar. 10:50 Só que é triste ver que o mercado tá seguindo, é, esse, seguir essa, essa dinâmica, sabe? A gente sabe que muita gente copia, simplesmente copia a Google, simplesmente copia processo seletivo. 11:01 Então se eles vão, forem trabalhar com isso mesmo, a gente pode esperar que outras empresas vão querer copiar esse modelo de entrevistas também, sabe? Verdade. 11:08 E aquela coisa, né Paulo, a pessoa que vai trapacear no processo seletivo, ela vai trapacear tanto no, no modelo presencial quanto no modelo remoto, né? 11:16 Sempre vai arranjar uma forma ali de tentar convencer o próprio recrutador. 11:21 E aquela coisa também, né, que a gente fala muito dentro da área de tecnologia, até mesmo quando a gente fala sobre apresentação de portfólios e tudo mais, nem tudo se garante, né? 11:28 Então como que cê consegue literalmente trazer um negócio totalmente autêntico, mas também atrelado a esses processos seletivos que tão atrelados a outros desafios, né? 11:37 E tem também aquela questão da capacidade humana, né? Se realmente aquele momento de pressão, se ele consegue também desenvolver bem a solução. Acho que tem outros fatores que precisam ser observados. Total, total, Ni. 11:49 Então assim, vamo acompanhar como é que vai ser isso. Tomara que tenham só apenas cogitado essa ideia, mas não apliquem ela de, de fato, né? 11:57 Porque acho que a gente criou tanta coisa assim nos últimos anos aí em questão de processo seletivo, formas de trabalho. É triste ver voltando, re-- tendo esse retrocesso, sabe? Exato. 12:07 E também acho que também é uma, uma própria pressão do mercado agora, né, que pelo menos aqui em São Paulo, todas as empresas tão voltando no formato presencial, né? 12:16 Então automaticamente notícias como essa acho que venham a surgir até meio pra que reforçar esse modelo que estamos retomando, né? Na camada mais presencial do que o mercado acaba exigindo ali desses profissionais. 12:29 E agora vem as discussões, né, se é uma questão de mercado, se é uma questão econômica ou se realmente é uma questão de praticidade, utilidade, ou se é olhando pelo, pra esse ecossistema organizacional, né? 12:41 Não, exatamente, exatamente. Vamo acompanhar. Vamos acompanhar. [vinheta] Bom, essas e outras notícias você acompanha não só aqui no Data Hackers News, mas lá na nossa newsletter semanal, acessando datahackers.news. 12:59 Vai lá, coloca seu e-mail e toda segunda-feira, tudo que rola dentro da área de dados cai na sua caixa de entrada. E aí, Paulo, bora se despedir? Vambora. É isso aí, pessoal. Obrigado pela presença de vocês aí novamente. 13:11 A gente se vê na próxima. Falou, até mais. 13:14 [música de encerramento] Esse podcast foi editado por Aerolitos, edição inteligente. 13:31 [música desvanecendo]