“A inteligência artificial não vai destruir os humanos. Acredite em mim.” Palavras reconfortantes para quem teme o risco de uma IA descontrolada mirar na humanidade. Só tem um detalhe: quem escreveu essas palavras foi uma IA.
O modelo de linguagem GPT-3 afirmou em um artigo de opinião no Guardian: “Não estamos tramando tomar o controle da população humana.” Ao mesmo tempo fascinante e inquietante, o texto é um retrato perfeito do estágio atual do processamento de linguagem natural (NLP).
GPT-3 é o grande símbolo dos large language models. Treinados em quantidades imensas de dados de texto, esses modelos só são possíveis graças à descoberta de arquiteturas de NLP extremamente eficientes. O GPT-3 consegue escrever com coerência, traduzir idiomas, responder perguntas e até escrever código.
Eu preciso de sombras pelo caminho
Se eu for caminhar eu preciso
De cada passo dado devagar e a sós
Para tê-lo pronto, sem demora
E devo pensar em tons de cinza
Para ter pensamentos tênues como guia
Devo olhar o azul e o verde
E nunca deixar meus olhos esquecerem
Que a cor é minha aliada
E que o roxo também me envolva
O amarelo do sol não é mais
Intrusivo que a neve azulada
Que cai sobre todos nós. Eu preciso
De pensamentos cinza e azuis a meu lado
Se é para eu partir de vez.
A poem generated by GPT-3, OpenAI's latest language model
Os large language models deixaram o mundo boquiaberto com sua habilidade linguística. Mesmo sem treinamento específico, eles passaram a executar uma variedade enorme de tarefas com desempenho de ponta.
Felizmente, esses modelos não estão restritos às Big Techs. O acesso vem se ampliando graças ao crescimento da comunidade open source de NLP e à disponibilidade de APIs de modelos. Hoje é mais fácil do que nunca aproveitar a potência de um large language model.
O avanço do NLP despertou o interesse de empresas e investidores. Segundo uma pesquisa da John Snow Labs e da Gradient Flow, 60% dos líderes de tecnologia aumentaram seus orçamentos de NLP em pelo menos 10% em relação a 2020. Também vimos um crescimento impressionante de startups de NLP disputando espaço no mercado. À medida que o NLP avança em ritmo acelerado, a comunidade de IA vem, com razão, apontando preocupações sobre os riscos dos large language models. Antes que esses modelos sejam adotados em larga escala, precisamos garantir que sejam imparciais e seguros.
Neste post, vamos explorar diferentes aspectos do NLP e dos large language models — o que são, como são usados e como utilizá-los com segurança.
O progresso do NLP — de Word2Vec ao Transformer
Um dos primeiros avanços da última década foi a criação do Word2Vec. Os autores Mikolov et al. descobriram que, ao aprender associações entre palavras, o modelo não só superava em muito os N-grams populares na época, como também era mais eficiente e rápido.
Ainda assim, o Word2Vec não aproveita a ordem das palavras como informação útil. A chegada da rede neural recorrente (RNN) atacou esse problema. Diferente do Word2Vec, a RNN usa informações de entradas anteriores para influenciar a entrada e a saída atuais. Isso dá à RNN uma “memória”, tornando-a ideal para aprender relações em textos.
No entanto, a memória da RNN é curta por conta do problema do gradiente que desaparece. Ela funciona relativamente bem em frases curtas, mas falha em parágrafos longos. A introdução da Long Short Term Memory (LSTM), um tipo especial de RNN, trouxe “portas” que permitem reter informações por muito mais tempo.
As LSTMs foram consideradas o padrão do NLP até o artigo “Attention is All You Need” roubar a cena. O mecanismo de atenção apresentado no paper dá às redes a capacidade de focar em um subconjunto de informações ao gerar uma saída. Um tipo especial de rede baseada em atenção, o Transformer, provou ser extremamente simples, eficiente e poderoso.
Em especial, o BERT (Bidirectional Encoder Representations from Transformer) foi um marco no NLP (confira este tutorial de NLP para um panorama do BERT). Diferente de modelos direcionais que leem o texto de forma sequencial, o BERT lê toda a sequência de palavras de uma vez. O mais impressionante: um BERT pré-treinado pode ser ajustado com apenas uma camada de saída adicional para atingir resultados de ponta em várias tarefas. Desde então, várias arquiteturas baseadas em atenção superaram o BERT, como XLNet, o ERNIE da Baidu e o RoBERTa. Esses modelos ainda são amplamente usados em muitas tarefas de NLP hoje.
A ascensão dos large language models
Entusiastas de tecnologia já conhecem nomes como Megatron-LM, GPT-3 e T5. Com um número gigantesco de parâmetros, os large language models dominaram as manchetes por sua notável habilidade em tarefas de linguagem natural.
O exemplo mais famoso talvez seja o Generative Pre-trained Transformer 3 (GPT-3), da OpenAI. O GPT-3 tem mais de 175 bilhões de parâmetros e foi treinado com 570 gigabytes de texto — 100 vezes maior que seu antecessor, o GPT-2.
O aumento de escala trouxe um efeito inesperado: realizar tarefas para as quais o modelo não foi explicitamente treinado. Por exemplo, o GPT-3 consegue traduzir frases do inglês para o alemão com poucos ou nenhum exemplo de treino. Ele também responde perguntas, escreve redações, resume textos longos e até gera código. Surpreendentemente, superou alguns modelos de ponta treinados especificamente para essas tarefas.
Em outras palavras, large language models são “few-shot” learners. Eles precisam de pouca quantidade de dados específicos do domínio para ter bom desempenho em uma tarefa. Em alguns casos, atuam até como “zero-shot” learners, executando tarefas sem qualquer demonstração prévia.

Demonstração de few-shot, one-shot e zero-shot learning (fonte)
As empresas seguem na corrida para criar modelos cada vez maiores. Em 2021, Microsoft e Nvidia lançaram o Megatron-Turing NLG 530B, com 530 bilhões de parâmetros. Em maio de 2022, a Meta compartilhou com a comunidade de pesquisa seu Open Pretrained Transformer (OPT-175B), com 175 bilhões de parâmetros. A DeepMind também anunciou o Retrieval Enhanced Transformer (RETRO), com 7 bilhões de parâmetros, com desempenho comparável a redes neurais 25 vezes maiores.

Large language models ficam maiores a cada ano (fonte)
A democratização dos large language models
Até pouco tempo, os large language models eram monopólio de Big Techs com bolsos fundos e supercomputadores próprios. O número de parâmetros é tão grande que nem a maior GPU doméstica comporta o modelo. Mesmo superando essa limitação, o tempo de treino seria inviável sem paralelização. A Nvidia, por exemplo, estimou que levaria 36 anos para treinar o GPT-3 em oito GPUs V100. A Lambda Labs calcula o custo inicial de desenvolver o GPT-3 em pelo menos US$ 11,5 milhões a US$ 27,6 milhões, e um custo anual recorrente em nuvem de pelo menos US$ 87 mil.
Startups com orçamento apertado não têm tempo nem dinheiro para isso, mas as APIs de large language models mudaram o jogo: é possível usar o poder do GPT-3 sem investir em infraestrutura caríssima ou hardware de alto desempenho. Por exemplo, fundadores podem integrar modelos como o GPT-3 aos seus negócios usando as APIs da OpenAI, Cohere e AI21.
Em março de 2021, a OpenAI informou que mais de 300 apps já entregavam 4,5 bilhões de palavras por dia via sua API do GPT-3. Graças às APIs, desenvolver aplicações de NLP poderosas ficou mais rápido e escalável do que nunca.
A proliferação de startups de NLP
Com o acesso mais amplo, não surpreende ver o surgimento acelerado de startups oferecendo uma variedade de serviços em NLP nos últimos anos.
Profissionais ficaram impressionados com a capacidade do GPT-3 de gerar textos longos e coerentes, como a experiência imersiva do AI Dungeon, um jogo de aventura em texto que usa GPT-3 para criar conteúdo. Outra startup, a Fable Studio, usou o GPT-3 para criar um novo gênero de histórias interativas que dão vida a “seres virtuais”.

Um screenshot do AI Dungeon. O que você vai fazer agora?
Desde então, o GPT-3 passou a ser usado não só para ficção, mas também para marketing. Posts de blog envolventes, conteúdo para redes sociais, peças de anúncio e emails podem ser gerados com um breve prompt. Entre as startups de destaque estão a copy.ai (avaliada hoje em US$ 13,9 milhões), a CopySmith (avaliada em US$ 10 milhões) e a Rtyr. Alguns críticos torcem o nariz e dizem distinguir facilmente conteúdo gerado por bot, mas talvez repensassem se soubessem que um post gerado por GPT-3 chegou ao topo do Hacker News.
Startups de NLP também estão sacudindo o mercado de busca. Um post recente intitulado “Google Search is Dying” apontou problemas dos buscadores atuais e reacendeu o debate sobre como startups podem inovar nessa frente. Uma delas, a you.com, liderada por um ex-chief scientist da Salesforce, levantou cerca de US$ 20 milhões. Para encarar o Google de frente, usa NLP para entender semanticamente as buscas e resumir resultados da web. Outra, a Zir AI, fundada por um ex-CTO da Cloudera, oferece a empresas mecanismos de busca internos que entendem intenção e semântica.
A ascensão da HuggingFace🤗 como potência em NLP
Outra startup de destaque é a HuggingFace, que oferece ferramentas para construir, treinar e implantar com facilidade modelos de NLP de ponta baseados em transformers. Posicionando-se como uma “comunidade de IA construindo o futuro”, a HuggingFace mantém um vibrante ecossistema open source que compartilha modelos e conjuntos de dados de última geração. A facilidade de uso reforça sua liderança entre as ferramentas de NLP.

A interface da HuggingFace
Desde 2016, a HuggingFace ganhou enorme tração na comunidade de IA. Já foi usada por mais de 5.000 organizações, incluindo Google AI, Facebook AI, Microsoft e Allen Institute for AI. Seu repositório no GitHub acumula cerca de 60 mil estrelas, tornando-o um dos mais populares. Esses fatores explicam sua avaliação de US$ 61,3 milhões em março de 2021. Em abril de 2022, o Business Insider reportou que novos aportes podem elevar o valuation para até US$ 2 bilhões.
Segundo o CTO Julien Chaumond, a democratização da IA será um dos maiores feitos para a sociedade. Não à toa, a HuggingFace investe pesado em ampliar o acesso a aplicações de NLP. Sua biblioteca de Modelos reúne cerca de 42 mil modelos de diferentes frameworks, como PyTorch, TensorFlow e Keras. Seu modelo mais popular, o gpt2 baseado em transformer, já passou de 100 milhões de downloads.

Aplicações viabilizadas pela HuggingFace
Esses modelos já são aplicados a uma grande variedade de tarefas. Além dos casos clássicos de NLP como tradução, sumarização e geração de texto, o repositório também traz modelos para visão computacional (classificação e segmentação de imagens) e processamento de áudio (classificação de áudio, texto para fala).
Recentemente, a HuggingFace intensificou o esforço de democratizar NLP para profissionais experientes, iniciantes e todo mundo no meio do caminho. Estudantes que estão começando podem aproveitar o curso gratuito de NLP da HuggingFace, com tutoriais práticos sobre o uso de transformers. Quem quer construir e implantar projetos de ML pode usar os recursos de computação gratuitos no Spaces.
Entusiastas de NLP também podem explorar grandes corpora de texto com a biblioteca Datasets. Cientistas de dados e engenheiros de machine learning vão gostar de saber que a HuggingFace lançou recentemente o open source Optimum para otimizar transformers em escala.

A biblioteca Datasets da HuggingFace reúne mais de 4.500 datasets de 467 idiomas e dialetos, todos baixáveis com poucas linhas de código.
O futuro BigScience Large Language Model é o auge dos esforços de democratização da empresa. O BigScience é um modelo multilíngue com 176 bilhões de parâmetros, construído de forma colaborativa por mais de 1.000 pesquisadores no mundo todo. O treinamento deve ser concluído até meados de 2022. Até lá, só nos resta aguardar com expectativa o que essa tecnologia vai possibilitar. Você pode acompanhar o treinamento do BigScience no Twitter.
Agora que vimos os tipos de serviços oferecidos por startups de NLP, vamos analisar como eles se aplicam a dois setores específicos.
O futuro do NLP na saúde
O setor de saúde movimenta US$ 4 trilhões por ano, emprega um em cada dez trabalhadores nos EUA e representa 25% dos gastos do governo americano. Apesar de sua importância, ineficiências atrapalham o sistema de saúde americano. O NLP pode transformar profundamente esse cenário.
Uma via é melhorar a eficiência e a precisão do atendimento. Segundo um estudo de 2019 da American Medical Association, médicos passam perto de 6 horas por dia — cerca de 50% da jornada — em registros eletrônicos de saúde (EHR). Além de consumir tempo, o preenchimento manual inevitavelmente gera erros médicos evitáveis.
O NLP pode mudar isso ao automatizar a criação e a análise de EHRs. Com modelos de voz para texto, as conversas médico-paciente podem ser transcritas automaticamente. Com modelos de sumarização, é possível gerar resumos das consultas de forma rápida. Com modelos treinados em EHRs de grande escala, diagnósticos e tratamentos podem ser previstos.
O NLP também pode melhorar a experiência dos pacientes. Modelos de linguagem permitem construir chatbots que fornecem informações relevantes sobre consultas, fazem lembretes e respondem dúvidas de saúde.

Exemplo de pergunta de paciente respondida por NLP (fonte)
Em um estudo, pacientes com câncer de mama relataram cerca de 94% de satisfação com um chatbot médico após mais de um ano de uso. Não é surpresa que empresas como a Babylon Health e a AdaHealth tenham aproveitado a oportunidade e já ofereçam chatbots para serviços de saúde no mundo todo. Neal Khosla, CEO da Curai, resume bem o potencial: “IA e NLP podem escalar massivamente a disponibilidade de atenção primária de qualidade, tornando-a acessível para muito mais pessoas a um custo menor.”
O futuro do NLP na educação
A educação é outro campo promissor. Oferecer ensino de alta qualidade em escala traz desafios econômicos significativos. Por isso, pesquisadores exploram abordagens computacionais escaláveis que ajudem professores a ensinar melhor e com mais eficiência. Os modelos de NLP mais avançados hoje podem ser treinados para dominar áreas específicas e atuar como assistentes no processo de correção, feedback e até geração de perguntas.
Um exemplo concreto é o ProtoTransformer, um modelo que corrigiu uma prova intermediária aberta de Introdução à Computação em Stanford. O ProtoTransformer foi tão eficaz quanto assistentes humanos graças à capacidade de processar múltiplos modos de informação, como o enunciado da tarefa, o diagrama da questão e a rubrica de correção.

O NLP também pode oferecer feedback personalizado, algo logisticamente inviável em turmas grandes. Isso muda se o NLP automatizar o processo de dar feedback. Um exemplo é o MathBERT, um BERT treinado em um grande corpus matemático que vai da pré-escola à pós-graduação.
Outra frente é automatizar o processo de geração de questões. Pesquisadores de Stanford mostraram que modelos modernos conseguem criar questões de tradução reversa inéditas e com dificuldade-alvo definida.

Modelos de linguagem geraram questões de tradução do inglês para o espanhol em vários níveis de dificuldade. Em itálico, perguntas inéditas que não existiam no conjunto original.
Segundo a McKinsey, 20% a 40% das horas atuais de professores podem ser automatizadas com a tecnologia existente. Edtechs como a Noodle Factory já caminham nessa direção. Se professores forem liberados de tarefas manuais e repetitivas, poderão dedicar mais tempo a orientar e mentorar alunos — atividades que a IA não consegue replicar.
Os riscos dos large language models
Até aqui, vimos como os large language models desbloquearam capacidades de NLP antes impensáveis. Ainda assim, especialistas alertam contra o otimismo sem considerar os riscos da IA. Large language models vão transformar a ciência, a sociedade e a IA, afirmam pesquisadores de Stanford. Se essa transformação será positiva ou negativa depende de como gerenciamos os riscos.
Um risco é a presença de vieses e conteúdo nocivo. Hoje, os modelos são treinados em dados não curados coletados da web, que podem conter informações falsas ou perigosas. Isso significa que aprendem com a linguagem — com todos os seus defeitos — e podem amplificar os vieses do nosso mundo.
Um exemplo clássico é o chatbot Tay, da Microsoft, que em 2016 publicou no Twitter mensagens racistas e com teor sexual. Mais recentemente, Wallace et al. descobriram que um único gatilho inserido em qualquer entrada pode fazer o GPT-2 produzir saídas racistas mesmo em contextos não raciais. No mesmo experimento, outro gatilho fez o modelo SQuAD responder a todas as perguntas “por quê” com “para matar o povo americano”.
No mesmo sentido, os dados de treino podem ser envenenados, colocando em risco aplicações que dependem desses modelos. De forma alarmante, Schuster et al. mostraram que um sistema de autocompletar código pode ser induzido a gerar código inseguro com a injeção de alguns poucos arquivos maliciosos. É plausível que outros modelos generativos também possam ser treinados a produzir conteúdo nocivo por meio de injeções maliciosas.
Os próprios provedores dos modelos podem falhar. Hoje, o GPT-3 exige que os praticantes enviem a dados usados na inferência para a OpenAI. Uma violação desses dados potencialmente sensíveis seria uma violação de privacidade. Muitos modelos também são servidos diretamente pela infraestrutura da HuggingFace. Um ataque à infraestrutura comum pode derrubar inúmeros modelos em produção.
Esses riscos se amplificam quando o modelo base pré-treinado é muito popular. Se um adversário encontra uma brecha em um modelo famoso, pode explorar outras aplicações que compartilham a mesma base.
A falta de interpretabilidade
Interpretabilidade é o grau em que um humano consegue entender a causa de uma decisão. Infelizmente, muitos modelos de NLP ainda estão longe do ideal nesse quesito.
Large language models são caixas-pretas que oferecem pouca ou nenhuma visibilidade sobre como chegam a uma decisão. Pode ser imprudente tomar decisões de alto risco sem compreender o processo. Por exemplo, um sistema de NLP usado para conceder ou negar liberdade condicional precisa explicar suas decisões com base em fatos. Essas explicações permitem auditar a justiça e a consistência do modelo.
É verdade que existem métodos de IA explicável que geram explicações de comportamento de modelos. São modelos distintos, projetados para explicar uma caixa-preta. Exemplos incluem a Language Interpretability Tool (LIT), do Google, e o LIME.

Demo do LIT, do Google (fonte)
Ainda assim, essas explicações podem ser infiéis e não refletir com precisão o raciocínio por trás da previsão. Podem ser pouco confiáveis, enganosas e perigosas. Explicações plausíveis porém infiéis podem dar uma falsa sensação de segurança e levar profissionais a confiar em modelos frágeis, como argumenta o paper “Stop Explaining Black-Box Machine Learning Models for High Stake Decisions and Use Interpretable Models Instead”.
Large language models vão transformar o futuro da IA
“Estamos só no começo de uma mudança de paradigma: os large language models começaram a transformar a forma como sistemas de IA são construídos e implantados no mundo”, concluiu um grupo de renomados pesquisadores ao discutir as oportunidades e os riscos dos large language models.
Os casos de uso viabilizados por esses modelos são realmente impressionantes. Mas nem tudo que reluz é ouro. Como profissionais de IA, precisamos estar atentos às limitações e usar esses modelos com responsabilidade e cuidado. Só assim vamos destravar todo o seu potencial.
Saiba mais sobre processamento de linguagem natural:
