Curso
O primeiro uso registrado do termo inteligência artificial ocorreu em uma conferência acadêmica em 1956, em um discurso de John McCarthy, referindo-se à simulação da inteligência humana por máquinas. Por isso, ele é frequentemente creditado como um dos pais fundadores da IA.
Mas a jornada para entender se as máquinas podem pensar começou bem antes disso. Em 1950, por exemplo, o matemático inglês Alan Turing publicou o artigo Computing Machinery and Intelligence, propondo um teste para determinar se um computador é capaz de pensar.
Hoje, as perguntas sobre Inteligência Artificial (IA) são outras. A tecnologia ganhou popularidade com o aumento do volume de dados que produzimos, o avanço dos algoritmos e melhorias significativas no poder de computação. Chegamos ao ponto em que faz sentido considerar as questões éticas e sociais do uso dessas ferramentas.
Embora a IA possa aumentar a eficiência e a produtividade, ela também tem potencial para gerar conteúdo prejudicial, reproduzir vieses e violar a privacidade de dados. Isso desencadeou discussões importantes sobre a prática de construir IA de forma responsável, de modo a empoderar colaboradores, impactar positivamente os clientes e permitir que as empresas escalem a IA com ética.
A evolução do ChatGPT e a moderação de conteúdo
Um dos avanços em IA mais comentados na cultura popular é o ChatGPT. O ChatGPT é um chatbot de IA desenvolvido pela OpenAI para simular interações humanas com os usuários.
O ChatGPT, que por alguns meses deteve o título de serviço online com adoção mais rápida após atingir um milhão de usuários em cinco dias, passou por várias iterações desde sua estreia em junho de 2018.
Na época, o modelo se chamava Generative Pre-trained Transformer 1 (GPT-1). Foi o primeiro large language model (LLM) desenvolvido pela OpenAI, em resposta à invenção da arquitetura transformer pelo Google em 2017. Esse modelo formou as bases do ChatGPT como conhecemos hoje, mas vieram outras iterações até chegarmos lá.
Em 2019, por exemplo, a OpenAI lançou o GPT-2, um modelo mais potente. As atualizações focaram em aprimorar a compreensão de linguagem, o que significou treinar o modelo em um conjunto de dados muito maior e ajustar o acesso para permitir que usuários o personalizassem para seus casos de uso. Logo depois, em 2020, surgiu o GPT-3.
Hoje, o ChatGPT é considerado um dos modelos de linguagem mais poderosos disponíveis. Ele consegue executar tarefas de processamento de linguagem natural, como tradução, completação de texto, respostas a perguntas e geração de texto.
Mas isso não significa que ele não tenha problemas.
O poder e os limites do ChatGPT
O ChatGPT que conhecemos hoje se baseia na arquitetura GPT-3.5, com assinantes pagos tendo acesso ao GPT-4. A principal diferença está no conjunto de dados usado e no fato de ter sido otimizado para casos de uso conversacionais, oferecendo uma experiência mais personalizada quando o usuário interage com o modelo via chat.
Essas mudanças melhoraram a eficiência da comunicação entre humanos e programas de computador. Também transformaram a forma como a informação é processada e consumida, além de aprimorar a experiência do cliente.
Ainda assim, há falhas. Diversos debates recentes jogaram luz sobre o potencial do ChatGPT de gerar respostas inadequadas ou enviesadas. Nosso guia sobre a ética da IA generativa aprofunda esse tema.
A raiz do problema está em como o ChatGPT foi construído: o LLM foi treinado com escritos coletivos de pessoas de perfis diversos. Embora essa diversidade ajude na compreensão do modelo, ela também pode introduzir vieses e preconceitos no que ele produz.
A necessidade de moderação ativa
Moderação ativa de conteúdo é o processo de revisar e monitorar o que os usuários publicam. O objetivo é garantir que esse conteúdo atenda a padrões e diretrizes, protegendo sua marca de associações negativas e evitando que usuários se deparem com materiais ofensivos.
Por exemplo, um aspecto da moderação ativa é remover conteúdos inadequados das plataformas; outro é aplicar as diretrizes da comunidade para prevenir práticas como bullying.
Mecanismos de moderação de conteúdo no ChatGPT
A OpenAI reconheceu o risco do conteúdo gerado por usuários (por exemplo, prejudicar a reputação do aplicativo, causar danos a usuários etc.) e rapidamente ofereceu uma ferramenta para impedir que conteúdos inadequados venham de um modelo de linguagem ou do próprio usuário.
Essa ferramenta é a Moderation API, que permite a desenvolvedores verificar seus conteúdos segundo as políticas de uso da OpenAI. Essas políticas buscam eliminar linguagens inadequadas, como:
- Discurso de ódio
- Linguagem ameaçadora
- Assédio
- Autoagressão (intencão ou instruções)
- Conteúdo gráfico (incluindo pornografia e violência)
No entanto, também é possível que modelos como o ChatGPT emitam saídas enviesadas ou imprecisas quando influenciados por entradas de usuários sem filtro. Por isso, são implementadas medidas de controle para evitar que o modelo espalhe informações falsas sem querer.
Assim, o conteúdo é controlado em duas frentes:
Controle da entrada do usuário
Técnicas para monitorar, filtrar e gerenciar o conteúdo gerado por usuários; o objetivo é permitir que empresas mantenham integridade, segurança e padrões morais ao construir aplicações com LLMs.
Controle da saída do modelo
Essas políticas e procedimentos permitem acompanhar e filtrar as respostas geradas pelo modelo nas interações com usuários, possibilitando que desenvolvedores tratem problemas potenciais na saída, como viés.
Implementar controles de entrada e saída coloca a responsabilidade ética dos LLMs nas empresas: cabe a elas garantir que os usuários tenham uma experiência positiva com seus produtos e serviços e que a IA seja usada de forma responsável.
Métodos de moderação de conteúdo
Existem seis tipos comuns de moderação:
Pré-moderação
Antes de o conteúdo se tornar visível para o mundo, ele precisa ser verificado. Isso é a pré-moderação. A vantagem é que materiais inadequados ou indesejados podem ser barrados antes de causarem danos.
Ela é muito popular em comunidades online voltadas ao público jovem. No entanto, muitos acham que isso tira a gratificação instantânea dessas comunidades, já que o conteúdo precisa ser aprovado antes de ser compartilhado.
Pós-moderação
O oposto da pré-moderação é a pós-moderação. Do ponto de vista da experiência do usuário, ela costuma ser preferida porque permite publicar o conteúdo imediatamente após o envio, entrando depois na fila para moderação.
A grande vantagem é que os usuários podem se comunicar em tempo real, mas o custo pode se tornar proibitivo, já que os operadores do site, que são os responsáveis legais pelo que é exibido na plataforma, respondem pelo conteúdo – quanto mais gente vê materiais destrutivos, maiores podem ser os prejuízos caso a questão seja judicializada.
Moderação reativa
Outra opção é colocar o poder nas mãos da comunidade. Isso significa permitir que usuários sinalizem conteúdos que violem regras ou comportamentos inadequados.
É comum ver a moderação reativa sendo usada junto com a pré ou a pós-moderação, como uma rede de segurança extra para o que escapar dos moderadores. A grande vantagem é que ela escala com o crescimento da comunidade sem sobrecarregar seus recursos.
Moderação distribuída
A moderação distribuída é uma forma rara de filtragem. Ela depende de um sistema de avaliação usado pelos membros para votar se uma submissão está ou não de acordo com as diretrizes da comunidade.
As empresas tendem a evitar transferir para a comunidade a responsabilidade de se automoderar, pois isso traz riscos jurídicos e de imagem.
Moderação automatizada
Com o aumento do conteúdo gerado por usuários, cresce também a complexidade para moderadores humanos darem conta do volume. Além de ser difícil analisar manualmente uma grande quantidade de materiais, isso também é desmotivador: ninguém vai trabalhar animado para lidar com um monte de conteúdo perturbador.
Adicionar moderação automatizada à moderação humana é uma solução valiosa. Ela inclui várias ferramentas técnicas, como filtros de palavras, para rejeitar e aprovar submissões.
Sem moderação
Moderadores provavelmente desaconselhariam a abordagem sem moderação. Ainda assim, entendem que pode haver razões para não moderar o conteúdo de uma comunidade.
Por exemplo, talvez faltem recursos, ou a comunidade valorize ao máximo a ideia de "liberdade de expressão". Na prática, abrir mão da moderação é abrir mão do controle, deixando plataformas vulneráveis — o que costuma afastar novos usuários.
Moderação de conteúdo na prática
A maioria das plataformas hoje, como Facebook e YouTube, usa moderação automatizada para bloquear certos tipos de conteúdo. Normalmente isso envolve IA para aprimorar o esforço de moderação e melhorar a experiência do usuário.
No entanto, embora seja possível à IA detectar conteúdo inadequado e assumir a maior parte do trabalho repetitivo antes feito por humanos, há limitações. As máquinas costumam passar por cima de nuances importantes, como desinformação, viés e discurso de ódio, o que significa que eliminar completamente moderadores humanos não é o ideal.
Em outras palavras, a moderação automatizada com IA geralmente é combinada com moderação humana para manter as plataformas seguras e proteger a marca. Veja alguns exemplos reais:
Conteúdo abusivo
O Twitter (agora X) enfrentou fortes críticas por não responder de forma eficiente ao assédio online. Desde a aquisição por Elon Musk, no entanto, a empresa passou a depender bastante de automação para moderar conteúdo. O resultado são ferramentas como o Quality filter, que usa técnicas como processamento de linguagem natural para limitar a visibilidade de conteúdo de baixa qualidade.
Conteúdo adulto
O YouTube tem uma política rigorosa contra nudez e conteúdo sexual; quem desrespeita pode até ter o canal encerrado. A detecção ocorre de duas formas: moderação automatizada e reativa.
Na abordagem automatizada, o Google emprega algoritmos que usam técnicas como visão computacional para identificar nudez. Se o conteúdo escapar dos algoritmos, o YouTube conta com os espectadores para sinalizar materiais inadequados para revisão.
Conteúdo falso e enganoso
O Instagram usa IA e moderadores humanos para localizar, revisar e agir sobre conteúdos que espalham informações enganosas – algo especialmente evidente durante a pandemia de Covid.
De acordo com o Central de Ajuda do Instagram, “[A] nossa IA pode detectar e remover conteúdo que viole as Diretrizes da Comunidade antes mesmo de qualquer pessoa denunciar. Em outros casos, nossa tecnologia encaminha conteúdo para equipes humanas de revisão analisarem com mais atenção e decidirem o que fazer.”
Conclusão
Ao avançarmos das teorias fundamentais de Turing e McCarthy para as aplicações práticas do ChatGPT, o panorama ético da IA se tornou mais complexo. Embora tecnologias como o ChatGPT tragam um potencial transformador, elas também impõem desafios éticos, incluindo moderação de conteúdo e viés.
A Moderation API da OpenAI é um grande passo rumo à IA responsável, mas não é uma solução única para todos os casos. Empresas e desenvolvedores compartilham a responsabilidade ética de implementar uma abordagem multifacetada, combinando sistemas automáticos com supervisão humana. Exemplos do Twitter e do YouTube mostram a eficácia desse modelo híbrido.
Para se aprofundar em IA responsável, confira nossos materiais: um podcast sobre o futuro da IA responsável, um webinar sobre avaliação de modelos de machine learning em Python e um curso de ética em IA.
A gestão ética da IA é um esforço coletivo que exige vigilância contínua de todos os envolvidos. Conforme expandimos os limites das capacidades da IA, vamos também elevar o padrão ético para garantir que a tecnologia seja uma força para o bem.


