Pular para o conteúdo principal

Promovendo uma IA responsável: moderação de conteúdo no ChatGPT

Explore o panorama ético da IA com foco na moderação de conteúdo no ChatGPT. Saiba mais sobre a Moderation API da OpenAI, exemplos práticos e boas práticas para um desenvolvimento responsável de IA.
Atualizado 17 de set. de 2026  · 11 min lido

Explorar com IA

ChatGPTClaudePerplexity

O primeiro uso registrado do termo inteligência artificial ocorreu em uma conferência acadêmica em 1956, em um discurso de John McCarthy, referindo-se à simulação da inteligência humana por máquinas. Por isso, ele é frequentemente creditado como um dos pais fundadores da IA.

Mas a jornada para entender se as máquinas podem pensar começou bem antes disso. Em 1950, por exemplo, o matemático inglês Alan Turing publicou o artigo Computing Machinery and Intelligence, propondo um teste para determinar se um computador é capaz de pensar.

Hoje, as perguntas sobre Inteligência Artificial (IA) são outras. A tecnologia ganhou popularidade com o aumento do volume de dados que produzimos, o avanço dos algoritmos e melhorias significativas no poder de computação. Chegamos ao ponto em que faz sentido considerar as questões éticas e sociais do uso dessas ferramentas.

Embora a IA possa aumentar a eficiência e a produtividade, ela também tem potencial para gerar conteúdo prejudicial, reproduzir vieses e violar a privacidade de dados. Isso desencadeou discussões importantes sobre a prática de construir IA de forma responsável, de modo a empoderar colaboradores, impactar positivamente os clientes e permitir que as empresas escalem a IA com ética.

A evolução do ChatGPT e a moderação de conteúdo

Um dos avanços em IA mais comentados na cultura popular é o ChatGPT. O ChatGPT é um chatbot de IA desenvolvido pela OpenAI para simular interações humanas com os usuários.

O ChatGPT, que por alguns meses deteve o título de serviço online com adoção mais rápida após atingir um milhão de usuários em cinco dias, passou por várias iterações desde sua estreia em junho de 2018.

Na época, o modelo se chamava Generative Pre-trained Transformer 1 (GPT-1). Foi o primeiro large language model (LLM) desenvolvido pela OpenAI, em resposta à invenção da arquitetura transformer pelo Google em 2017. Esse modelo formou as bases do ChatGPT como conhecemos hoje, mas vieram outras iterações até chegarmos lá.

Em 2019, por exemplo, a OpenAI lançou o GPT-2, um modelo mais potente. As atualizações focaram em aprimorar a compreensão de linguagem, o que significou treinar o modelo em um conjunto de dados muito maior e ajustar o acesso para permitir que usuários o personalizassem para seus casos de uso. Logo depois, em 2020, surgiu o GPT-3.

Hoje, o ChatGPT é considerado um dos modelos de linguagem mais poderosos disponíveis. Ele consegue executar tarefas de processamento de linguagem natural, como tradução, completação de texto, respostas a perguntas e geração de texto.

Mas isso não significa que ele não tenha problemas.

O poder e os limites do ChatGPT

O ChatGPT que conhecemos hoje se baseia na arquitetura GPT-3.5, com assinantes pagos tendo acesso ao GPT-4. A principal diferença está no conjunto de dados usado e no fato de ter sido otimizado para casos de uso conversacionais, oferecendo uma experiência mais personalizada quando o usuário interage com o modelo via chat.

Essas mudanças melhoraram a eficiência da comunicação entre humanos e programas de computador. Também transformaram a forma como a informação é processada e consumida, além de aprimorar a experiência do cliente.

Ainda assim, há falhas. Diversos debates recentes jogaram luz sobre o potencial do ChatGPT de gerar respostas inadequadas ou enviesadas. Nosso guia sobre a ética da IA generativa aprofunda esse tema.

A raiz do problema está em como o ChatGPT foi construído: o LLM foi treinado com escritos coletivos de pessoas de perfis diversos. Embora essa diversidade ajude na compreensão do modelo, ela também pode introduzir vieses e preconceitos no que ele produz.

A necessidade de moderação ativa

Moderação ativa de conteúdo é o processo de revisar e monitorar o que os usuários publicam. O objetivo é garantir que esse conteúdo atenda a padrões e diretrizes, protegendo sua marca de associações negativas e evitando que usuários se deparem com materiais ofensivos.

Por exemplo, um aspecto da moderação ativa é remover conteúdos inadequados das plataformas; outro é aplicar as diretrizes da comunidade para prevenir práticas como bullying.

Mecanismos de moderação de conteúdo no ChatGPT

A OpenAI reconheceu o risco do conteúdo gerado por usuários (por exemplo, prejudicar a reputação do aplicativo, causar danos a usuários etc.) e rapidamente ofereceu uma ferramenta para impedir que conteúdos inadequados venham de um modelo de linguagem ou do próprio usuário.

Essa ferramenta é a Moderation API, que permite a desenvolvedores verificar seus conteúdos segundo as políticas de uso da OpenAI. Essas políticas buscam eliminar linguagens inadequadas, como:

  • Discurso de ódio
  • Linguagem ameaçadora
  • Assédio
  • Autoagressão (intencão ou instruções)
  • Conteúdo gráfico (incluindo pornografia e violência)

No entanto, também é possível que modelos como o ChatGPT emitam saídas enviesadas ou imprecisas quando influenciados por entradas de usuários sem filtro. Por isso, são implementadas medidas de controle para evitar que o modelo espalhe informações falsas sem querer.

Assim, o conteúdo é controlado em duas frentes:

Controle da entrada do usuário

Técnicas para monitorar, filtrar e gerenciar o conteúdo gerado por usuários; o objetivo é permitir que empresas mantenham integridade, segurança e padrões morais ao construir aplicações com LLMs.

Controle da saída do modelo

Essas políticas e procedimentos permitem acompanhar e filtrar as respostas geradas pelo modelo nas interações com usuários, possibilitando que desenvolvedores tratem problemas potenciais na saída, como viés.

Implementar controles de entrada e saída coloca a responsabilidade ética dos LLMs nas empresas: cabe a elas garantir que os usuários tenham uma experiência positiva com seus produtos e serviços e que a IA seja usada de forma responsável.

Métodos de moderação de conteúdo

Existem seis tipos comuns de moderação:

Pré-moderação

Antes de o conteúdo se tornar visível para o mundo, ele precisa ser verificado. Isso é a pré-moderação. A vantagem é que materiais inadequados ou indesejados podem ser barrados antes de causarem danos.

Ela é muito popular em comunidades online voltadas ao público jovem. No entanto, muitos acham que isso tira a gratificação instantânea dessas comunidades, já que o conteúdo precisa ser aprovado antes de ser compartilhado.

Pós-moderação

O oposto da pré-moderação é a pós-moderação. Do ponto de vista da experiência do usuário, ela costuma ser preferida porque permite publicar o conteúdo imediatamente após o envio, entrando depois na fila para moderação.

A grande vantagem é que os usuários podem se comunicar em tempo real, mas o custo pode se tornar proibitivo, já que os operadores do site, que são os responsáveis legais pelo que é exibido na plataforma, respondem pelo conteúdo – quanto mais gente vê materiais destrutivos, maiores podem ser os prejuízos caso a questão seja judicializada.

Moderação reativa

Outra opção é colocar o poder nas mãos da comunidade. Isso significa permitir que usuários sinalizem conteúdos que violem regras ou comportamentos inadequados.

É comum ver a moderação reativa sendo usada junto com a pré ou a pós-moderação, como uma rede de segurança extra para o que escapar dos moderadores. A grande vantagem é que ela escala com o crescimento da comunidade sem sobrecarregar seus recursos.

Moderação distribuída

A moderação distribuída é uma forma rara de filtragem. Ela depende de um sistema de avaliação usado pelos membros para votar se uma submissão está ou não de acordo com as diretrizes da comunidade.

As empresas tendem a evitar transferir para a comunidade a responsabilidade de se automoderar, pois isso traz riscos jurídicos e de imagem.

Moderação automatizada

Com o aumento do conteúdo gerado por usuários, cresce também a complexidade para moderadores humanos darem conta do volume. Além de ser difícil analisar manualmente uma grande quantidade de materiais, isso também é desmotivador: ninguém vai trabalhar animado para lidar com um monte de conteúdo perturbador.

Adicionar moderação automatizada à moderação humana é uma solução valiosa. Ela inclui várias ferramentas técnicas, como filtros de palavras, para rejeitar e aprovar submissões.

Sem moderação

Moderadores provavelmente desaconselhariam a abordagem sem moderação. Ainda assim, entendem que pode haver razões para não moderar o conteúdo de uma comunidade.

Por exemplo, talvez faltem recursos, ou a comunidade valorize ao máximo a ideia de "liberdade de expressão". Na prática, abrir mão da moderação é abrir mão do controle, deixando plataformas vulneráveis — o que costuma afastar novos usuários.

Moderação de conteúdo na prática

A maioria das plataformas hoje, como Facebook e YouTube, usa moderação automatizada para bloquear certos tipos de conteúdo. Normalmente isso envolve IA para aprimorar o esforço de moderação e melhorar a experiência do usuário.

No entanto, embora seja possível à IA detectar conteúdo inadequado e assumir a maior parte do trabalho repetitivo antes feito por humanos, há limitações. As máquinas costumam passar por cima de nuances importantes, como desinformação, viés e discurso de ódio, o que significa que eliminar completamente moderadores humanos não é o ideal.

Em outras palavras, a moderação automatizada com IA geralmente é combinada com moderação humana para manter as plataformas seguras e proteger a marca. Veja alguns exemplos reais:

Conteúdo abusivo

O Twitter (agora X) enfrentou fortes críticas por não responder de forma eficiente ao assédio online. Desde a aquisição por Elon Musk, no entanto, a empresa passou a depender bastante de automação para moderar conteúdo. O resultado são ferramentas como o Quality filter, que usa técnicas como processamento de linguagem natural para limitar a visibilidade de conteúdo de baixa qualidade.

Conteúdo adulto

O YouTube tem uma política rigorosa contra nudez e conteúdo sexual; quem desrespeita pode até ter o canal encerrado. A detecção ocorre de duas formas: moderação automatizada e reativa.

Na abordagem automatizada, o Google emprega algoritmos que usam técnicas como visão computacional para identificar nudez. Se o conteúdo escapar dos algoritmos, o YouTube conta com os espectadores para sinalizar materiais inadequados para revisão.

Conteúdo falso e enganoso

O Instagram usa IA e moderadores humanos para localizar, revisar e agir sobre conteúdos que espalham informações enganosas – algo especialmente evidente durante a pandemia de Covid.

De acordo com o Central de Ajuda do Instagram, “[A] nossa IA pode detectar e remover conteúdo que viole as Diretrizes da Comunidade antes mesmo de qualquer pessoa denunciar. Em outros casos, nossa tecnologia encaminha conteúdo para equipes humanas de revisão analisarem com mais atenção e decidirem o que fazer.”

Conclusão

Ao avançarmos das teorias fundamentais de Turing e McCarthy para as aplicações práticas do ChatGPT, o panorama ético da IA se tornou mais complexo. Embora tecnologias como o ChatGPT tragam um potencial transformador, elas também impõem desafios éticos, incluindo moderação de conteúdo e viés.

A Moderation API da OpenAI é um grande passo rumo à IA responsável, mas não é uma solução única para todos os casos. Empresas e desenvolvedores compartilham a responsabilidade ética de implementar uma abordagem multifacetada, combinando sistemas automáticos com supervisão humana. Exemplos do Twitter e do YouTube mostram a eficácia desse modelo híbrido.

Para se aprofundar em IA responsável, confira nossos materiais: um podcast sobre o futuro da IA responsável, um webinar sobre avaliação de modelos de machine learning em Python e um curso de ética em IA.

A gestão ética da IA é um esforço coletivo que exige vigilância contínua de todos os envolvidos. Conforme expandimos os limites das capacidades da IA, vamos também elevar o padrão ético para garantir que a tecnologia seja uma força para o bem.


Kurtis Pykes 's photo
Author
Kurtis Pykes
LinkedIn
Tópicos
Inteligência Artificial

Comece a aprender IA hoje mesmo!

Curso

Ética em IA

1 h
151.2K
Explore a ética da IA, com foco em princípios, justiça, redução de vieses e confiança no design de IA.
Ver detalhesRight Arrow
Iniciar Curso
Ver maisRight Arrow
Relacionado

blog

Anthropic vs. OpenAI: Os Dois Gigantes da IA Comparados

Saiba como OpenAI e Anthropic lideram o desenvolvimento de IA com abordagens únicas. Explore produtos como o ChatGPT e os modelos inovadores que elas oferecem.
Khalid Abdelaty's photo

Khalid Abdelaty

15 min

blog

ChatGPT vs Google Bard: Um guia comparativo para chatbots de IA

Uma introdução amigável para iniciantes aos dois chatbots com tecnologia de IA sobre os quais todos estão falando.
Javier Canales Luna's photo

Javier Canales Luna

14 min

blog

10 dos melhores plug-ins do ChatGPT para você obter o máximo da IA em 2024

Desbloqueie todo o potencial do ChatGPT com nosso guia especializado sobre os 10 principais plug-ins para 2023. Aumente a produtividade, simplifique os fluxos de trabalho e descubra novas funcionalidades para elevar sua experiência com o ChatGPT.
Matt Crabtree's photo

Matt Crabtree

12 min

Tutorial

Guia para iniciantes no uso da API do ChatGPT

Este guia o orienta sobre os conceitos básicos da API ChatGPT, demonstrando seu potencial no processamento de linguagem natural e na comunicação orientada por IA.
Moez Ali's photo

Moez Ali

11 min

Tutorial

Um guia para iniciantes na engenharia de prompts do ChatGPT

Descubra como fazer com que o ChatGPT forneça os resultados que você deseja, fornecendo a ele as entradas necessárias.
Matt Crabtree's photo

Matt Crabtree

6 min

Tutorial

Tutorial da API de assistentes da OpenAI

Uma visão geral abrangente da API Assistants com nosso artigo, que oferece uma análise aprofundada de seus recursos, usos no setor, orientação de configuração e práticas recomendadas para maximizar seu potencial em vários aplicativos de negócios.
Zoumana Keita 's photo

Zoumana Keita

14 min

Ver MaisVer Mais