Curso
Bem-vindo à última edição da nossa série mensal Dados sem mistério. Como parte do Data Literacy Month, esta série esclareceu conceitos essenciais do mundo dos dados e tentou responder às perguntas que você talvez tivesse receio de fazer. Se quiser começar do início, leia a primeira edição: O que é um dataset?

Nesta edição, vamos continuar o tema da edição anterior de Dados sem mistério e discutir os efeitos potencialmente nocivos da IA, como ela pode perpetuar vieses contra determinados grupos e os diferentes tipos de vieses em IA que todo mundo precisa conhecer.
O problema dos vieses em IA
A maioria dos sistemas de IA hoje se apoia em machine learning. Machine learning, por definição, aplica técnicas estatísticas avançadas para aprender padrões a partir de dados do passado e fazer previsões sobre eventos futuros.
A adoção em larga escala de machine learning levou a um aumento acentuado de casos em que ele produziu previsões enviesadas. Algoritmos de IA tendenciosos são uma preocupação séria na comunidade e são produto dos dados usados no treinamento do modelo. O viés pode se manifestar de várias formas — pode ser social ou estrutural — e pode ocorrer em relação a gênero, cor, religião ou nacionalidade.
Consequentemente, algoritmos de IA aprendem vieses dos dados de treinamento ao tentar imitar o julgamento humano. Vamos relembrar alguns exemplos do passado em que previsões enviesadas de IA impactaram negativamente a sociedade e a humanidade como um todo:
Viés de gênero: o motor de recrutamento da Amazon
A Amazon desenvolveu um motor de recrutamento para automatizar a triagem de currículos de candidatos para entrevistas. No entanto, o algoritmo refletiu o viés aprendido com os dados históricos e acabou favorecendo apenas perfis de candidatos do sexo masculino.
Viés racial: algoritmo PredPol
O PredPol, ou policiamento preditivo, criou um mapa de calor de áreas com alta atividade criminal e identificou locais com predominância de minorias como zonas críticas. O algoritmo foi treinado com dados de entrada enviesados que continham vários incidentes criminais reportados nessas regiões.
Viés racial: algoritmo COMPAS
O software Correctional Offender Management Profiling for Alternative Sanctions (COMPAS) era usado para avaliar a probabilidade de reincidência de um criminoso. No entanto, a investigação de 2016 mostrou que o algoritmo era tendencioso. O software classificou pessoas negras como mais propensas a reincidir do que pessoas brancas.

Como mostram os exemplos acima, algoritmos de machine learning aprendem vieses dos dados de treinamento além de outras regularidades. Se não for tratado na origem, o viés pode se manifestar em várias etapas dos pipelines de IA/ML. À medida que a IA se dissemina nas organizações e na sociedade, todos precisam conhecer os diferentes tipos de vieses nos sistemas de IA. A seguir, três dos tipos mais comuns.
Três tipos comuns de viés em IA
Viés de preconceito (prejudice bias)
Quando os dados de treinamento refletem preconceitos, estereótipos e suposições sociais existentes, esses vieses ficam incorporados no modelo aprendido — é o chamado viés de preconceito. Por exemplo, quando você pesquisa por “médico”, o resultado traz muitas imagens de médicos homens. Já uma pesquisa por “enfermeira” resulta em imagens de mulheres. Isso diz muito sobre os estereótipos de gênero na sociedade.
Viés de seleção de amostra
O viés de seleção de amostra ocorre quando os dados de treinamento não representam a população estudada. Um exemplo são sistemas de IA treinados para detectar câncer de pele. Se o conjunto de dados original não representar bem a população mais ampla, o sistema terá pior desempenho para membros de um grupo sub-representado no dataset.
Viés de mensuração
O viés de mensuração surge de erros no processo de coleta ou medição dos dados. Por exemplo, se as imagens de uma câmera que alimenta um sistema de reconhecimento de imagens tiverem baixa qualidade, isso pode gerar resultados enviesados contra populações específicas. Outro exemplo vem do julgamento humano. Um algoritmo de diagnóstico médico pode ser treinado para prever a probabilidade de doença com base em métricas proxy, como número de visitas ao médico, em vez de sintomas reais.
Desenvolvendo letramento em dados para uma IA responsável
Ao longo deste mês, destacamos a importância do letramento em dados para indivíduos e organizações. O letramento em dados permite que públicos não técnicos conversem com especialistas em dados e IA e entendam as limitações dos sistemas de IA. Mais importante, promove um diálogo de mão dupla entre especialistas do domínio e especialistas em IA, possibilitando uma discussão cuidadosa sobre os potenciais danos de um sistema de IA.
Para se capacitar com o conhecimento necessário para essas conversas, faça nosso curso Understanding Machine Learning e inicie sua jornada de letramento em dados. Para mais conteúdo sobre letramento em dados e Dados sem mistério, confira estes recursos:

