Tecnologia do Basquete & IA

Como Avaliar um Coach de Basquete com IA: Um Framework Confiável

Diagrama de avaliação de IA com uma matriz TP FP FN TN e fórmulas para precisão, revocação e acurácia

A versão resumida: Este guia discute a avaliação de sistemas de treinamento de IA, aproveitando o NIST AI Risk Management Framework e as principais métricas de aprendizado de máquina.

Principais aprendizados

  • O NIST AI Risk Management Framework oferece uma abordagem voluntária e estruturada para avaliar a confiabilidade da IA.
  • A acurácia padrão é frequentemente uma métrica enganosa para avaliar o desempenho da IA em conjuntos de dados desbalanceados.
  • Revocação e precisão fornecem medidas matematicamente precisas das taxas de detecção e da qualidade da previsão.
  • Uma avaliação completa requer a análise de falsos positivos, falsos negativos e cartões de modelo transparentes.

Como Estabelecemos Confiabilidade em Sistemas de Coaching com IA?

De acordo com o AI RMF - AIRC, o AI Risk Management Framework (AI RMF) destina-se ao uso voluntário e a melhorar a capacidade de incorporar considerações de confiabilidade no projeto, desenvolvimento, uso e avaliação de produtos, serviços e sistemas de IA. De acordo com o AI RMF - AIRC, esta estrutura foi desenvolvida de forma aberta, transparente, multidisciplinar e com múltiplos stakeholders ao longo de um período de 18 meses e em colaboração com mais de 240 organizações contribuintes. AI RMF - AIRC

Identificar e gerenciar riscos de IA e impactos potenciais requer um amplo conjunto de perspectivas e atores em todo o ciclo de vida da IA. Para que os sistemas de IA sejam confiáveis, eles geralmente precisam ser responsivos a uma multiplicidade de critérios que são de valor para as partes interessadas. Abordagens que aumentam a confiabilidade da IA podem reduzir riscos negativos de IA. sistemas de coaching de IA

Quais são as Funções Essenciais e os Perfis do Gerenciamento de Risco de IA?

De acordo com o AI RMF - AIRC, o Núcleo do AI RMF fornece resultados e ações que permitem o diálogo, a compreensão e atividades para gerenciar riscos de IA e desenvolver de forma responsável sistemas de IA confiáveis. Isso é operacionalizado através de quatro funções: Governar, Mapear, Medir e Gerenciar. roteiro prático para compradores de tecnologia

De acordo com o AI RMF - AIRC, os Perfis de caso de uso são implementações das funções, categorias e subcategorias do AI RMF para um ambiente ou aplicação específica, com base nos requisitos, tolerância a riscos e recursos do usuário da Estrutura. De acordo com o NIST, o NIST lançou o NIST-AI-600-1, Estrutura de Gerenciamento de Risco de Inteligência Artificial: Perfil de Inteligência Artificial Generativa, em 26 de julho de 2024. De acordo com o NIST, o Perfil de IA Generativa ajuda as organizações a identificar riscos únicos apresentados pela IA generativa e propõe ações para o gerenciamento de riscos da IA generativa. Estrutura de Gerenciamento de Risco de IA | NIST

De acordo com o AI Risk Management Framework | NIST, em 30 de março de 2023, o NIST lançou o Centro de Recursos de IA Confiável e Responsável. Este centro de recursos facilitará a implementação e o alinhamento internacional com o AI RMF. Além disso, em 7 de abril de 2026, o NIST divulgou uma nota conceitual para um Perfil AI RMF sobre IA Confiável em Infraestrutura Crítica.

Como as Métricas de Machine Learning Diferem da Linguagem Comum?

Em aprendizado de máquina, palavras como recall, precisão e acurácia possuem definições matemáticas que podem diferir, ou ser mais específicas, dos significados mais comumente usados das palavras. Verdadeiros e falsos positivos e negativos são usados para calcular várias métricas úteis para avaliar modelos. Classificação: Acurácia, recall, precisão e métricas relacionadas | Machine Learning | Google for Developers

Quais métricas de avaliação são mais significativas depende do modelo específico e da tarefa específica, do custo de diferentes classificações incorretas e se o conjunto de dados é balanceado ou desbalanceado. As métricas que você escolhe priorizar ao avaliar um modelo e escolher um limite dependem dos custos, benefícios e riscos do problema específico. De acordo com Model cards — Google DeepMind, os cartões de modelo são visões gerais simples e estruturadas de como um modelo avançado de IA foi projetado e avaliado. Model cards — Google DeepMind

Por que a Acurácia Padrão é Enganosa em Conjuntos de Dados Desbalanceados?

A acurácia deve ser usada como um indicador aproximado do progresso ou convergência do treinamento do modelo para conjuntos de dados balanceados, mas evitada para conjuntos de dados desequilibrados. Quando um conjunto de dados é desequilibrado, ou onde um tipo de erro é mais custoso do que o outro, é melhor otimizar para outras métricas que não a acurácia.

Para conjuntos de dados altamente desequilibrados onde uma classe aparece muito raramente, digamos 1% das vezes, um modelo que prevê negativo 100% das vezes atingiria 99% de acurácia, apesar de ser inútil. detectar movimentos críticos e raros

O que é Recall e por que ele importa para a Detecção?

O recall, ou taxa de verdadeiros positivos (TPR), é a proporção de todos os positivos reais que foram classificados corretamente como positivos. Matematicamente, o recall é definido como os positivos reais classificados corretamente divididos por todos os positivos reais, ou TP / (TP + FN).

Falsos negativos são positivos reais que foram classificados incorretamente como negativos, razão pela qual aparecem no denominador da fórmula de recall. Um modelo hipotético perfeito teria zero falsos negativos e, portanto, um recall de 1.0, representando uma taxa de detecção de 100%. Na prática, o recall deve ser priorizado quando falsos negativos são mais caros do que falsos positivos.

Como a Precisão e as Taxas de Falsos Positivos Impactam a Usabilidade?

A precisão é a proporção de todas as classificações positivas do modelo que são realmente positivas. Matematicamente, a precisão é definida como os positivos reais classificados corretamente divididos por tudo o que foi classificado como positivo, ou TP / (TP + FP). Um modelo hipotético perfeito teria zero falsos positivos e, portanto, uma precisão de 1.0.

Por outro lado, um modelo que nunca prevê positivo teria 0 TPs e 0 FPs, resultando em um cálculo de precisão de NaN. A precisão deve ser priorizada quando for muito importante que as previsões positivas sejam precisas.

A taxa de falsos positivos (FPR) é a proporção de todos os negativos reais que foram classificados incorretamente como positivos, também conhecida como a probabilidade de falso alarme. A FPR é matematicamente definida como negativos reais classificados incorretamente divididos por todos os negativos reais, ou FP / (FP + TN). Falsos positivos são negativos reais que foram classificados incorretamente, razão pela qual aparecem no denominador da fórmula da taxa de falsos positivos (FPR).

Um modelo perfeito teria zero falsos positivos e, portanto, um FPR de 0.0, representando uma taxa de alarme falso de 0%. Para um conjunto de dados desequilibrado, o FPR é geralmente uma métrica mais informativa do que a acurácia. Essa taxa deve ser priorizada quando os falsos positivos são mais caros do que os falsos negativos.

No entanto, se o número de negativos reais for muito baixo, o FPR pode não ser uma escolha ideal devido à sua volatilidade. Por exemplo, se houver apenas quatro negativos reais em um conjunto de dados, uma única classificação incorreta resulta em um FPR de 25%, enquanto uma segunda classificação incorreta faz com que o FPR salte para 50%.

Como Aplicamos Métricas de Classificação a Exemplos Práticos?

Para entender como essas métricas funcionam em um cenário do mundo real, podemos analisar um exemplo padrão de classificação de spam. Nesse contexto, o recall mede a fração de e-mails de spam que foram corretamente classificados como spam. É por isso que outro nome para recall é a probabilidade de detecção, pois responde à pergunta de qual fração de e-mails de spam é detectada pelo modelo.

No mesmo exemplo de classificação de spam, a taxa de falsos positivos (FPR) mede a fração de e-mails legítimos que foram incorretamente classificados como spam, representando a taxa de falsos alarmes do modelo. A precisão mede a fração de e-mails classificados como spam que eram realmente spam. Ao avaliar tal sistema, muitas vezes faz sentido priorizar o recall, a precisão ou um certo equilíbrio entre os dois, acima de um nível mínimo de acurácia.

Perguntas frequentes

Qual a diferença entre revocação e precisão na avaliação de IA?

O recall, ou taxa de verdadeiros positivos, é a proporção de todos os positivos reais que foram classificados corretamente como positivos. A precisão, por outro lado, é a proporção de todas as classificações positivas do modelo que são realmente positivas.

Por que a acurácia é uma métrica ruim para conjuntos de dados desbalanceados?

A acurácia deve ser evitada para conjuntos de dados desequilibrados porque um modelo pode ter uma pontuação alta sendo inútil. Por exemplo, se uma classe rara aparece apenas 1% das vezes, um modelo que prevê negativo 100% das vezes atinge 99% de acurácia.

Quais são as quatro funções principais do NIST AI Risk Management Framework?

De acordo com o AI RMF - AIRC, o AI RMF Core é operacionalizado através de quatro funções: Governar, Mapear, Medir e Gerenciar. O AI RMF Core fornece resultados e ações que permitem o diálogo, a compreensão e atividades para gerenciar riscos de IA e desenvolver de forma responsável sistemas de IA confiáveis.

Perguntas frequentes

Qual a diferença entre revocação e precisão na avaliação de IA?

O recall, ou taxa de verdadeiros positivos, é a proporção de todos os positivos reais que foram classificados corretamente como positivos. A precisão, por outro lado, é a proporção de todas as classificações positivas do modelo que são realmente positivas.

Por que a acurácia é uma métrica ruim para conjuntos de dados desbalanceados?

A acurácia deve ser evitada para conjuntos de dados desequilibrados porque um modelo pode ter uma pontuação alta sendo inútil. Por exemplo, se uma classe rara aparece apenas 1% das vezes, um modelo que prevê negativo 100% das vezes atinge 99% de acurácia.

Quais são as quatro funções principais do NIST AI Risk Management Framework?

De acordo com o AI RMF - AIRC, o AI RMF Core é operacionalizado através de quatro funções: Governar, Mapear, Medir e Gerenciar. O AI RMF Core fornece resultados e ações que permitem o diálogo, a compreensão e atividades para gerenciar riscos de IA e desenvolver de forma responsável sistemas de IA confiáveis.