篮球技术 & AI

如何评估AI篮球教练:一个可信赖的框架

包含TP FP FN TN矩阵以及精确率、召回率和准确率公式的AI评估图

简而言之:本指南讨论了如何评估人工智能教练系统,并利用NIST人工智能风险管理框架和关键机器学习指标。

核心要点

  • NIST AI风险管理框架提供了一种自愿的、结构化的方法来评估AI的可靠性。
  • 标准准确率在评估不平衡数据集上的AI性能时常常是一个误导性指标。
  • 召回率和精确率提供了检测率和预测质量的数学精确衡量标准。
  • 完整的评估需要分析假阳性、假阴性以及透明的模型卡。

我们如何在AI教练系统中建立信任度?

根据 AI RMF - AIRC,AI 风险管理框架 (AI RMF) 旨在自愿使用,并提高将可信度考量纳入 AI 产品、服务和系统的设计、开发、使用和评估的能力。根据 AI RMF - AIRC,该框架是在 18 个月的时间内,以开放、透明、多学科和多利益相关者的方式,与 240 多个贡献组织合作开发的。AI RMF - AIRC

识别和管理 AI 风险及潜在影响需要 AI 生命周期中广泛的视角和参与者。为了使 AI 系统值得信赖,它们通常需要响应对相关方有价值的多种标准。增强 AI 可信度的方法可以降低负面 AI 风险。AI 篮球训练系统

AI风险管理的核心功能和概况是什么?

根据 AI RMF - AIRC,AI RMF Core 提供了成果和行动,以促进对话、理解和活动,从而管理 AI 风险并负责任地开发值得信赖的 AI 系统。这通过四个功能实现:Govern、Map、Measure 和 Manage。技术采购商的实用路线图

根据AI RMF - AIRC,用例配置文件是AI RMF功能、类别和子类别在特定设置或应用中的实现,基于框架用户的要求、风险承受能力和资源。根据NIST,NIST于2024年7月26日发布了NIST-AI-600-1,《人工智能风险管理框架:生成式人工智能配置文件》。根据NIST,生成式人工智能配置文件帮助组织识别生成式人工智能带来的独特风险,并提出生成式人工智能风险管理的行动方案。AI风险管理框架 | NIST

根据 AI Risk Management Framework | NIST,NIST 于 2023 年 3 月 30 日启动了 Trustworthy and Responsible AI Resource Center。该资源中心将促进 AI RMF 的实施和国际协调。此外,NIST 于 2026 年 4 月 7 日发布了一份关于关键基础设施中值得信赖的 AI 的 AI RMF Profile 概念说明。

机器学习指标与日常语言有何不同?

在机器学习中,召回率 (recall)、精确率 (precision) 和准确率 (accuracy) 等词具有数学定义,这些定义可能与这些词的常用含义不同,或比其更具体。真阳性、假阳性、真阴性和假阴性用于计算评估模型的几个有用指标。分类:准确率、召回率、精确率及相关指标 | 机器学习 | Google for Developers

哪些评估指标最有意义取决于具体的模型和任务、不同错误分类的成本以及数据集是否平衡。您在评估模型和选择阈值时优先考虑的指标取决于特定问题的成本、收益和风险。根据 Model cards — Google DeepMind,模型卡是关于高级 AI 模型如何设计和评估的简单、结构化概述。Model cards — Google DeepMind

为什么标准准确率在不平衡数据集上具有误导性?

准确率应作为平衡数据集模型训练进度或收敛的粗略指标,但对于不平衡数据集则应避免使用。当数据集不平衡,或者某种错误比另一种错误代价更高时,最好优化除准确率之外的其他指标。

对于高度不平衡的数据集,如果某个类别极少出现,例如只占1%的时间,一个100%预测为负的模型将获得99%的准确率,尽管它毫无用处。检测关键的稀有动作

什么是召回率?它为何对检测很重要?

召回率,即真阳性率(TPR),是所有实际正例中被正确分类为正例的比例。在数学上,召回率定义为正确分类的实际正例除以所有实际正例,即TP / (TP + FN)。

假阴性是实际为阳性但被错误分类为阴性的样本,这就是它们出现在召回率公式分母中的原因。一个假设的完美模型将具有零假阴性,因此召回率为 1.0,代表 100% 的检测率。在实践中,当假阴性的成本高于假阳性时,应优先考虑召回率。

精确率和误报率如何影响可用性?

精确率是模型所有正向分类中实际为正例的比例。在数学上,精确率定义为正确分类的实际正例除以所有被分类为正例的项,即TP / (TP + FP)。一个假设的完美模型将没有假阳性,因此精确率为1.0。

反之,一个从不预测为正的模型将有0个真阳性(TP)和0个假阳性(FP),导致精确度计算结果为NaN。当正向预测的准确性非常重要时,应优先考虑精确度。

假阳性率 (FPR) 是所有实际阴性样本中被错误分类为阳性的比例,也称为误报概率。FPR 在数学上定义为错误分类的实际阴性样本除以所有实际阴性样本,即 FP / (FP + TN)。假阳性是实际为阴性但被错误分类的样本,这就是它们出现在假阳性率 (FPR) 公式分母中的原因。

一个完美的模型将没有假阳性,因此FPR为0.0,代表0%的误报率。对于不平衡数据集,FPR通常比准确率更具信息量。当假阳性的代价高于假阴性时,应优先考虑此指标。

然而,如果实际负例的数量非常少,FPR可能不是一个理想的选择,因为它具有波动性。例如,如果数据集中只有四个实际负例,一次错误分类就会导致FPR达到25%,而第二次错误分类则会导致FPR跃升至50%。

我们如何将分类指标应用于实际案例?

为了理解这些指标在实际场景中如何运作,我们可以看一个标准的垃圾邮件分类示例。在这种情况下,召回率衡量的是被正确分类为垃圾邮件的垃圾邮件的比例。这就是召回率又被称为检测概率的原因,因为它回答了模型检测到多少比例的垃圾邮件的问题。

在相同的垃圾邮件分类示例中,假阳性率 (FPR) 衡量的是被错误分类为垃圾邮件的合法电子邮件的比例,代表了模型的误报率。精确率衡量的是被分类为垃圾邮件的电子邮件中实际是垃圾邮件的比例。在评估此类系统时,通常有必要在某个最低准确率水平之上,优先考虑召回率、精确率或两者的某种平衡。

常见问题

AI评估中召回率和精确率有什么区别?

召回率,即真阳性率,是所有实际正例中被正确分类为正例的比例。另一方面,精确率是模型所有正向分类中实际为正例的比例。

为什么准确率是不平衡数据集的糟糕指标?

对于不平衡数据集,应避免使用准确率,因为模型即使得分很高也可能毫无用处。例如,如果一个稀有类别只出现1%的时间,一个100%预测为负的模型将获得99%的准确率。

NIST AI风险管理框架的四个核心功能是什么?

根据AI RMF - AIRC,AI RMF核心通过四个功能实现操作:治理(Govern)、映射(Map)、衡量(Measure)和管理(Manage)。AI RMF核心提供了成果和行动,以促进对话、理解和活动,从而管理人工智能风险并负责任地开发可信赖的人工智能系统。

常见问题

AI评估中召回率和精确率有什么区别?

召回率,即真阳性率,是所有实际正例中被正确分类为正例的比例。另一方面,精确率是模型所有正向分类中实际为正例的比例。

为什么准确率是不平衡数据集的糟糕指标?

对于不平衡数据集,应避免使用准确率,因为模型即使得分很高也可能毫无用处。例如,如果一个稀有类别只出现1%的时间,一个100%预测为负的模型将获得99%的准确率。

NIST AI风险管理框架的四个核心功能是什么?

根据AI RMF - AIRC,AI RMF核心通过四个功能实现操作:治理(Govern)、映射(Map)、衡量(Measure)和管理(Manage)。AI RMF核心提供了成果和行动,以促进对话、理解和活动,从而管理人工智能风险并负责任地开发可信赖的人工智能系统。