機械学習におけるAccuracy vs. Precision vs. Recall
機械学習におけるAccuracy、Precision、Recallについて学びます。混同行列、F1スコア、およびこれらの重要な評価指標の使用方法を探究します。

機械学習 (ML) は、データから学習するシステムの作成に注力する人工知能 (AI) の一分野です。機械が画像を解釈するcomputer visionや、人間の言語を理解して生成する自然言語処理など、AIの他の多くの領域において中心的な役割を果たしています。
多くの場合、そのようなAIモデルはディープラーニングの手法を用いてデータから予測を行います。これらのシステムは非常に効果的ですが、常に正しい予測を行うわけではありません。正確な出力がある一方で、目標を外すものもあります。
これらのエラーがどのように発生するかを理解することは、モデルのパフォーマンスを評価する上で重要な要素です。パフォーマンスを測定するために、model evaluation metricsを使用できます。
一般的な評価メトリクスには、精度(全体的な正解率)、適合率(ポジティブ予測の信頼性)、および再現率(モデルが実際のポジティブをどれだけ識別できたか)が含まれます。これらは一見似ていますが、それぞれモデルの挙動の異なる側面に焦点を当てています。
本記事では、これら各AIモデルのパフォーマンスメトリクスを詳しく見ていきます。また、それらがどのように関連し合い、ユースケースに適したメトリクスを選択する方法についても解説します。それでは始めましょう!
機械学習においてモデル評価メトリクスは重要です#
machine learningモデルは、最初はうまく機能しているように見えることがあります。しかし、適切な評価指標がないと、その結果がどれほど正確であるかを理解することは困難です。これらの指標はモデル評価に構造を与え、「モデルの予測は特定のタスクにおいて有用かつ信頼できるか?」という重要な疑問に答えるのに役立ちます。
精度、適合率、再現率のようなメトリクスは、AI開発者がモデルの動作状況を測定する明確な方法を提供します。例えば、異なるモデルを比較する際、これらのメトリクスによって特定のタスクに最も適したモデルを見極めることが可能になります。これらはパフォーマンスを評価し、AIプロジェクトの目標に最も適合するモデルを選択するための指針となります。

図 1. モデルのトレーニングと評価のワークフロー (ソース)
これらのメトリクスは、パフォーマンスの比較をより客観的なものにします。推測や不完全な観測に頼る代わりに、さまざまな状況下でモデルがどのように振る舞うかについて測定可能な洞察を提供します。そうすることで、各コンテキストにおいてパフォーマンスのどの側面が最も重要であるかを浮き彫りにします。
たとえば、指標の選択は多くの場合アプリケーションによって異なります。AI healthcare applicationsでは、一部のネガティブなケースが誤ってフラグ付けされたとしても、できるだけ多くのポジティブなケースを特定することが目的であるため、recallが重要になります。対照的に、電子メールのスパムフィルターでは、正当なメールをスパムとして誤ってマークすることを避けるためにprecisionが優先される場合があります。
混同行列:分類メトリクスの基礎#
confusion matrixは、AIモデルを評価する上で基本となる2×2の表です。実際の結果と予測された結果(モデルが与える答え)を比較することにより、予測を4つのカテゴリに整理します。
この比較により、モデルのパフォーマンスに関する詳細な視点が得られます。これは、行列の値から直接計算される適合率や再現率といった重要な評価メトリクスの基礎を形成します。
表の行は実際のクラスを表し、列は予測されたクラスを表します。各セルにはそのカテゴリの成果の数が表示されます。簡単に言えば、何件の予測が正解で、モデルがどのような種類のエラーを犯したかを示しています。
混同行列は、データが不均衡な場合、つまり一部のカテゴリが他のカテゴリよりも多くの例を持っている場合に特に有用です。また、間違いの種類によってコストが異なる場合にも役立ちます。
例えば、不正検知において、不正行為を捕らえることは不可欠ですが、正規の取引を誤ってフラグ付けすることも問題を引き起こす可能性があります。混同行列を使えば、各タイプのエラーがどの程度の頻度で発生するかが明確になります。
混同行列の要素#
混同行列に含まれる各要素の概要は以下の通りです。
- 真陽性 (TP): モデルがポジティブなインスタンスを正しく予測した場合、それは真陽性として記録されます。たとえば、computer vision modelが画像内の車両を正しく分類します。
- 真陰性(TN): 真陰性は、モデルがネガティブなインスタンスを正しく識別したときに発生します。例えば、メール分類器が通常のメッセージを「スパムではない」と判定する場合です。
- 偽陽性(FP): 実際にはネガティブなインスタンスに対して、モデルが誤ってポジティブと予測した場合に偽陽性が発生します。これは第一種の誤りとも呼ばれ、不正検知システムが正規の取引を不正とフラグ付けしてしまうような場合に起こります。
- 偽陰性(FN): 偽陰性は、モデルがポジティブなケースを検出できず、誤ってネガティブと予測した場合に記録されます。第二種の誤りとも呼ばれ、実際に病気にかかっている患者の病気を診断ツールが見逃してしまうような場合に起こる可能性があります。

図 2. 混同行列の要素 (ソース)
混同行列の視覚的表現と解釈#
混同行列はグリッド形式で表示されます。垂直軸が実際のクラス、水平軸が予測されたクラスを表します。正しい予測は対角線上に配置され、真陽性と真陰性を表します。
エラーは対角線の外側に配置され、偽陽性と偽陰性を網羅します。この構造により、強みと弱みを容易に見つけることができます。
機械学習における精度とは何か?#
Accuracyは、機械学習モデルのパフォーマンスを評価するために最も広く使用されている指標の1つです。すべてのクラスにわたって予測がどれだけ正しいかを測定します。言い換えれば、「AIモデルが行ったすべての予測のうち、何個が正しかったか?」という単純な疑問に答えます。
精度の計算式は、正解予測数(真陽性と真陰の両方を含む)を全予測数で割ったものです。精度は計算が単純で理解しやすいため、モデル評価の一般的な出発点となります。
一般的に、精度はバランスの取れたデータセットを扱う場合に信頼できます。しかし、一方のクラスが他方を圧倒しているような不均衡なデータセットでは、精度は誤解を招く可能性があります。常に多数派のクラスを予測するモデルは、他の少数派クラスを検出できなくても高い精度スコアを達成してしまう可能性があるためです。
例えば、歩行者がほとんど写っていない画像データセットにおいて、すべての画像に対して「歩行者なし」と予測するモデルは、高い精度を達成するかもしれませんが、実際の歩行者を検出することには完全に失敗してしまいます。
これは、精度単体ではモデルがどのような種類の間違いを、どれくらいの頻度で犯しているかが示されないためです。そのため、AIモデルがどれだけうまく機能しているかを完全に理解するには、適合率や再現率のようなメトリクスにも注目することが重要です。
適合率の深掘り:誤報の最小化#
Precisionは、モデルのポジティブな予測の正確さを測定する主要な評価指標です。これは、「ポジティブと予測されたすべてのインスタンスのうち、何個が正しかったか?」という疑問に答えます。
適合率の計算式は、真陽性数を真陽性と偽陽性の合計で割ったものです。これは、ポジティブな予測が間違っていた場合に大きなコストがかかるようなケースで特に重要になります。

図 3. 精度と精度の比較 (ソース)
例えば、不正検知において適合率が低いモデルは、多くの正規取引を不正としてフラグ付けしてしまい、ユーザーとサポートチーム双方にとって不要な問題を引き起こします。適合率が高いモデルは、フラグ付けされた取引が実際に不正である可能性を高めることで、このリスクを軽減します。
高い適合率は良いことですが、そればかりを重視するモデルは非常に選択的になりすぎて、実際のポジティブケースを見逃してしまう可能性があります。そのため、パフォーマンスのバランスを保つために、適合率メトリクスは多くの場合、再現率と併せて確認されます。
再現率とは何か?#
Recallは、実際のポジティブなケースをモデルがどれだけうまく識別できるかを測定するために使用される指標です。感度または真陽性率としても知られており、「実際のすべてのポジティブなインスタンスのうち、モデルはいくつを正しく検出したか?」という疑問に答えます。
再現率の計算式は、真陽性数を真陽性と偽陰性の合計で割ったものです。高い再現率スコアは、モデルがデータ内の実際のポジティブケースのほとんどを捉えていることを示します。
再現率は、症状を見逃すと治療が遅れ患者がリスクにさらされる可能性があるヘルスケアのような業界において不可欠です。一部のネガティブケースを誤ってフラグ付けしてしまったとしても、真のケースをすべて特定することが最優先事項となります。
ただし、recallのみに焦点を当てたモデルは、あまりにも多くの偽陽性にフラグを立てる可能性があり、precisionが低下し、モデル全体の効率が損なわれます。信頼性の高いAI model performanceのためには、recallとprecisionのバランスを取ることが不可欠です。
バランス調整:適合率と再現率のトレードオフ#
適合率と再現率はしばしば逆方向に動きます。一方が向上すると、他方が低下することがあります。このトレードオフは機械学習タスクにおける一般的な課題です。
高適合率モデルは、自信がある場合にのみ「ポジティブ」と予測します。これにより誤報は減りますが、実際のポジティブを見逃す可能性があり、結果として再現率が低下します。逆に、すべてのポジティブを捉えようとするモデルは再現率が高まりますが、誤報が増えるリスクがあり、適合率が低下します。
このトレードオフは、モデルの意思決定しきい値を調整するとより明確になります。しきい値とは、システムがスコアや確率をアクションやラベルに変換するために使用するカットオフポイントです。しきい値を下げるとシステムはより頻繁にポジティブとして振る舞うようになり、再現率が上がる可能性がありますが、適合率は下がるかもしれません。逆にしきい値を上げると、モデルはポジティブと予測する回数が減り、適合率は向上しますが、通常再現率は低下します。
例えば、スパム検知に取り組んでいるとします。モデルは、スパムを受信トレイに紛れ込ませるリスクと、正規のメールをブロックしてしまうリスクのバランスを取らなければなりません。厳格なフィルタはスパムを一部見逃す可能性があり、寛容なフィルタは誤って正規のメッセージをブロックしてしまうかもしれません。適切なバランスは、ユースケースと各タイプのエラーのコストによって決まります。
適合率–再現率曲線の重要性#
適合率–再現率曲線(PR曲線)は、モデルの意思決定しきい値が変化するにつれて適合率と再現率がどのように変化するかを示します。各ポイントは、両者間の異なるトレードオフを表しています。PR曲線は、1つのクラスの頻度が非常に少ない不均衡なデータセットにおいて特に有用です。
また、異なる決定閾値でモデルがポジティブとネガティブをどれだけうまく分離できるかも示すReceiver Operating Characteristic (ROC) curveよりも、より意味のある洞察を提供します。precisionとrecallの両方が高いモデルは、右上隅の近くにとどまる適合率-再現率曲線を持つことになり、これは一般的に理想的です。
F1スコアの紹介:バランスのための組み合わせメトリクス#
F1-scoreは、precisionとrecallのバランスを捉える単一の数値を提供します。F1-scoreは、precisionとrecallの積の2倍を、precisionとrecallの和で割って計算されます。偽陽性と偽陰性の両方が重要である場合や、不均衡なデータセットを扱う場合、あるいはモデルのパフォーマンスのバランスの取れたビューが必要な場合に役立ちます。

図 4. 適合率と再現率を使用したF1-scoreの計算 (ソース)
精度、適合率、再現率を超えて#
精度、適合率、再現率は不可欠ですが、モデルの種類やデータセットの特性に応じてさらなる洞察を提供する他のメトリクスも存在します。
パフォーマンスのさまざまな側面を評価するのに役立つ、一般的に使用されるメトリクスをいくつか紹介します:
- 特異度(Specificity): モデルが実際のネガティブをどれだけ識別できたかを測定します。偽陽性を避けることが重要な場合に有用です。
- AUC: AUC(曲線下面積)は、モデルがクラス間をどれだけうまく区別できるかを反映する単一のスコアを提供します。
- 対数損失: 対数損失は、予測を行う際にモデルがどれだけ確信を持っているかを測定するために使用され、高い確信度で行われた誤った予測に対してより多くのペナルティを与えます。ここで、confidenceは、モデルがその予測についてどれほど確信しているかを指します。
- マルチラベル評価: マルチラベルタスクでは、モデル全体のパフォーマンスを反映させるために、ラベル間でメトリクスを平均化します。
コンピュータビジョンにおける精度、適合率、再現率の応用#
精度、適合率、再現率についての理解が深まったところで、これらのメトリクスがコンピュータビジョンでどのように応用されているかを見ていきましょう。
Ultralytics YOLO11などのコンピュータービジョンモデルは、モデルが画像内にどのようなオブジェクトが存在するかを特定し、バウンディングボックスを使用してそれらの位置を特定するオブジェクト検出などのタスクをサポートします。各予測にはオブジェクトのラベルとその位置の両方が含まれるため、単にラベルが正しいかどうかを確認するよりも評価が複雑になります。

図 5. オブジェクト検出に Ultralytics YOLO11 を使用する例 (ソース)
カメラを使用して棚の製品を自動的に追跡するretailアプリケーションを考えてみます。オブジェクト検出モデルは、シリアルボックス、ソーダ缶、ボトルの水などのアイテムを識別し、その位置をマークする場合があります。
この場合、適合率は検出された商品のうちいくつが実際に正しいかを教えてくれます。高い適合率は、影や背景のオブジェクトを商品としてラベル付けするような偽陽性を回避できていることを意味します。再現率は、棚にある実際の商品をモデルがどれだけ検出できたかを示します。高い再現率は見逃しが少ないことを意味し、正確な在庫管理のために極めて重要です。
精度は依然として正解率の一般的な指標となりますが、このような環境では、数個の商品を見逃したり、存在しないものを検出したりするだけで在庫管理に大きな影響を与える可能性があります。そのため、開発者はシステムが信頼に足る実用的なものであることを保証するために、適合率、再現率、精度を組み合わせて確認します。
精度、適合率、再現率:重要なポイント#
精度、適合率、再現率はそれぞれ、機械学習モデルのパフォーマンスの異なる側面を示しています。単一のメトリクスに頼ることは誤解を招く可能性があります。
混同行列、適合率–再現率曲線、F1スコアなどのツールやメトリクスは、トレードオフを明らかにし、MLモデルの改善に関する意思決定を導くのに役立ちます。特定のAIソリューションに対して適切なメトリクスの組み合わせを選択することで、モデルが現実のアプリケーションにおいて正確で信頼性が高く、効果的であることを保証できます。
成長を続けるcommunityを探索してください!AIについて詳しく知るには、GitHub repositoryをチェックしてください。コンピュータービジョンプロジェクトを開始する準備はできましたか?licensing optionsをご覧ください。ソリューションページにアクセスして、AI in agricultureとvision AI in roboticsを発見してください!






