機械学習におけるAccuracy、Precision、Recallの比較
機械学習におけるAccuracy、Precision、Recallについて解説します。混同行列、F1スコア、これらの重要な評価指標の使用方法を紹介します。

機械学習(ML)は、データから学習するシステムの作成に重点を置く人工知能(AI)の一分野です。画像を解釈するコンピュータービジョンや、人間の言語を理解して生成する自然言語処理など、AIの多くの分野で中心的な役割を果たしています。
このようなAIモデルでは、データから予測を行うためにディープラーニング技術が使われることがよくあります。このようなシステムは非常に効果的ですが、常に正しい予測を生成するとは限りません。正確な出力もあれば、目標を外す出力もあります。
このような誤りがどのように発生するかを把握することは、モデルの性能を評価するうえで重要です。性能を測定するには、モデル評価指標を使用できます。
一般的な評価指標には、Accuracy(全体的な正確さ)、Precision(陽性予測の信頼性)、Recall(実際の陽性をモデルがどの程度適切に識別できるか)があります。一見似ているように見えますが、それぞれモデルの挙動の異なる側面に焦点を当てています。
この記事では、これらのAIモデルの性能指標をそれぞれ詳しく見ていきます。また、各指標がどのように関連し、ユースケースに適した指標をどのように選択するかについても説明します。早速始めましょう。
機械学習でモデル評価指標が重要な理由#
機械学習モデルは、最初は良好に動作しているように見えるかもしれません。しかし、適切な評価指標がなければ、その結果がどの程度正確なのかを理解することは困難です。これらの指標はモデル評価に構造を与え、重要な問いに答えるのに役立ちます。そのモデルの予測は、特定のタスクに対して有用で信頼できるでしょうか。
Accuracy、Precision、Recallなどの指標を使うと、AI開発者はモデルがどの程度適切に動作しているかを明確に測定できます。例えば、異なるモデルを比較する際、これらの指標によって特定のタスクで最も優れた性能を発揮するモデルを確認できます。性能の評価に役立つだけでなく、AIプロジェクトの目標に最適なモデルの選択も支援します。

図1. モデルのトレーニングと評価のワークフロー(出典)
これらの指標によって、性能比較もより客観的になります。推測や不完全な観察に頼るのではなく、さまざまな状況でモデルがどのように動作するかについて、測定可能な洞察が得られます。これにより、それぞれの状況でどの性能側面が最も重要かが明らかになります。
例えば、指標の選択はアプリケーションによって異なることがよくあります。AIヘルスケアアプリケーションでは、陰性を誤って陽性として判定するケースがあっても、できるだけ多くの陽性ケースを特定することが目標であるため、Recallが重要です。一方、メールのスパムフィルターでは、正当なメールをスパムとして誤判定しないよう、Precisionが優先される場合があります。
混同行列:分類指標の基盤#
混同行列は、AIモデルの評価に不可欠な2×2の表です。実際の結果と予測結果(モデルが出す答え)を比較し、予測を4つのカテゴリに分類します。
この比較により、モデルの性能を詳細に把握できます。PrecisionやRecallなどの主要な評価指標は、行列内の値から直接計算されるため、混同行列が基盤となります。
表の行は実際のクラスを、列は予測されたクラスを表します。各セルには、そのカテゴリに該当する結果の件数が示されます。簡単に言えば、正しかった予測の数と、モデルが犯した誤りの種類を示します。
混同行列は、データが不均衡な場合、つまり一部のカテゴリの例が他のカテゴリよりはるかに多い場合に特に役立ちます。また、誤りの種類によってコストが異なる場合にも有用です。
例えば、不正検出では不正行為を発見することが重要ですが、正当な取引を誤って不正として判定することも問題を引き起こします。混同行列を使うと、それぞれの誤りがどの程度の頻度で発生するかが明確になります。
混同行列の要素#
ここでは、混同行列のさまざまな要素について説明します。
- 真陽性(TP): モデルが陽性の事例を正しく予測した場合、真陽性として記録されます。例えば、コンピュータービジョンモデルが画像内の車両を正しく分類するケースです。
- 真陰性(TN): モデルが陰性の事例を正しく識別した場合、真陰性となります。例えば、メール分類器が通常のメッセージをスパムではないと判定するケースです。
- 偽陽性(FP): 実際には陰性の事例を、モデルが誤って陽性と予測した場合、偽陽性が生成されます。タイプIエラーとも呼ばれ、不正検出システムが有効な取引を不正として判定する場合などに発生します。
- 偽陰性(FN): モデルが陽性のケースを検出できず、誤って陰性と予測した場合、偽陰性として記録されます。タイプIIエラーとも呼ばれ、実際には病気である患者の疾患を診断ツールが見逃す場合などに発生します。

図2. 混同行列の要素(出典)
混同行列の視覚的表現と解釈#
混同行列はグリッド形式で表示されます。縦軸は実際のクラスを、横軸は予測されたクラスを示します。正しい予測は対角線上に表示され、真陽性と真陰性を表します。
誤りは対角線の外側に現れ、偽陽性と偽陰性が含まれます。この構造により、強みと弱みを簡単に把握できます。
機械学習におけるAccuracyとは?#
Accuracyは、機械学習モデルの性能を評価するために最も広く使われている指標の1つです。すべてのクラスにわたって、予測がどの程度正しかったかを測定します。言い換えると、AIモデルが行ったすべての予測のうち、正しかったものはいくつあるかという単純な問いに答える指標です。
Accuracyの式は、正しい予測の数(真陽性と真陰性の両方を含む)を予測の総数で割ったものです。Accuracyは計算が簡単で理解しやすいため、モデル評価の一般的な出発点となります。
一般に、Accuracyはバランスの取れたデータセットを扱う場合に信頼できます。ただし、1つのクラスが他のクラスを圧倒する不均衡なデータセットでは、Accuracyが誤解を招くことがあります。多数派クラスだけを常に予測するモデルでも高いAccuracyスコアを達成しながら、他の少数派クラスの検出には失敗する可能性があります。
例えば、歩行者を含む画像がわずかしかない画像データセットでは、すべての画像に対して「歩行者なし」と予測するモデルでも高いAccuracyを達成できますが、実際の歩行者の検出には完全に失敗します。
これは、Accuracyだけではモデルがどのような誤りを犯すのか、またそれがどの程度の頻度で発生するのかが分からないためです。そのため、AIモデルがどの程度適切に動作するかを完全に理解するには、PrecisionやRecallなどの指標も確認することが重要です。
Precisionの詳細:誤警報の最小化#
Precisionは、モデルの陽性予測の正確さを測定する重要な評価指標です。陽性と予測されたすべての事例のうち、正しかったものはいくつあるかという問いに答えます。
Precisionの式は、真陽性の数を真陽性と偽陽性の合計で割ったものです。陽性予測が誤りだった場合に大きなコストが発生する状況で、特に重要になります。

図3. AccuracyとPrecisionの比較(出典)
例えば、不正検出においてPrecisionの低いモデルは、多数の有効な取引を不正として判定し、ユーザーとサポートチームの双方に不要な問題を引き起こす可能性があります。Precisionの高いモデルは、フラグが付いた取引が実際の不正である可能性を高めることで、このリスクを低減します。
Precisionが高いことは望ましいですが、Precisionを重視しすぎるモデルは選択的になりすぎ、実際の陽性ケースを見逃す可能性があります。そのため、性能のバランスを保つために、PrecisionはRecallと併せて確認されることがよくあります。
Recallとは?#
Recallは、実際の陽性ケースをモデルがどの程度適切に識別できるかを測定する指標です。感度または真陽性率とも呼ばれ、実際の陽性事例のうち、モデルが正しく検出できたものはいくつあるかという問いに答えます。
Recallの式は、真陽性の数を真陽性と偽陰性の合計で割ったものです。Recallスコアが高い場合、データ内の実際の陽性ケースの大部分をモデルが捉えていることを示します。
Recallは、状態の検出に失敗すると治療が遅れ、患者を危険にさらす可能性がある医療などの業界で不可欠です。一部の陰性ケースを誤って陽性として判定するとしても、真のケースをすべて特定することが最優先です。
ただし、Recallだけに重点を置くモデルは偽陽性を多く出す可能性があり、その結果Precisionが低下し、モデル全体の効率が損なわれます。信頼性の高いAIモデルの性能には、RecallとPrecisionのバランスが不可欠です。
バランスの取り方:PrecisionとRecallのトレードオフ#
PrecisionとRecallは、反対方向に動くことがよくあります。一方が改善すると、もう一方が低下する場合があります。このトレードオフは、機械学習タスクでよく見られる課題です。
Precisionの高いモデルは、確信がある場合にのみ陽性と予測します。これにより誤警報は減りますが、実際の陽性を見逃す可能性があり、Recallは低下します。すべての陽性を捉えようとするモデルはRecallを高めますが、誤警報が増え、Precisionが低下するリスクがあります。
このトレードオフは、モデルの判定しきい値を調整するとより明確になります。しきい値とは、スコアや確率をアクションまたはラベルに変換するためにシステムが使用する境界値です。しきい値を下げると、システムはより頻繁に陽性として動作するため、Recallが上がる可能性がありますが、Precisionは低下する場合があります。しきい値を上げると逆の効果が生じます。モデルが予測する陽性が減り、Precisionは向上しますが、通常はRecallが低下します。
スパム検出に取り組んでいるとします。モデルは、スパムを受信トレイに通してしまうリスクと、正当なメールをブロックするリスクのバランスを取る必要があります。厳格なフィルターでは一部のスパムを見逃す可能性がある一方、寛容なフィルターでは正当なメッセージを誤ってブロックする可能性があります。適切なバランスは、ユースケースとそれぞれの誤りのコストによって決まります。
Precision–Recall曲線の重要性#
Precision-Recall曲線(PR曲線)は、モデルの判定しきい値が変化したときにPrecisionとRecallがどのように変化するかを示します。各点は、両者の異なるトレードオフを表します。PR曲線は、1つのクラスの出現頻度が他のクラスより大幅に低い不均衡なデータセットで特に有用です。
また、さまざまな判定しきい値でモデルが陽性と陰性をどの程度適切に分離できるかを示す受信者動作特性曲線(ROC曲線)よりも、意味のある洞察を提供します。PrecisionとRecallがともに高いモデルでは、Precision–Recall曲線が右上隅付近に留まり、一般的に理想的な状態となります。
F1-scoreの紹介:バランスのための統合指標#
F1-scoreは、PrecisionとRecallのバランスを1つの値で表します。F1-scoreは、PrecisionとRecallの積を2倍した値を、PrecisionとRecallの合計で割って計算します。偽陽性と偽陰性の両方が重要な場合や、不均衡なデータセットを扱う場合、またモデル性能をバランスよく把握する必要がある場合に有用です。

図4. PrecisionとRecallを使用したF1-scoreの計算(出典)
Accuracy、Precision、Recallを超えて#
Accuracy、Precision、Recallは不可欠ですが、モデルの種類やデータセットの特性に応じて、他の指標からも追加の洞察が得られます。
性能のさまざまな側面の評価に役立つ、一般的に使用される指標を以下に示します。
- Specificity: 実際の陰性をモデルがどの程度適切に識別できるかを測定します。偽陽性の回避が重要な場合に有用です。
- AUC: AUC、つまり曲線下面積は、モデルがクラス間をどの程度適切に識別できるかを表す単一のスコアです。
- Log loss: Log lossは、予測を行う際のモデルの確信度を測定するために使用され、高い確信度で行った誤った予測により大きなペナルティを与えます。ここでいう確信度とは、モデルが自分の予測をどの程度確信しているかを指します。
- マルチラベル評価: マルチラベルタスクでは、モデル全体の性能を反映するため、指標をラベル全体で平均します。
コンピュータービジョンにおけるAccuracy、Precision、Recallの適用#
Accuracy、Precision、Recallについて理解が深まったところで、これらの指標がコンピュータービジョンにどのように適用されるかを見ていきましょう。
Ultralytics YOLO11などのコンピュータービジョンモデルは、画像内に存在する物体を識別し、バウンディングボックスを使って位置を特定する物体検出などのタスクに対応しています。各予測には物体のラベルと位置の両方が含まれるため、ラベルが正しいかどうかを確認するだけの場合よりも評価が複雑になります。

図5. 物体検出にUltralytics YOLO11を使用する例(出典)
カメラを使って棚の商品を自動的に追跡する小売アプリケーションを考えてみましょう。物体検出モデルは、シリアルの箱、ソーダの缶、水のボトルなどのアイテムを識別し、その位置を示します。
この場合、Precisionは検出されたアイテムのうち、実際に正しかったものがいくつあるかを示します。Precisionが高い場合、影や背景の物体を商品としてラベル付けするなどの偽陽性をシステムが回避していることを意味します。Recallは、棚に実際にある商品のうち、モデルが検出できたものがいくつあるかを示します。Recallが高いほど見逃す商品が少なくなるため、正確な在庫数の把握に不可欠です。
Accuracyによって正しさを全般的に測定することもできますが、このような環境では、少数の商品を見逃したり、存在しない商品を検出したりするだけでも在庫管理に大きな影響を与える可能性があります。そのため開発者は、システムが信頼性を備え、実環境で実用的に利用できるよう、Precision、Recall、Accuracyを総合的に確認します。
Accuracy、Precision、Recall:重要なポイント#
Accuracy、Precision、Recallはそれぞれ、機械学習モデルの性能の異なる側面を示します。1つの指標だけに依存すると、誤解を招く可能性があります。
混同行列、Precision–Recall曲線、F1-scoreなどのツールや指標は、トレードオフを明らかにし、MLモデルを改善するための意思決定を支援します。特定のAIソリューションに適した指標の組み合わせを選択することで、実環境のアプリケーションにおいて、モデルの正確性、信頼性、効果を確保できます。
成長を続けるコミュニティをご覧ください。GitHubリポジトリでAIについて詳しく学べます。コンピュータービジョンプロジェクトを始める準備はできていますか?ライセンスオプションをご確認ください。AI in agricultureとvision AI in roboticsについては、ソリューションページをご覧ください。









