计算机视觉中使用的 AI 学习技术类型
探索计算机视觉应用中使用的不同机器学习和深度学习技术,从监督学习到迁移学习。

Machine learning 是一种人工智能 (AI),它能帮助计算机从数据中学习,从而无需针对每个任务进行详细编程即可自行做出决策。它包含构建能够识别数据中模式的算法模型。通过识别数据中的模式并从中学习,这些算法可以随着时间的推移逐渐提高其性能。
Machine learning 发挥关键作用的一个领域是computer vision,这是一个专注于visual data的 AI 领域。Computer vision 利用机器学习来帮助计算机检测和识别图像及视频中的模式。在机器学习进步的推动下,computer vision 的global market value预计到 2032 年将达到约 1,757.2 亿美元。
在本文中,我们将探讨 computer vision 中使用的不同类型机器学习,包括监督学习、无监督学习、强化学习和迁移学习,以及每种学习在不同应用中的作用。让我们开始吧!
计算机视觉中的机器学习概述#
Computer vision 依赖于机器学习,尤其是deep learning和neural networks等技术,来解释和分析视觉信息。这些方法使计算机能够执行computer vision tasks,例如detecting objects(检测图像中的对象)、classifying images(按类别对图像进行分类)和recognizing faces(识别人脸)。机器学习对于实时 computer vision applications(例如manufacturing中的quality control和healthcare中的medical imaging)也至关重要。在这些情况下,neural networks帮助计算机解释复杂的视觉数据,例如analyzing brain scans以detect tumors。
事实上,许多高级 computer vision 模型(如 Ultralytics YOLO11)都是构建在神经网络之上的。

图 1. 使用 Ultralytics YOLO11 分割脑部扫描。
机器学习中有几种学习方法,如监督学习、无监督学习、迁移学习和强化学习,它们正在突破计算机视觉的可能性边界。在接下来的章节中,我们将探索每种类型,以了解它们如何对计算机视觉做出贡献。
探索监督学习#
Supervised learning 是最常用的机器学习类型。在 supervised learning 中,模型使用labeled data进行训练。每个输入都附带正确的输出标签,这有助于模型学习。类似于student learning接受老师的指导,这些带标签的数据就像一个向导或监督者。
在training期间,模型会获得输入数据(需要处理的信息)和输出数据(正确的答案)。这种设置有助于模型学习输入和输出之间的联系。supervised learning 的主要目标是让模型发现将每个输入准确链接到其正确输出的规则或模式。通过这种映射,模型在遇到新数据时可以做出准确的预测。例如,computer vision中的面部识别依赖于 supervised learning,根据这些学习到的模式来识别人脸。
一个常见的用法是使用面部识别解锁smartphone。模型会在你面部的带标签图像上进行训练,以便在你去解锁手机时,将实时图像与它学到的内容进行比较。如果检测到匹配,你的手机就会解锁。

Fig 2. 面部识别可用于解锁你的智能手机。
无监督学习在 AI 中是如何工作的?#
Unsupervised learning 是一种使用未标记数据的机器学习类型——在训练期间不会为模型提供任何指导或正确答案。相反,它通过自行探索来发现模式和见解。
无监督学习使用三种主要方法识别模式:
- Clustering:将相似的数据点组合在一起。它适用于诸如customer segmentation等任务,在此任务中,可以根据相似客户的behaviors或属性将其归为一组。
- Association:用于识别项目之间的关系,有助于揭示数据中的联系(例如,在market basket analysis中寻找经常一起购买的产品)。
- Dimensionality reduction:通过移除冗余特征来简化数据集,这有助于可视化和处理。
unsupervised learning 的一个关键应用是image compression,其中k-means clustering等技术可以在不影响视觉质量的情况下减小图像大小。像素被分组到各个集群中,每个集群由一个平均颜色表示,从而产生颜色更少且文件大小更小的图像。

图 3. 无监督图像压缩示例。
然而,unsupervised learning 确实面临一定的局限性。在没有预定义答案的情况下,它在准确性和performanceevaluation(评估)方面可能会遇到困难。它通常需要人工投入来解释结果和对群组进行标记,并且它对缺失值和噪声等问题很敏感,这会影响结果的质量。
强化学习详解#
与监督学习和无监督学习不同,reinforcement learning不依赖于训练数据。相反,它使用神经网络智能体与环境交互以实现特定目标。
该过程涉及三个主要组件:
- 代理:学习者或决策者。
- 环境:代理与之交互的一切,可以是现实的也可以是虚拟的。
- 奖励信号:在每次动作后给出的数值,引导代理向目标前进。
当代理采取行动时,它会影响环境,环境随后会做出反馈。反馈帮助代理评估其选择并调整其行为。奖励信号帮助代理理解哪些动作能使其更接近目标。
reinforcement learning 对于autonomous driving和robotics等用例至关重要。在autonomous driving中,车辆控制、对象检测和避障等任务是根据反馈进行学习的。模型通过神经网络智能体进行训练,以检测行人或其他对象并采取适当的行动来avoid collision。同样,在robotics中,reinforcement learning 实现了对象操作和运动控制等任务。
reinforcement learning 实际应用的一个绝佳例子是 OpenAI 的一个项目,研究人员在其中trained AI agents来玩热门的多人video game《Dota 2》。这些智能体利用神经网络,处理来自game environment的大量信息,以做出快速的战略决策。通过不断反馈,智能体不断学习和改进,最终达到足以击败game’s top players(游戏顶级玩家)的技能水平。

Fig 4。人与 AI 对 Dota 矩阵的解读。
了解迁移学习的基础知识#
Transfer learning is different from other types of learning. Instead of training a model from scratch, it uses a pre-trained model on a large dataset and fine-tunes it for a new, but related, task. The knowledge gained during the initial training is used to improve the performance of the new task. Transfer learning reduces the time required to train for a new task, depending on its complexity. It works by retaining the initial layers of the model that capture the general features and replacing the final layers with that of the new specific task.
艺术风格迁移是 transfer learning 在 computer vision 中的一个有趣应用。该技术使模型能够转换图像以匹配不同artwork(艺术品)的风格。为了实现这一点,首先要在配有其艺术风格的大型图像数据集上对神经网络进行训练。通过此过程,模型学会识别通用的图像特征和风格模式。
模型训练完成后,可以进行微调以将特定绘画的风格应用于新图像。网络在适应新图像的同时保留学习到的风格特征,从而创造出一种将原始内容与选定艺术风格相结合的独特结果。例如,你可以拍摄一张山脉的照片并应用爱德华·蒙克 (Edvard Munch) 的《呐喊》(The Scream) 的风格,从而得到一张既捕捉了场景又带有画作大胆、表现力风格的图像。

Fig 5. 使用 transfer learning 进行艺术风格迁移的示例。
机器学习类型之间的差异一览#
现在我们已经涵盖了主要的机器学习类型,让我们仔细观察每一种,以帮助你了解最适合不同应用的类型。
- 监督学习:这种类型在处理标记数据时非常准确,但需要大量数据,并且可能对噪声敏感。
- 无监督学习:它对于探索未标记数据以发现隐藏模式非常有用,尽管结果可能不够精确且更难解读。
- 强化学习:它训练代理在复杂环境中进行逐步决策,但通常需要大量的计算能力。
- 迁移学习:这种方法使用预训练模型来加速训练并在新任务上提高性能,尤其是在数据有限的情况下。

图 6. 所有机器学习类型的比较。图片来源:作者。
选择正确的机器学习类型取决于几个因素。如果你拥有丰富带标签的数据和清晰的任务,supervised learning 效果很好。unsupervised learning 适用于数据探索,或者在带标签的示例很少时使用。reinforcement learning 是需要逐步决策的复杂理想选择,而 transfer learning 在数据有限或资源受限时非常棒。通过权衡这些因素,你可以为你的computer vision project选择最合适的方法。
总结#
机器学习技术可以解决各种挑战,尤其是在计算机视觉等领域。通过了解监督学习、无监督学习、强化学习和迁移学习这几种不同类型,你可以选择最适合你需求的方法。
监督学习非常适合需要高精度和标记数据的任务,而无监督学习是寻找未标记数据中模式的理想选择。强化学习在复杂的、基于决策的环境中运行良好,而当你想要基于具有有限数据的预训练模型进行构建时,迁移学习非常有用。
每种方法都有独特的优势和应用,从人脸识别到机器人技术再到艺术风格迁移。选择合适的类型可以在医疗保健、汽车和娱乐等行业开启新的可能性。
要探索更多内容,请访问我们的GitHub 仓库,并与我们的社区互动。在我们的解决方案页面上探索自动驾驶汽车和农业中的 AI 应用。🚀






