Scaling Laws
探索 AI 中的神经缩放定律和测试时计算。了解资源扩展与优化如何指导包括全新 Ultralytics YOLO26 在内的模型。
在人工智能领域,对神经网络缩放的经验观察表明,随着计算能力、数据集规模和参数数量等特定资源的增加,模型性能会以可预测的方式提升。由 OpenAI 和 Google DeepMind 等组织的研究率先推广的这些幂律关系表明,扩大资源规模会使交叉熵损失以数学上可预测的方式降低。理解这些原理后,研究人员和工程师可以高效地分配数百万美元的预算,在启动大规模训练之前,准确预测需要多大的神经网络才能达到目标准确率。
预训练缩放的演变#
这些规则最初的表述被称为 2020 年提出的Kaplan 缩放定律,其确立了语言模型性能会随着训练计算量的增加而平稳扩展。随后,2022 年的Chinchilla 缩放定律对这一框架进行了完善,揭示了要实现最优训练,模型规模和训练数据必须按相同比例扩展。例如,如果将模型的参数量加倍,也必须将训练词元数量加倍。这一范式成功指导了使用 PyTorch 和 TensorFlow 等框架构建现代大型语言模型 (LLMs),确保大规模 GPUs 集群得到有效利用,同时避免过拟合或计算资源浪费。
范式转变:测试时计算缩放#
正如年度 AI 进展报告所强调的,2024 至 2025 年间,AI 行业经历了向推理时缩放的大幅转变。随着预训练更大模型开始面临收益递减和数据可用性瓶颈,研究人员发现可以直接扩展 LLM 的测试时计算量。通过在推理期间为模型提供更多处理能力,可以显著提升其复杂推理能力。
思维链 (CoT) 和 Best-of-N 采样等技术允许模型在作答前探索多条路径。这一测试时缩放定律由 OpenAI 的 o1 和 DeepSeek-R1 等先进模型以及其他高级推理模型率先实践,证明了增加预测阶段的计算量,可以让规模小得多且效率更高的架构在严格的逻辑基准测试中超越庞大的传统模型。
实际应用#
缩放原则的影响远不止文本生成,还深刻决定着现代计算机视觉和目标检测流程。
- 基础模型的资源分配: 开发自动驾驶系统的公司依靠缩放公式准确计算所需的标注图像数量,从而将平均精度均值 (mAP)误差率降低到安全且适合生产部署的水平。通过利用 Ultralytics 平台进行协作式数据标注和基于云的分布式训练,团队可以在部署前用数学方法预测成本。
- 模型规模确定与边缘部署: 缩放公式直接影响现代模型(如 Ultralytics YOLO26)的架构设计。通过提供一个从 Nano (n) 到 Extra Large (x) 按数学规律缩放的统一模型系列,开发者可以根据具体边缘硬件的限制,在严格的准确率要求与推理延迟之间进行可预测的权衡。
代码示例:计算机视觉中的推理时缩放#
在计算机视觉中,你可以利用一种实用的测试时缩放形式,即测试时增强 (TTA)。在预测阶段投入额外计算资源,对图像的多个增强版本进行评估,模型就能以可预测的方式提升检测置信度,这与高级 LLM 中采用的推理搜索技术相似。
from ultralytics import YOLO
# Load the recommended YOLO26 model (nano version for high speed)
model = YOLO("yolo26n.pt")
# Perform standard inference (faster, lower test-time compute)
results_standard = model("https://ultralytics.com/images/bus.jpg")
# Perform inference-time scaling via Test-Time Augmentation (TTA)
# Predictably improves accuracy by utilizing more compute during prediction
results_tta = model("https://ultralytics.com/images/bus.jpg", augment=True)
print(f"Standard detections: {len(results_standard[0].boxes)}")
print(f"Scaled TTA detections: {len(results_tta[0].boxes)}")缩放定律与相关概念的比较#
虽然 AI 缩放规则与硬件能力密切相关,但它们具体衡量的是软件和算法相对于硬件的效率。






