Implicit Neural Representations (INRs)
Örtük Sinirsel Gösterimleri (INR'ler) keşfet. Bu sürekli ağların 3B yeniden yapılandırmayı nasıl dönüştürdüğünü ve Ultralytics YOLO26 ile nasıl bütünleştiğini öğren.
Örtük Sinirsel Temsiller (INRs), görüntüler, ses veya 3B sahneler gibi karmaşık, sürekli sinyallerin pikseller veya vokseller gibi geleneksel ayrık ızgara yapıları yerine bir derin öğrenme (DL) yaklaşımıyla, sinir ağı (NN) kullanılarak parametreleştirildiği modern bir yaklaşımdır. INRs, uzamsal veya zamansal koordinatları doğrudan belirli sinyal değerlerine (ör. renk veya yoğunluk) eşleyerek teorik olarak sonsuz çözünürlüklü görüntü eşlemesi sağlar. Bu zarif matematiksel formülasyon, bilgisayarlı görü (CV) ve üretken yapay zekâ alanlarında devrim yaratarak 3B yeniden yapılandırma, işleme ve veri sıkıştırma alanlarında büyük gelişmeler sağladı.
Örtük Sinirsel Temsiller Nasıl Çalışır?#
Verileri sonlu dizilerde depolayan standart açık temsillerin aksine bir INR, sinyalin temel topolojisini öğrenmek için genellikle bir sürekli matematiksel işlev olan çok katmanlı algılayıcıyı (MLP) kullanır. Örneğin, bir görüntüyü temsil etmek için ağ, girdi olarak 2B piksel koordinatını (x, y) alır ve karşılık gelen RGB rengini çıktı olarak verir. Temsil sürekli olduğundan modeli istenen herhangi bir uzamsal noktada sorgulayabilir ve doğal olarak çözünürlükten bağımsız bir çıktı oluşturabilirsin.
Erken dönem INR araştırmalarındaki yaygın zorluklardan biri, temel ağların keskin kenarlar veya karmaşık dokular gibi yüksek frekanslı ayrıntıları yakalamakta zorlandığı “spektral yanlılık”tı. arXiv gibi akademik kaynaklarda ve IEEE bilgisayarlı görü yayınlarında ayrıntıları verilen son gelişmeler, özel aktivasyon işlevleri (sinüs tabanlı SIREN ağları gibi) veya Fourier özellik kodlaması kullanarak bu sorunu çözüyor. Bu teknikler, modelin karmaşık ve dinamik sahnelerde bile net, yüksek doğruluklu görsel ayrıntıları korumasını sağlıyor.
Gerçek Dünya Uygulamaları#
Sürekli işlevler öğrendikleri için INR'ler, fiziksel ızgara çözünürlüğü sınırlarının hesaplama açısından sorun yarattığı durumlarda büyük avantaj sunar.
- Tıbbi Görüntüleme Rekonstrüksiyonları: Klinik ortamlarda INR'ler, tanı olanaklarını geliştirmek için giderek daha fazla kullanılıyor. INR'ler, seyrek örneklenmiş sensör verilerinden yüksek çözünürlüklü MRI veya CT taramalarını yeniden oluşturabilir. Bu, daha net tanı sonuçları sunarken hastaların maruz kalma süresini kısaltır.
- Yüksek Doğruluklu 3B Sahne Sentezi: INR'ler, modern görüntü sentezi tekniklerinin temel mimarisini oluşturur. Koordinatları ve bakış açılarını değerlendirerek video oyunları veya film yapımları için fotogerçekçi ortamlar oluşturmakta kullanılan hacimsel verileri üretirler.
- Gelişmiş Veri Sıkıştırma: Mühendisler milyonlarca ayrı pikseli veya ses örneğini depolamak yerine yalnızca eğitilmiş model ağırlıklarını aktarabilir. Nature'ın örtük temsiller hakkındaki yayınları, bu yaklaşımın yüksek boyutlu bilimsel verilerin dosya boyutlarını nasıl önemli ölçüde küçülttüğünü gösteriyor.
İlgili Kavramlardan Farkları#
INR'leri anlamak için bu temsilleri, yerleşik diğer temsil yöntemlerinden ayırmak gerekir.
- INR'ler ve Açık Izgara Temsilleri: 3B voksel ızgaraları gibi açık biçimlerin sabit bellek gereksinimi, çözünürlük arttıkça üstel olarak büyür. Buna karşın INR'lerin bellek gereksinimi yalnızca sinir ağının boyutuna bağlıdır ve çıktının uzamsal çözünürlüğünden bağımsız olarak sabit kalır.
- INR'ler ve Sinirsel Işınım Alanları (NeRFs): NeRF, INR'nin belirli bir uygulamasıdır. “INR”, sinir ağlarını kullanarak koordinatları sinyallere eşleme yönteminin genel adıyken NeRF, yeni 3B görünümler sentezlemek için 3B uzamsal koordinatları ve bakış yönlerini renge ve hacim yoğunluğuna eşlemek üzere özellikle bir INR kullanır.
Görüntü İşleme İş Akışlarında INR'lerin Kullanımı#
INR'ler sürekli uzamsal verilerin üretimini ve temsilini üstlenirken genellikle açık görüntü işleme modelleriyle birlikte çalışır. Örneğin bir INR, bir sahnenin yüksek çözünürlüklü karesini sentezleyebilir veya daha sonra bir nesne algılama işlem hattına aktarılan sentetik veriler üretebilir.
Bu koordinat eşleme ağlarını tanımlamak için PyTorch sinir ağı kütüphanesi gibi çerçeveleri kullanabilirsin. INR bir görüntüyü yeniden oluşturduktan veya ölçeğini yükselttikten sonra görüntüyü Ultralytics YOLO26 gibi gelişmiş bir modelle sorunsuzca işleyebilirsin. Ayrıca bu sentezlenmiş sahnelerden eğitim veri kümeleri oluştururken Ultralytics Platformu, açıklama ekleme ve dağıtım için güçlü bir bulut altyapısı sunar. Ayrıntılı talimatlar Platform belgelerinde bulunabilir.
import torch
import torch.nn as nn
from ultralytics import YOLO
# 1. 2B koordinatları RGB'ye eşleyen temel bir INR tanımla
inr = nn.Sequential(nn.Linear(2, 64), nn.ReLU(), nn.Linear(64, 3), nn.Sigmoid())
# 2. Sürekli (x, y) koordinatlarından RGB piksellerini yeniden oluştur
synthetic_pixels = inr(torch.rand(100, 2))
# 3. Sentezlenmiş verileri Ultralytics YOLO26 ile analiz et
model = YOLO("yolo26n.pt")Veri temsilini fiziksel ızgara sınırlamalarından ayıran örtük sinirsel temsiller, uzamsal zekâ ve sürekli makine öğrenimi mimarilerinin geleceği için yüksek ölçeklenebilirliğe sahip, bellek açısından verimli bir çerçeve sunar.









