Ultralytics YOLO27:
Ultralytics用語集に戻る

Transformer-XL

Transformer-XLとセグメントレベルの再帰を解説します。このアーキテクチャがAIモデルにおける長距離依存性の固定コンテキスト問題を解決する仕組みを学びます。

Transformer-XL(Transformer-Extra Long)は、標準的なTransformerモデルにおける重大な制約、つまりシーケンシャルデータの長距離依存関係を処理する能力に対応するために設計された、特殊なニューラルネットワークアーキテクチャです。Google AIの研究者によって導入されたこのアーキテクチャは、BERTやオリジナルのTransformerのような従来のアプローチを制約する固定長のコンテキストウィンドウをはるかに超えて、言語モデルが処理できるようにします。セグメントレベルの再帰メカニズムと新しい位置エンコーディング方式を導入することで、Transformer-XLはコンテキストを見失うことなく非常に長いテキストシーケンスを処理できます。そのため、現代の大規模言語モデル(LLMs)や生成AIアプリケーションの基盤となる概念です。

コンテキストの制約の克服#

Transformer-XLの主な動機は、「固定コンテキスト問題」にあります。標準的なTransformerは、データを固定サイズのセグメント(例:512トークン)で処理します。通常、これらのセグメント間で情報が伝達されないため、モデルは前のセグメントで起きたことを忘れてしまいます。これにより、長いドキュメントの一貫性が損なわれます。

Transformer-XLは、次の2つの主要な革新によってこの問題を解決します。

  1. セグメントレベルの再帰: 各セグメントを独立して処理する一般的なTransformerとは異なり、Transformer-XLは前のセグメントの隠れ状態をメモリにキャッシュします。現在のセグメントを処理する際、モデルはこれらのキャッシュ済み状態に注目できます。これによりセグメントが実質的に接続され、情報がはるかに長い距離にわたって伝播できるようになります。これは再帰型ニューラルネットワーク(RNN)にやや似ていますが、アテンションメカニズムによる並列化の利点も備えています。

  2. 相対位置エンコーディング: 再帰メカニズムでは前のセグメントの状態を再利用するため、標準的な絶対位置エンコーディング(各位置に一意のIDを割り当てる方式)では混乱が生じます。Transformer-XLは相対エンコーディングを使用します。これにより、ドキュメント内の絶対位置ではなく、トークン間の距離(例:「単語Aは単語Bの5ステップ前にある」)をモデルが理解しやすくなります。

このアーキテクチャは、RNNや標準的なTransformerなどの従来モデルと比較して、言語モデリングタスクにおけるパープレキシティスコアを大幅に改善します。

標準的なTransformerとの違い#

Transformer-XLを、標準的なVision Transformer(ViT)やテキストTransformerと区別して理解することが重要です。標準的なTransformerは各セグメントの後に状態をリセットするため、「コンテキストの断片化」が発生します。一方、Transformer-XLは過去のアクティベーションのメモリを維持します。これにより、固定コンテキストモデルの数百倍の長さを持つ依存関係をモデル化できます。これは、質問への答えがクエリから数段落離れた場所にある可能性がある、深い自然言語理解(NLU)を必要とするタスクで特に重要です。

実世界での利用例#

長期的なコンテキストを維持できるTransformer-XLは、次のような影響の大きい複数の分野で有用です。

  • 長文テキスト生成: 小説の執筆や長大なレポートの生成などのテキスト生成アプリケーションでは、テーマの一貫性を維持することが困難です。Transformer-XLを使用すると、テキストの冒頭で導入された登場人物の名前、プロット上の要点、技術的な定義などをAIが記憶できるため、出力全体の一貫性を保てます。
  • DNAシーケンス解析: このアーキテクチャは人間の言語に限定されません。バイオインフォマティクスでは、研究者がTransformer-XLの派生モデルを使用して、長いDNA鎖を解析しています。遠く離れた遺伝子配列間の関係を理解することで、遺伝マーカーの特定やタンパク質構造の予測に役立ちます。これは、医療分野のAIが医用画像の解析を支援する方法と似ています。
  • チャットボットとバーチャルアシスタント: 現代のチャットボットは、会話の早い段階で言及されたユーザーの好みや詳細を記憶する必要があります。Transformer-XLのメカニズムはコンテキストウィンドウの拡張に役立ち、数分前に話したトピックをアシスタントが忘れてしまうという不満につながる体験を防ぎます。

メモリと効率#

Transformer-XLは長いシーケンスで優れたパフォーマンスを発揮しますが、特有のメモリに関する考慮事項があります。隠れ状態のキャッシュには追加のGPUメモリが必要であり、適切に管理しないと推論レイテンシに影響する可能性があります。ただし、長いコンテキストにおける精度が最優先されるアプリケーションでは、このトレードオフが正当化されることが多くあります。

YOLO26のような現代の物体検出モデルは、ビジュアルデータの速度と効率に重点を置いています。一方、Transformer-XLのようなアーキテクチャは、シーケンシャルデータのメモリ保持を優先します。興味深いことに、この分野はマルチモーダルAIへと進化しています。そこでは、効率的なビジョンバックボーン(YOLO26のようなモデルで使用されるもの)と長いコンテキストに対応する言語デコーダーを組み合わせ、長時間にわたる出来事を含む動画を解析したり、複雑な質問に回答したりできる可能性があります。

例:推論におけるコンテキストの管理#

Transformer-XLの内部メカニズムは複雑ですが、高度なモデルを使用する場合、多くの場合はコンテキスト制限に従うよう入力を管理する必要があります。次のtorchを使用したPythonの例では、モデルに「メモリ」(隠れ状態)を渡してステップ間のコンテキストを維持するという概念を示します。これは、Transformer-XLのようなアーキテクチャに見られる再帰的な動作をシミュレートするものです。

import torch
import torch.nn as nn

# Define a simple RNN to demonstrate passing hidden states (memory)
# This mimics the core concept of recurrence used in Transformer-XL
rnn = nn.RNN(input_size=10, hidden_size=20, num_layers=2, batch_first=True)

# Initial input: Batch size 1, sequence length 5, feature size 10
input_seq1 = torch.randn(1, 5, 10)

# Run first segment, receiving output and the hidden state (memory)
output1, memory = rnn(input_seq1)

# Run second segment, PASSING the memory from the previous step
# This connects the two segments, allowing context to flow
input_seq2 = torch.randn(1, 5, 10)
output2, new_memory = rnn(input_seq2, memory)

print(f"Output shape with context: {output2.shape}")

最先端のモデルを効率的にトレーニングおよびデプロイしたいチームに向けて、Ultralytics Platformは、データセットを管理し、モデルのトレーニングプロセスを効率化するためのツールを提供します。ビジョンモデルを扱う場合でも、複雑なシーケンシャルアーキテクチャを統合する場合でも利用できます。

Explore solutions

航空画像向けコンピュータービジョン

航空画像向けコンピュータービジョン

Ultralytics YOLOを使用して、ドローンや航空画像から農業、水産業、環境モニタリング、保全、地理空間分析向けのリアルタイムなインサイトを生成します。
詳細を見る
航空宇宙におけるコンピュータビジョン

航空宇宙におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、ビジョンAIを空中モニタリングに導入します。コンピュータビジョンソリューションで、ドローン、航空宇宙ワークフロー、環境保護、および地理空間産業を強力にサポートします。
詳細を見る

Ultralytics YOLOモデルであらゆるサイトを保護します。ビジョンAIは、境界モニタリング、脅威検出、ナンバープレート認識、職場安全をサポートします。
詳細を見る
ロボティクスのコンピュータービジョン

ロボティクスのコンピュータービジョン

Ultralytics YOLOモデルで、よりスマートなマシンを実現します。ロボティクスのVision AIにより、自律ナビゲーション、認識、物体追跡、リアルタイム制御を実現します。
詳細を見る
物流のコンピュータービジョン

物流のコンピュータービジョン

Ultralytics YOLOモデルで物流を効率化します。Vision AIにより、荷物検査、仕分け、車両追跡、倉庫の安全性に関するリアルタイム監視を実現します。
詳細を見る
小売のコンピュータービジョン

小売のコンピュータービジョン

Ultralytics YOLOモデルで小売を再構築します。Vision AIにより、在庫追跡、棚監視、待ち行列管理、より高度な顧客インサイトを実現します。
詳細を見る
ヘルスケア向けコンピュータービジョン

ヘルスケア向けコンピュータービジョン

Ultralytics YOLOモデルでヘルスケアソリューションを構築しましょう。ヘルスケア向けVision AIは、医用画像処理の高速化、より高度な診断、患者モニタリングを実現します。
詳細を見る
製造業向けコンピュータービジョン

製造業向けコンピュータービジョン

Ultralytics YOLOモデルで製造業を最適化しましょう。Vision AIは、品質管理、欠陥検出、PPE遵守、組立ラインの自動化を推進します。
詳細を見る
自動車分野のコンピュータビジョン

自動車分野のコンピュータビジョン

Ultralytics YOLOモデルで自動車分野にコンピュータビジョンを適用します。ビジョンAIにより、道路の安全性、運転支援、車両自動化を向上させ、よりスマートな道路を実現します。
詳細を見る
農業分野のコンピュータビジョン

農業分野のコンピュータビジョン

Ultralytics YOLOモデルでスマート農業にビジョンAIを導入します。作物のモニタリング、家畜の追跡、精密農業を支援し、より高くスマートな収穫量を実現します。
詳細を見る
航空画像向けコンピュータービジョン

航空画像向けコンピュータービジョン

Ultralytics YOLOを使用して、ドローンや航空画像から農業、水産業、環境モニタリング、保全、地理空間分析向けのリアルタイムなインサイトを生成します。
詳細を見る
航空宇宙におけるコンピュータビジョン

航空宇宙におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、ビジョンAIを空中モニタリングに導入します。コンピュータビジョンソリューションで、ドローン、航空宇宙ワークフロー、環境保護、および地理空間産業を強力にサポートします。
詳細を見る

Ultralytics YOLOモデルであらゆるサイトを保護します。ビジョンAIは、境界モニタリング、脅威検出、ナンバープレート認識、職場安全をサポートします。
詳細を見る
ロボティクスのコンピュータービジョン

ロボティクスのコンピュータービジョン

Ultralytics YOLOモデルで、よりスマートなマシンを実現します。ロボティクスのVision AIにより、自律ナビゲーション、認識、物体追跡、リアルタイム制御を実現します。
詳細を見る
物流のコンピュータービジョン

物流のコンピュータービジョン

Ultralytics YOLOモデルで物流を効率化します。Vision AIにより、荷物検査、仕分け、車両追跡、倉庫の安全性に関するリアルタイム監視を実現します。
詳細を見る
小売のコンピュータービジョン

小売のコンピュータービジョン

Ultralytics YOLOモデルで小売を再構築します。Vision AIにより、在庫追跡、棚監視、待ち行列管理、より高度な顧客インサイトを実現します。
詳細を見る
ヘルスケア向けコンピュータービジョン

ヘルスケア向けコンピュータービジョン

Ultralytics YOLOモデルでヘルスケアソリューションを構築しましょう。ヘルスケア向けVision AIは、医用画像処理の高速化、より高度な診断、患者モニタリングを実現します。
詳細を見る
製造業向けコンピュータービジョン

製造業向けコンピュータービジョン

Ultralytics YOLOモデルで製造業を最適化しましょう。Vision AIは、品質管理、欠陥検出、PPE遵守、組立ラインの自動化を推進します。
詳細を見る
自動車分野のコンピュータビジョン

自動車分野のコンピュータビジョン

Ultralytics YOLOモデルで自動車分野にコンピュータビジョンを適用します。ビジョンAIにより、道路の安全性、運転支援、車両自動化を向上させ、よりスマートな道路を実現します。
詳細を見る
農業分野のコンピュータビジョン

農業分野のコンピュータビジョン

Ultralytics YOLOモデルでスマート農業にビジョンAIを導入します。作物のモニタリング、家畜の追跡、精密農業を支援し、より高くスマートな収穫量を実現します。
詳細を見る
航空画像向けコンピュータービジョン

航空画像向けコンピュータービジョン

Ultralytics YOLOを使用して、ドローンや航空画像から農業、水産業、環境モニタリング、保全、地理空間分析向けのリアルタイムなインサイトを生成します。
詳細を見る
航空宇宙におけるコンピュータビジョン

航空宇宙におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、ビジョンAIを空中モニタリングに導入します。コンピュータビジョンソリューションで、ドローン、航空宇宙ワークフロー、環境保護、および地理空間産業を強力にサポートします。
詳細を見る

Ultralytics YOLOモデルであらゆるサイトを保護します。ビジョンAIは、境界モニタリング、脅威検出、ナンバープレート認識、職場安全をサポートします。
詳細を見る
ロボティクスのコンピュータービジョン

ロボティクスのコンピュータービジョン

Ultralytics YOLOモデルで、よりスマートなマシンを実現します。ロボティクスのVision AIにより、自律ナビゲーション、認識、物体追跡、リアルタイム制御を実現します。
詳細を見る
物流のコンピュータービジョン

物流のコンピュータービジョン

Ultralytics YOLOモデルで物流を効率化します。Vision AIにより、荷物検査、仕分け、車両追跡、倉庫の安全性に関するリアルタイム監視を実現します。
詳細を見る
小売のコンピュータービジョン

小売のコンピュータービジョン

Ultralytics YOLOモデルで小売を再構築します。Vision AIにより、在庫追跡、棚監視、待ち行列管理、より高度な顧客インサイトを実現します。
詳細を見る
ヘルスケア向けコンピュータービジョン

ヘルスケア向けコンピュータービジョン

Ultralytics YOLOモデルでヘルスケアソリューションを構築しましょう。ヘルスケア向けVision AIは、医用画像処理の高速化、より高度な診断、患者モニタリングを実現します。
詳細を見る
製造業向けコンピュータービジョン

製造業向けコンピュータービジョン

Ultralytics YOLOモデルで製造業を最適化しましょう。Vision AIは、品質管理、欠陥検出、PPE遵守、組立ラインの自動化を推進します。
詳細を見る
自動車分野のコンピュータビジョン

自動車分野のコンピュータビジョン

Ultralytics YOLOモデルで自動車分野にコンピュータビジョンを適用します。ビジョンAIにより、道路の安全性、運転支援、車両自動化を向上させ、よりスマートな道路を実現します。
詳細を見る
農業分野のコンピュータビジョン

農業分野のコンピュータビジョン

Ultralytics YOLOモデルでスマート農業にビジョンAIを導入します。作物のモニタリング、家畜の追跡、精密農業を支援し、より高くスマートな収穫量を実現します。
詳細を見る

AIの未来を一緒に築きましょう!

機械学習の未来への歩みを始めましょう