Ultralytics YOLO27:
Ultralytics用語集に戻る

Sequence-to-Sequence Models

シーケンス・ツー・シーケンス(Seq2Seq)モデルが翻訳とNLPを支える仕組みを解説します。エンコーダー・デコーダーアーキテクチャ、Transformer、Ultralytics YOLO26との統合について紹介します。

シーケンス・ツー・シーケンス(Seq2Seq)モデルは、あるドメインのシーケンスを別のドメインのシーケンスに変換するよう設計された、強力な機械学習アーキテクチャの一種です。入力サイズと出力サイズが固定されている標準的な画像分類タスクとは異なり、Seq2Seqモデルは可変長の入力と出力の処理に優れています。この柔軟性により、入力文の長さが必ずしも出力文の長さを決定しない、翻訳や要約などの現代的な自然言語処理(NLP)アプリケーションの多くで中核となっています。

中核アーキテクチャと機能#

Seq2Seqモデルの基本構造は、エンコーダー・デコーダーフレームワークに基づいています。このアーキテクチャでは、モデルを2つの主要コンポーネントに分け、それらが連携してシーケンシャルデータを処理します。

  • エンコーダー: このコンポーネントは、入力シーケンス(英語の文やオーディオフレームのシーケンスなど)を1要素ずつ処理します。情報を固定長のコンテキストベクトル(隠れ状態とも呼ばれます)に圧縮します。従来のアーキテクチャでは、エンコーダーにリカレントニューラルネットワーク(RNN)長短期記憶(LSTM)ネットワークを使用することが多く、これらは時間ステップをまたいで情報を保持するよう設計されています。
  • デコーダー: 入力がエンコードされると、デコーダーはコンテキストベクトルを受け取り、出力シーケンス(対応するフランス語の文など)をステップごとに予測します。直前の予測を次の予測に反映させることで、文法的および文脈的な一貫性を確保します。

初期のバージョンはRNNに大きく依存していましたが、現代のSeq2Seqモデルでは主にTransformerアーキテクチャが使用されています。Transformerはアテンション機構を利用します。これにより、モデルは現在のステップからの距離に関係なく、入力シーケンスの特定の部分に「注意を向ける」ことができ、長いシーケンスに対する性能が大幅に向上します。この点は、基礎となる論文Attention Is All You Needで詳しく説明されています。

実世界での利用例#

Seq2Seqモデルは汎用性が高く、テキスト分析とコンピュータービジョンの間のギャップを埋め、複雑なマルチモーダルインタラクションを可能にします。

  • 機械翻訳: おそらく最も有名な応用例であり、Seq2SeqモデルはGoogle Translateなどのツールを支えています。モデルはソース言語の文を受け取り、文法や文構造の違いを流暢に処理しながら、ターゲット言語の文を出力します。
  • テキスト要約: これらのモデルは、長い文書や記事を取り込み、簡潔な要約を生成できます。入力テキストの核心的な意味を理解することで、デコーダーは重要な情報を保持した短いシーケンスを生成します。これは自動ニュースアグリゲーションに不可欠な技術です。
  • 画像キャプション生成: ビジョンと言語を組み合わせることで、Seq2Seqモデルは画像の内容を説明できます。畳み込みニューラルネットワーク(CNN)がエンコーダーとして視覚的特徴を抽出し、RNNがデコーダーとして説明文を生成します。これはマルチモーダルモデルの代表的な例です。
  • 音声認識: これらのシステムでは、入力はオーディオ信号フレームのシーケンスであり、出力はテキストの文字または単語のシーケンスです。この技術は、SiriやAlexaなどのバーチャルアシスタントを支えています。

コード例: 基本構成要素#

高レベルフレームワークによって複雑さの大部分が抽象化されますが、基盤となる仕組みを理解しておくことは役立ちます。次のコードは、PyTorchで基本的なLSTMレイヤーを実装する方法を示しています。このレイヤーは、従来のSeq2Seqモデルのエンコーダーまたはデコーダー内でリカレントユニットとして使用されることがよくあります。

import torch
import torch.nn as nn

# Initialize an LSTM layer (common in Seq2Seq encoders)
# input_size: number of features per time step (e.g., word embedding size)
# hidden_size: size of the context vector/hidden state
lstm_layer = nn.LSTM(input_size=10, hidden_size=20, batch_first=True)

# Create a dummy input sequence: Batch size 3, Sequence length 5, Features 10
input_seq = torch.randn(3, 5, 10)

# Pass the sequence through the LSTM
# output contains features for each time step; hn is the final hidden state
output, (hn, cn) = lstm_layer(input_seq)

print(f"Output shape: {output.shape}")  # Shape: [3, 5, 20]
print(f"Final Hidden State shape: {hn.shape}")  # Shape: [1, 3, 20]

関連概念との比較#

Seq2Seqモデルの具体的な用途を理解するには、他のアーキテクチャとの違いを明確にすることが重要です。

  • 標準分類との比較: 基本的な画像分類で使用される標準分類器などは、単一の入力(画像など)を単一のクラスラベルにマッピングします。これに対して、Seq2Seqモデルはシーケンスをシーケンスにマッピングするため、出力長を可変にできます。
  • 物体検出との比較: Ultralytics YOLO26などのモデルは、単一フレーム内の空間的な検出に重点を置き、物体とその位置を特定します。YOLOが画像を構造的に処理するのに対し、Seq2Seqモデルはデータを時間的に処理します。ただし、物体追跡などのタスクでは両方の領域が重なります。このタスクでは、動画フレームをまたぐ物体の軌跡の特定にシーケンシャルデータ分析が関わります。
  • Transformerとの比較: Transformerアーキテクチャは、Seq2Seqの現代的な発展形です。従来のSeq2SeqモデルがRNNやゲート付きリカレントユニット(GRU)に大きく依存していたのに対し、Transformerは自己アテンションを利用してシーケンスを並列処理し、速度と精度を大幅に向上させます。

AIエコシステムにおける重要性#

Seq2Seqモデルは、機械が人間の言語や時間的データとやり取りする方法を根本的に変えました。シーケンス依存データを処理する能力により、高度なチャットボット、自動翻訳ツール、コード生成ツールが実現しています。これらのモデルのトレーニングに必要な大規模データセットを扱う開発者にとって、Ultralytics Platformを使用すると、データ管理とモデルデプロイメントのワークフローを効率化できます。Generative AIの研究が進む中、シーケンスモデリングの原則は、大規模言語モデル(LLMs)や高度な動画理解システムの開発において、引き続き中心的な役割を果たしています。

Explore solutions

航空画像向けコンピュータービジョン

航空画像向けコンピュータービジョン

Ultralytics YOLOを使用して、ドローンや航空画像から農業、水産業、環境モニタリング、保全、地理空間分析向けのリアルタイムなインサイトを生成します。
詳細を見る
航空宇宙におけるコンピュータビジョン

航空宇宙におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、ビジョンAIを空中モニタリングに導入します。コンピュータビジョンソリューションで、ドローン、航空宇宙ワークフロー、環境保護、および地理空間産業を強力にサポートします。
詳細を見る

Ultralytics YOLOモデルであらゆるサイトを保護します。ビジョンAIは、境界モニタリング、脅威検出、ナンバープレート認識、職場安全をサポートします。
詳細を見る
ロボティクスのコンピュータービジョン

ロボティクスのコンピュータービジョン

Ultralytics YOLOモデルで、よりスマートなマシンを実現します。ロボティクスのVision AIにより、自律ナビゲーション、認識、物体追跡、リアルタイム制御を実現します。
詳細を見る
物流のコンピュータービジョン

物流のコンピュータービジョン

Ultralytics YOLOモデルで物流を効率化します。Vision AIにより、荷物検査、仕分け、車両追跡、倉庫の安全性に関するリアルタイム監視を実現します。
詳細を見る
小売のコンピュータービジョン

小売のコンピュータービジョン

Ultralytics YOLOモデルで小売を再構築します。Vision AIにより、在庫追跡、棚監視、待ち行列管理、より高度な顧客インサイトを実現します。
詳細を見る
ヘルスケア向けコンピュータービジョン

ヘルスケア向けコンピュータービジョン

Ultralytics YOLOモデルでヘルスケアソリューションを構築しましょう。ヘルスケア向けVision AIは、医用画像処理の高速化、より高度な診断、患者モニタリングを実現します。
詳細を見る
製造業向けコンピュータービジョン

製造業向けコンピュータービジョン

Ultralytics YOLOモデルで製造業を最適化しましょう。Vision AIは、品質管理、欠陥検出、PPE遵守、組立ラインの自動化を推進します。
詳細を見る
自動車分野のコンピュータビジョン

自動車分野のコンピュータビジョン

Ultralytics YOLOモデルで自動車分野にコンピュータビジョンを適用します。ビジョンAIにより、道路の安全性、運転支援、車両自動化を向上させ、よりスマートな道路を実現します。
詳細を見る
農業分野のコンピュータビジョン

農業分野のコンピュータビジョン

Ultralytics YOLOモデルでスマート農業にビジョンAIを導入します。作物のモニタリング、家畜の追跡、精密農業を支援し、より高くスマートな収穫量を実現します。
詳細を見る
航空画像向けコンピュータービジョン

航空画像向けコンピュータービジョン

Ultralytics YOLOを使用して、ドローンや航空画像から農業、水産業、環境モニタリング、保全、地理空間分析向けのリアルタイムなインサイトを生成します。
詳細を見る
航空宇宙におけるコンピュータビジョン

航空宇宙におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、ビジョンAIを空中モニタリングに導入します。コンピュータビジョンソリューションで、ドローン、航空宇宙ワークフロー、環境保護、および地理空間産業を強力にサポートします。
詳細を見る

Ultralytics YOLOモデルであらゆるサイトを保護します。ビジョンAIは、境界モニタリング、脅威検出、ナンバープレート認識、職場安全をサポートします。
詳細を見る
ロボティクスのコンピュータービジョン

ロボティクスのコンピュータービジョン

Ultralytics YOLOモデルで、よりスマートなマシンを実現します。ロボティクスのVision AIにより、自律ナビゲーション、認識、物体追跡、リアルタイム制御を実現します。
詳細を見る
物流のコンピュータービジョン

物流のコンピュータービジョン

Ultralytics YOLOモデルで物流を効率化します。Vision AIにより、荷物検査、仕分け、車両追跡、倉庫の安全性に関するリアルタイム監視を実現します。
詳細を見る
小売のコンピュータービジョン

小売のコンピュータービジョン

Ultralytics YOLOモデルで小売を再構築します。Vision AIにより、在庫追跡、棚監視、待ち行列管理、より高度な顧客インサイトを実現します。
詳細を見る
ヘルスケア向けコンピュータービジョン

ヘルスケア向けコンピュータービジョン

Ultralytics YOLOモデルでヘルスケアソリューションを構築しましょう。ヘルスケア向けVision AIは、医用画像処理の高速化、より高度な診断、患者モニタリングを実現します。
詳細を見る
製造業向けコンピュータービジョン

製造業向けコンピュータービジョン

Ultralytics YOLOモデルで製造業を最適化しましょう。Vision AIは、品質管理、欠陥検出、PPE遵守、組立ラインの自動化を推進します。
詳細を見る
自動車分野のコンピュータビジョン

自動車分野のコンピュータビジョン

Ultralytics YOLOモデルで自動車分野にコンピュータビジョンを適用します。ビジョンAIにより、道路の安全性、運転支援、車両自動化を向上させ、よりスマートな道路を実現します。
詳細を見る
農業分野のコンピュータビジョン

農業分野のコンピュータビジョン

Ultralytics YOLOモデルでスマート農業にビジョンAIを導入します。作物のモニタリング、家畜の追跡、精密農業を支援し、より高くスマートな収穫量を実現します。
詳細を見る
航空画像向けコンピュータービジョン

航空画像向けコンピュータービジョン

Ultralytics YOLOを使用して、ドローンや航空画像から農業、水産業、環境モニタリング、保全、地理空間分析向けのリアルタイムなインサイトを生成します。
詳細を見る
航空宇宙におけるコンピュータビジョン

航空宇宙におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、ビジョンAIを空中モニタリングに導入します。コンピュータビジョンソリューションで、ドローン、航空宇宙ワークフロー、環境保護、および地理空間産業を強力にサポートします。
詳細を見る

Ultralytics YOLOモデルであらゆるサイトを保護します。ビジョンAIは、境界モニタリング、脅威検出、ナンバープレート認識、職場安全をサポートします。
詳細を見る
ロボティクスのコンピュータービジョン

ロボティクスのコンピュータービジョン

Ultralytics YOLOモデルで、よりスマートなマシンを実現します。ロボティクスのVision AIにより、自律ナビゲーション、認識、物体追跡、リアルタイム制御を実現します。
詳細を見る
物流のコンピュータービジョン

物流のコンピュータービジョン

Ultralytics YOLOモデルで物流を効率化します。Vision AIにより、荷物検査、仕分け、車両追跡、倉庫の安全性に関するリアルタイム監視を実現します。
詳細を見る
小売のコンピュータービジョン

小売のコンピュータービジョン

Ultralytics YOLOモデルで小売を再構築します。Vision AIにより、在庫追跡、棚監視、待ち行列管理、より高度な顧客インサイトを実現します。
詳細を見る
ヘルスケア向けコンピュータービジョン

ヘルスケア向けコンピュータービジョン

Ultralytics YOLOモデルでヘルスケアソリューションを構築しましょう。ヘルスケア向けVision AIは、医用画像処理の高速化、より高度な診断、患者モニタリングを実現します。
詳細を見る
製造業向けコンピュータービジョン

製造業向けコンピュータービジョン

Ultralytics YOLOモデルで製造業を最適化しましょう。Vision AIは、品質管理、欠陥検出、PPE遵守、組立ラインの自動化を推進します。
詳細を見る
自動車分野のコンピュータビジョン

自動車分野のコンピュータビジョン

Ultralytics YOLOモデルで自動車分野にコンピュータビジョンを適用します。ビジョンAIにより、道路の安全性、運転支援、車両自動化を向上させ、よりスマートな道路を実現します。
詳細を見る
農業分野のコンピュータビジョン

農業分野のコンピュータビジョン

Ultralytics YOLOモデルでスマート農業にビジョンAIを導入します。作物のモニタリング、家畜の追跡、精密農業を支援し、より高くスマートな収穫量を実現します。
詳細を見る

AIの未来を一緒に築きましょう!

機械学習の未来への歩みを始めましょう