AI Video Editing
اكتشف كيف يستخدم تحرير الفيديو بالذكاء الاصطناعي التعرّف على الكلام واكتشاف الأجسام والتتبّع والتجزئة لتبسيط عمليات القص وإعادة تأطير اللقطات وإضافة التسميات التوضيحية وطمس الأشخاص.
يستخدم تحرير الفيديو بالذكاء الاصطناعي التعلّم الآلي للمساعدة في اختيار اللقطات الموجودة أو ترتيبها أو تعديلها. وبدلًا من تحديد موقع كل متحدث يدويًا، أو تتبّع هدف متحرك عبر كل إطار، أو العثور على كل نقطة تنتهي عندها لقطة، يستطيع المحرر استخدام الذكاء الاصطناعي للتعرّف على هذه العناصر واقتراح التغييرات أو تطبيقها. وقد تكون النتيجة نسخة أولية، أو مقطعًا أعيد تأطيره، أو تسميات توضيحية، أو تأثيرًا بصريًا موجّهًا. ويظل الحكم البشري هو ما يحدد مدى دقة إيصال التعديل للقصة المقصودة.
آلية عمل تحرير الفيديو بالذكاء الاصطناعي#
يعمل محرر الفيديو على خط زمني يضم المقاطع والصوت والتأثيرات. ويضيف الذكاء الاصطناعي معلومات عمّا يحدث ضمن ذلك الخط الزمني. فقد يستخدم النظام التعرّف على الكلام لتحويل الحوار إلى نص متزامن زمنيًا، ثم يتيح للمحرر العثور على اقتباس أو حذف وقفة من خلال تحرير النص المفرّغ. ويوضح التحرير المعتمد على النص في Adobe Premiere هذه الصلة بين الكلمات واللقطات.
أما التغييرات البصرية، فيحدد اكتشاف الكائنات مواقع الأهداف في الإطارات الفردية، وغالبًا ما يستخدم لذلك مربعات إحاطة مستطيلة. ويربط تتبّع الكائنات عمليات الاكتشاف عبر الإطارات، بحيث يمكن للتأثير تتبّع الهدف نفسه أثناء حركته. وعندما يتطلب التعديل تحديد محيط الهدف بدلًا من رسم مستطيل حوله، يوفر تقسيم المثيلات قناعًا على مستوى البكسل. وبشكل منفصل، يستطيع اكتشاف تغيّر اللقطات تحديد الانتقالات بين لقطات الكاميرا، مما يسهل مراجعة التسجيلات الطويلة.
تسهم هذه التقنيات بأجزاء مختلفة في عملية التحرير: إذ يحدد الاكتشاف مكان وجود شيء ما، ويساعد التتبّع على تحديد أيّ كائن هو بمرور الوقت، بينما يحدد القناع وحدات البكسل المطلوب تغييرها. ولا تقرر أي من هذه التقنيات بمفردها اللحظات التي ينبغي أن تظهر في النسخة النهائية.
الاختلاف عن المصطلحات ذات الصلة#
يصف فهم الفيديو تفسير محتوى مقطع أو أحداثه؛ أما التحرير فيستخدم ذلك التفسير لتغيير طريقة عرض اللقطات. وينشئ توليد الفيديو لقطات جديدة، بينما يبدأ تحرير الفيديو بالذكاء الاصطناعي عمومًا بلقطات موجودة بالفعل. وقد يدمج المحرر مواد مولّدة مع مقاطع مسجّلة، لكن المهمتين ليستا قابلتين للتبادل.
كما تختلف المساعدة بالذكاء الاصطناعي عن التحرير الآلي العادي. فتعليمات ثابتة مثل «اقتصاص كل إطار ليكون في الوسط» تطبق القاعدة نفسها بصرف النظر عن المحتوى. أما إعادة التأطير المدعومة بالذكاء الاصطناعي، فيمكنها الاستجابة لموضع حركة المشهد، كما يوضح استعراض Auto Reframe من Adobe. وفي الحالتين، ينبغي للمحرر التأكد من بقاء الأهداف المهمة ظاهرة.
تطبيقان من الواقع العملي#
تحويل مقابلة مسجّلة إلى مقطع قصير. يستطيع فريق الإنتاج تفريغ محادثة مدتها ساعة، وتحديد إجابة ذات صلة، وإنشاء نسخة أولية تتمحور حولها. وتوفر التسميات التوضيحية التلقائية المحوّلة من الكلام إلى نص نقطة بداية لإعداد الترجمات النصية. ثم يراجع المحرر النص المفرّغ بمقارنته بالصوت، ويضبط الإيقاع، ويتأكد من أن حذف العبارات المجاورة لم يغيّر معنى المتحدث. وهذا مهم على نحو خاص للتسميات التوضيحية: إذ تشير إرشادات W3C بشأن التسميات التوضيحية الميسّرة إلى ضرورة مراجعة دقة المخرجات الآلية.
إعداد اللقطات للمشاركة. قد يحتاج فريق يصوّر فعالية عامة إلى طمس المارة مع إبقاء النشاط مرئيًا. ويمكن لكاشف تحديد مواقع الأشخاص في كل إطار، كما يمكن لسير عمل طمس الكائنات تطبيق التمويه على المناطق التي اكتُشف وجودهم فيها. ويتعين على المحررين فحص المخرجات: فقد يؤدي عدم اكتشاف شخص إلى بقائه ظاهرًا، بينما قد يحجب مربع إحاطة كبير مساحة من المشهد تتجاوز المطلوب. ولا يعادل طمس الأشخاص المكتشفين إخفاء هوية الجميع بشكل موثوق أو تحديد الوجوه تحديدًا.
سير عمل عملي للفيديو#
يستخدم المثال أدناه Ultralytics YOLO26 لطمس الأشخاص المكتشفين في فيديو موجود. ثبّت ultralytics وopencv-python، ثم ضع فيديو باسم input.mp4 إلى جانب البرنامج النصي.
import cv2
from ultralytics import solutions
capture = cv2.VideoCapture("input.mp4")
assert capture.isOpened(), "Provide an input.mp4 video"
width = int(capture.get(cv2.CAP_PROP_FRAME_WIDTH))
height = int(capture.get(cv2.CAP_PROP_FRAME_HEIGHT))
fps = capture.get(cv2.CAP_PROP_FPS)
writer = cv2.VideoWriter("blurred.mp4", cv2.VideoWriter_fourcc(*"mp4v"), fps, (width, height))
assert writer.isOpened(), "Could not create the output video"
blurrer = solutions.ObjectBlurrer(model="yolo26n.pt", classes=[0])
while True:
success, frame = capture.read()
if not success:
break
result = blurrer(frame)
writer.write(result.plot_im)
capture.release()
writer.release()تحدد الفئة 0 الأشخاص في النموذج المدرّب مسبقًا؛ ولا تحدد الوجوه. تعالج أداة التمويه كل إطار، بينما تجمع أدوات التقاط الفيديو وكتابته في OpenCV الإطارات المعالَجة في ملف جديد. يتعامل سير العمل المختصر هذا مع إطارات الفيديو، ولا يتعامل مع المسار الصوتي الأصلي. ويتطلب التحرير الكامل خطوة إنهاء تراعي الصوت؛ وتتناول وثائق مرشحات FFmpeg خيارات إضافية لمعالجة الفيديو.
ما ينبغي التحقق منه قبل النشر#
راجع المخرجات كاملة، وخصوصًا عمليات القطع، والحركة السريعة، وحالات الاحتجاب، والتسميات التوضيحية، والإطارين الأول والأخير لكل تأثير. واحتفظ بنسخة غير محررة حتى تتمكن من تصحيح أي قطع خاطئ أو تمويه غير مكتمل. وبالنسبة إلى الوسائط الموزعة، يمكن أن تساعد بيانات اعتماد المحتوى ومصدره في توثيق مصدر الملف وسجل تعديله، لكنها لا تثبت صدق رسالته. يستطيع الذكاء الاصطناعي تسريع أعمال التحرير المتكررة؛ لكن المحرر يظل مسؤولًا عن السياق والخصوصية والفيديو النهائي.









