أحدث تحديثات OpenAI: Canvas، والضبط الدقيق للرؤية، والمزيد
انضم إلينا بينما نلقي نظرة فاحصة على تحديثات ChatGPT الأخيرة التي أصدرتها OpenAI. سنستكشف Canvas، والضبط الدقيق لقدرات الرؤية، وميزة البحث الأحدث.

بعد أن اطلعنا آخر مرة على OpenAI's o1 models في سبتمبر (والتي صُممت لتحسين الاستدلال)، تمت إضافة العديد من الميزات الجديدة والمثيرة إلى ChatGPT. بعض هذه الإصدارات موجه للمطورين، بينما صُمم البعض الآخر لتحسين تجربة المستخدم. بشكل عام، تساعد كل ترقية في جعل التفاعلات مع ChatGPT أكثر سهولة وفعالية.
أدت التحديثات مثل Canvas، المصمم للتعاون في writing and coding، وfine-tuning الخاص بـ vision capabilities والذي يحسن كيفية عمل ChatGPT مع images، إلى اثارة الكثير من الاتمام، مما شجع المستخدمين على استكشاف المزيد من الإمكانيات الإبداعية. وفي الوقت نفسه، تعالج التحديثات التقنية، مثل واجهات برمجة التطبيقات الجديدة وتقارير اختبارات الإنصاف، جوانب مثل integration الخاص بالنماذج وممارسات ethical AI. لنغوص في التفاصيل ونحصل على فهم أفضل لأحدث ميزات ChatGPT من OpenAI!
نظرة عامة على ميزة Canvas من OpenAI#
تعد Canvas أول تحديث رئيسي لواجهة مستخدم ChatGPT منذ إطلاقه. إنها واجهة جديدة بتصميم ثنائي الشاشة، حيث توجد المطالبات في الشريط الجانبي الأيسر، بينما تظهر الردود في نافذة الشاشة اليمنى. تلغي واجهة المستخدم الجديدة هيكل الشاشة الواحدة المعتاد في المحادثات وتنتقل إلى تصميم ثنائي الشاشة يناسب أغراض تعدد المهام لتعزيز الإنتاجية.

Fig 1. يقدم Canvas تحديثات واجهة المستخدم إلى ChatGPT.
قبل تقديم Canvas، كان العمل مع documents الطويلة على ChatGPT يعني الاضطرار إلى التمرير صعوداً وهبوطاً بشكل كبير. في التخطيط الجديد، يتم عرض مطالبات الإدخال على الشريط الجانبي الأيسر، بينما يشغل المستند النصي أو مقتطف code الجزء الأكبر من الشاشة. إذا لزم الأمر، يمكنك حتى تخصيص حجم الشريط الجانبي الأيسر وشاشة الإخراج. بالإضافة إلى ذلك، يمكنك تحديد جزء من النص أو قسم من التعليمات البرمجية وتعديل هذا القسم المحدد دون تغيير المستند بأكمله.

الشكل 2. تعديل أقسام محددة من النص باستخدام Canvas.
إذا كنت تستخدم Canvas، ستلاحظ عدم وجود زر أو مفتاح تبديل محدد لفتحه في واجهة ChatGPT. بدلاً من ذلك، عندما تعمل مع نموذج GPT-4o، يفتح Canvas تلقائياً إذا اكتشف أنك تقوم بـ editing أو writing أو coding. بالنسبة للمطالبات الأبسط، يظل غير نشط. إذا كنت ترغب في فتحه يدوياً، يمكنك استخدام مطالبات مثل "Open the Canvas" أو "Get me the Canvas layout."
حالياً، Canvas في مرحلة تجريبية ومتاحة فقط مع GPT-4o. ومع ذلك، ذكرت OpenAI أن Canvas ستكون متاحة لجميع المستخدمين المجانيين عند خروجها من المرحلة التجريبية.
تحديثات API الخاصة بـ ChatGPT#
أصدرت OpenAI ثلاثة تحديثات جديدة لـ ChatGPT API تهدف إلى تحسين الكفاءة وقابلية التوسع وتعدد الاستخدامات. لنلقِ نظرة فاحصة على كل من هذه التحديثات.
تقطير النموذج (Model distillation)#
باستخدام ميزة Model Distillation من خلال واجهات برمجة تطبيقات OpenAI، يمكن للمطورين استخدام مخرجات advanced models مثل GPT-4o أو o1-preview لتحسين performance للنماذج الأصغر والأكثر كفاءة من حيث التكلفة مثل GPT-4o mini. تقطير النموذج هو عملية تتضمن training النماذج الأصغر لمحاكاة سلوك النماذج الأكثر تقدمًا، مما يجعلها أكثر كفاءة لـ specific tasks.
قبل إدخال هذه الميزة، كان على المطورين تنسيق مجموعة متنوعة من المهام يدوياً باستخدام أدوات مختلفة. تضمنت هذه المهام إنشاء datasets، وقياس model performance، وfine-tuning للنماذج، مما جعل العملية غالباً معقدة وعرضة للأخطاء. يتيح تحديث تقطير النموذج للمطورين استخدام Stored Completions، وهي أداة تتيح لهم تلقائياً generate datasets عن طريق التقاط وتخزين أزواج الإدخال والإخراج التي تنتجها النماذج المتقدمة عبر واجهة برمجة التطبيقات.
تساعد ميزة أخرى لتقطير النموذج، وهي Evals (الموجودة حالياً في مرحلة التجربة بيتا)، في قياس مدى أداء model performs في مهام محددة، دون الحاجة إلى إنشاء evaluation مخصصة أو استخدام أدوات منفصلة. باستخدام مجموعات البيانات generated مع Stored Completions وevaluating performance باستخدام Evals، يمكن للمطورين ضبط نماذج GPT المخصصة الخاصة بهم بدقة.

Fig 3. يمكنك استخدام Evals لقياس أداء النموذج.
تخزين المطالبات مؤقتًا (Prompt caching)#
غالباً عند بناء AI applications، وخاصة chatbots، سيتم استخدام نفس context (معلومات الخلفية أو سجل المحادثة السابق اللازم لفهم الطلب الحالي) بشكل متكرر لعدة استدعاءات لواجهة برمجة التطبيقات. يجعل Prompt Caching من الممكن للمطورين إعادة استخدام input tokens المستخدمة مؤخراً (قطع النص التي يعالجها النموذج لفهم الأرشيف وإنشاء استجابة)، مما يساعد على تقليل التكلفة ووقت الاستجابة.
من الأول من أكتوبر، قامت OpenAI بتطبيق Prompt Caching تلقائياً على نماذجها مثل GPT-4o، وGPT-4o mini، وo1-preview، وo1-mini. هذا يعني أنه عندما يستخدم المطورون واجهة برمجة التطبيقات للتفاعل مع نموذج يحتوي على prompt طويل (أكثر من 1,024 رمزاً)، يقوم النظام بتخزين الأجزاء التي قام بمعالجتها بالفعل.
بهذه الطريقة، إذا تم استخدام نفس المطالبات أو مطالبات مشابهة مرة أخرى، فيمكنه تخطي إعادة حساب تلك الأجزاء. يقوم النظام تلقائيًا بتخزين أطول جزء من المطالبة واجهه سابقًا، بدءًا من 1,024 رمزًا وإضافة كتل من 128 رمزًا مع زيادة طول المطالبة.
Realtime API#
يتطلب إنشاء voice assistant عموماً الحاجة إلى تحويل audio to text، ومعالجة النص، ثم تحويله مرة أخرى إلى audio to play الرد. تهدف Realtime API من OpenAI إلى التعامل مع هذه العملية برمتها من خلال طلب واحد لواجهة برمجة التطبيقات. من خلال جعل العملية أبسط، تتيح واجهة برمجة التطبيقات إجراء محادثات في الوقت الفعلي مع الذكاء الاصطناعي.
على سبيل المثال، يمكن لمساعد صوتي مدمج مع Realtime API تنفيذ إجراءات محددة، مثل placing an order أو finding information، بناءً على طلبات المستخدم. تجعل واجهة برمجة التطبيقات المساعد الصوتي أكثر استجابة وقدرة على التكيف بسرعة مع احتياجات المستخدمين. أصبحت Realtime API متاحة من خلال الإصدار التجريبي العام في الأول من أكتوبر، بستة أصوات. في 30 أكتوبر، تمت إضافة خمسة أصوات أخرى، مما يجعله إجمالي أحد عشر صوتاً متاحاً.

Fig 4. مثال على استخدام Realtime API لممارسة المحادثات بلغة جديدة.
الضبط الدقيق لـ ChatGPT لمهام الرؤية#
في الأصل، كان يمكن ضبط نموذج لغة الرؤية GPT-4o وتخصيصه فقط باستخدام مجموعات بيانات نصية فقط. الآن، مع إصدار واجهة برمجة تطبيقات الضبط الدقيق للرؤية، يمكن للمطورين تدريب وتخصيص GPT-4o باستخدام مجموعات بيانات الصور. منذ إصداره، أصبح الضبط الدقيق للرؤية موضوع اهتمام رئيسي بين المطورين ومهندسي رؤية الكمبيوتر.
لإجراء ضبط دقيق لقدرات الرؤية في GPT-4o، يمكن للمطورين استخدام مجموعات بيانات صور تتراوح من 100 صورة إلى 50,000 صورة. بعد التأكد من مطابقة مجموعة البيانات للتنسيق المطلوب من قبل OpenAI، يمكن تحميلها على منصة OpenAI، ويمكن إجراء الضبط الدقيق للنموذج لتطبيقات محددة.
على سبيل المثال، استخدمت شركة الأتمتة Automat مجموعة بيانات من لقطات الشاشة لـ train GPT-4o لتكون قادرة على تحديد عناصر واجهة المستخدم على الشاشة بناءً على الوصف. يساعد ذلك في تبسيط أتمتة العمليات الروبوتية (RPA) من خلال تسهيل تفاعل روبوتات الدردشة مع واجهات المستخدم. بدلاً من الاعتماد على إحداثيات ثابتة أو قواعد محددة معقدة، يمكن للنموذج تحديد عناصر واجهة المستخدم بناءً على أوصاف بسيطة، مما يجعل إعدادات الأتمتة أكثر قابلية للتكيف وأسهل للصيانة عند تغير الواجهات.

Fig 5. استخدام نسخة معدلة بدقة من نموذج GPT-4o لاكتشاف عناصر واجهة المستخدم.
نزاهة ChatGPT واكتشاف التحيز#
تعتبر Ethical concerns المحيطة بـ AI applications موضوعاً بارزاً للنقاش مع تزايد تقدم الذكاء الاصطناعي. نظراً لأن ردود ChatGPT تعتمد على المطالبات المقدمة من المستخدم والبيانات المتاحة على الإنترنت، فقد يكون من الصعب ضبط لغتها لتكون مسؤولة طوال الوقت. تشير التقارير إلى أن ChatGPT’s answers are biased بناءً على الاسم والجنس والعرق. ولحل هذه المشكلة، أجرى الفريق الداخلي لشركة OpenAI اختبار إنصاف من منظور الشخص الأول.
غالباً ما تحمل الأسماء إشارات خفية حول our culture والعوامل الجغرافية. في معظم الحالات، سيتجاهل ChatGPT الإشارات الخفية في الأسماء. ومع ذلك، في بعض الحالات، تؤدي الأسماء التي تعكس العرق أو الثقافة إلى ردود مختلفة من ChatGPT، حيث يعكس حوالي 1% منها harmful language. يعد القضاء على التحيزات واللغة الضارة مهمة صعبة لأي language model. ومع ذلك، من خلال مشاركة هذه النتائج علناً والاعتراف بقيود النموذج، تساعد OpenAI المستخدمين على تحقيق مطالباتهم لتحقيق إجابات أكثر حيادية وخالية من التحيز.

Fig 6. مثال على اختلاف الردود بسبب اسم المستخدم.
فهم البحث في ChatGPT#
عند إطلاق ChatGPT لأول مرة، كانت هناك مناقشات في مجتمع الذكاء الاصطناعي حول ما إذا كان يمكنه استبدال تصفح الويب التقليدي. الآن، يستخدم العديد من المستخدمين ChatGPT بدلًا من بحث Google.
تحديث OpenAI الجديد، ميزة البحث، يأخذ هذا الأمر خطوة أخرى إلى الأمام. مع البحث، ينشئ ChatGPT استجابات محدثة ويتضمن روابط للمصادر ذات الصلة. اعتبارًا من 31 أكتوبر، أصبحت ميزة البحث متاحة لجميع مستخدمي ChatGPT Plus وTeam، مما يجعل ChatGPT يعمل بشكل أقرب إلى محرك بحث مدعوم بالذكاء الاصطناعي.

Fig 7. مثال على استخدام ميزة البحث الجديدة في ChatGPT.
الطريق إلى الأمام#
تركز تحديثات ChatGPT الأخيرة على جعل الذكاء الاصطناعي أكثر فائدة ومرونة وعدالة. تساعد ميزة Canvas الجديدة المستخدمين على العمل بكفاءة أكبر، بينما يسمح الضبط الدقيق للرؤية للمطورين بتخصيص النماذج للتعامل بشكل أفضل مع المهام المرئية. تعد معالجة العدالة وتقليل التحيز أيضًا من الأولويات الرئيسية، مما يضمن عمل الذكاء الاصطناعي بشكل جيد للجميع، بغض النظر عن هويتهم. سواء كنت مطورًا يقوم بضبط النماذج أو تستخدم الميزات الأحدث فقط، فإن ChatGPT يتطور لتلبية مجموعة واسعة من الاحتياجات. مع القدرات في الوقت الفعلي والتكامل المرئي والتركيز على الاستخدام المسؤول، تعمل هذه التحديثات على بناء تجربة ذكاء اصطناعي أكثر جدارة بالثقة وموثوقية للجميع.
استكشف المزيد حول الذكاء الاصطناعي من خلال زيارة GitHub repository الخاص بنا والانضمام إلى community الخاص بنا. تعرف على المزيد حول تطبيقات الذكاء الاصطناعي في مجالات self-driving وhealthcare.






