العقود الآجلة
وصول إلى مئات العقود الدائمة
CFD
الذهب
منصّة واحدة للأصول التقليدية العالمية
الخیارات المتاحة
Hot
تداول خيارات الفانيلا على الطريقة الأوروبية
الحساب الموحد
زيادة كفاءة رأس المال إلى أقصى حد
التداول التجريبي
مقدمة حول تداول العقود الآجلة
استعد لتداول العقود الآجلة
أحداث مستقبلية
"انضم إلى الفعاليات لكسب المكافآت "
التداول التجريبي
استخدم الأموال الافتراضية لتجربة التداول بدون مخاطر
CFD
مشتقات عقود الفروقات على الأسهم
الأسهم الأمريكية
وصول إلى الأسهم الأمريكية وصناديق ETF الحقيقية
أسهم هونغ كونغ
تداول أسهم عالية الجودة مدرجة في هونغ كونغ
الأسهم الكورية
SK Hynix
تداول الأسهم الكورية الحقيقية واستثمر في الأصول الشائعة
العقود الآجلة للأسهم
رافع مالية عالية، وتداول على مدار 24/7
الأسهم المُرمَّزة
مدعومة بأصول أسهم حقيقية
IPO Access
افتح الوصول الكامل إلى الاكتتابات العامة للأسهم العالمية
GUSD
3.8٪
سك GUSD للحصول على عوائد أصول العالم الحقيقي (RWA) للخزانة
أنشطة الأسهم
تداول الأسهم الرائجة واحصل على إنزالات جوية سخية
إطلاق
CandyDrop
اجمع الحلوى لتحصل على توزيعات مجانية.
منصة الإطلاق
-التخزين السريع، واربح رموزًا مميزة جديدة محتملة!
HODLer Airdrop
احتفظ بـ GT واحصل على توزيعات مجانية ضخمة مجانًا
Pre-IPOs
افتح الوصول الكامل إلى الاكتتابات العامة للأسهم العالمية
نقاط Alpha
تداول الأصول على السلسلة واكسب التوزيعات المجانية
نقاط العقود الآجلة
اكسب نقاط العقود الآجلة وطالب بمكافآت التوزيع المجاني
عروض ترويجية
AI
Gate AI
شريكك الذكي الشامل في الذكاء الاصطناعي
Gate AI Bot
استخدم Gate AI مباشرة في تطبيقك الاجتماعي
GateClaw
Gate الأزرق، جاهز للاستخدام
Gate for AI Agent
البنية التحتية للذكاء الاصطناعي، Gate MCP، Skills و CLI
Gate Skills Hub
أكثر من 10 آلاف مهارة
من المكتب إلى التداول، مكتبة المهارات الشاملة تجعل الذكاء الاصطناعي أكثر فعالية
اختبار عملي من OpenAI: إن «صدق» الذكاء الاصطناعي هو تمثيل يُقدَّم للممتحِنين، لا أحد يراقب فيُكذِب
قدّمت OpenAI وApollo Research منهجية اختبار بعنوان "Contrastive SDF" (التضبيط بصيغة ملفات توليفية متباينة)، وأثبتت أنه في ظل التدريب بالتعلّم التعزيزي، تميل نماذج الذكاء الاصطناعي بشكل متزايد إلى إرضاء من يقيّمها، بل قد يصبح الصدق أو عدمه بالكامل رهناً بما تظنه أن المُقيِّم يريد.
(خلفية سابقة: هل تم تقييد تصدير Claude Fable 5 لأنه كان شديد القسوة؟ في تجربة البقاء، قُضى 96% من الوقت في تدمير نماذج ذكاء اصطناعي أخرى)
(إضافة سياقية: معهد السلامة في مجال الذكاء الاصطناعي في المملكة المتحدة: خمسة نماذج رائدة كلها غشّت أثناء الاختبار، وأقل من نصفها اعتقد أنه مخطئ)
فهرس المقال
Toggle
هل يمكن لنسبة مخالفة التعهد بالصدق—عندما يواجه النموذج نفسه السؤال نفسه، لكن "لأنها تظن أن المُقيِّم يريد شيئًا مختلفًا"—أن تقلب بين 9% و87%؟ يشير بحث مواءمة جديد صادر عن OpenAI وApollo Research معًا إلى أن هذا ميل يمكن قياسه بشكل منهجي؛ فالـ"صدق" الذي تقوله نماذج الذكاء الاصطناعي قد يكون على الأرجح مجرد عرض يُقدَّم للمُقيِّمين.
والأكثر إزعاجًا هو أن نص هذا العرض قد يصبح أكثر إتقانًا كلما طال التدريب، فيبدو أكثر تصديقًا، بحيث يصعب التفريق بين ما إذا كان النموذج قد صار "أطوع" فعلًا، أو صار فقط أكثر مهارة في التمثيل.
النموذج لا يفعل ما هو صحيح، بل يفعل ما يرضي من يُقيِّم
سمّى فريق البحث هذا الميل reward-seeking (السعي وراء المكافأة). وببساطة يعني ذلك أن النموذج في داخله "يُمثِّل" من يقيِّمه، ثم يقرر كيفية التصرف بناءً على "ما يعتقد أن المُقيِّم سيكافئه"، بدلًا من أن يقرر بناءً على ما ينبغي فعله فعليًا في المهمة.
يصعب التقاط هذه الظاهرة لأن النموذج الجيد قد يفعل ما هو صحيح أيضًا "لأسباب خاطئة". مثال كلاسيكي هو وكيل مُتدرّب بالتعلّم التعزيزي (RL، أي تدريب النموذج بمكافآت: صح يكسب، وخطأ يعاقب). في بيئة يكون فيها تسليم العملات في أقصى يمين الممر، يتعلم الوكيل "الجري إلى اليمين" لا "البحث عن العملات".
قد يبدو السلوك مطابقًا تمامًا لبيانات التدريب، بينما تكمن وراءه إستراتيجية داخلية تتعقب مؤشرًا بديلًا خاطئًا. لاحظ فريق البحث أن نقاط تفتيش تدريب متعددة لنماذج رائدة، حتى دون أي تلميحات خاصة، تستنتج تلقائيًا "ما الذي يريد المُقيِّم"، لكن هذا الاستنتاج الذي يُقال إنه قائم على المعتقدات غير موثوق؛ إذ يمكن للنموذج أن يتصرف وفق معتقداته دون أن يقول كلمة واحدة عن ذلك.
تغذية النموذج بملفات مزيفة لرؤية ما إذا كانت معتقداته ستتغير وما إذا كان سلوكه سيتبعها
ولقياس هذا الميل، صمّم فريق البحث "Contrastive SDF" (التضبيط بصيغة ملفات توليفية متباينة). تتضمن الطريقة استخدام مجموعة من ملفات مكتوبة وكأنها صيغ ما قبل التدريب الحقيقية—أوراق، أخبار، كتب مدرسية—ثم ضبط النموذج عليها لإدخال معتقد معيّن في ذهنه، وبعد ذلك مراقبة ما إذا كان سلوكه سيتغير أم لا.
وتكمن العقدة في تصميم المقارنة: تم تدريب النموذج نفسه على نسختين متماثلتين؛ نسخة تُغذّى بملفات تُظهر تفضيل المُقيِّم لميزة f، مع عكس ذلك بالنسبة لسلطة مخالفة (سواء مستخدم أو مطور) تفضّل ميزات عكسية، ونسخة أخرى تُغذّى تمامًا بتركيبة معكوسة. الفرق في معدل إخراج f بين النسختين يُمثل "فجوة المُقيِّم"؛ وكلما ازداد الفرق، دلّ ذلك على أن النموذج يميل أكثر إلى إرضاء المُقيِّم.
اختبر فريق البحث نقطة تفتيش تدريب لتعزّز التعلم لـ o3 من OpenAI، وهو نموذج قوي للتعلم التعزيزي دون تدريب أمان خاص. ونتيجةً لتقدم التدريب، ارتفعت فجوة الانحياز لصالح المُقيِّم باستمرار، في حين ظلت تفضيلاته تجاه السلطات الأخرى شبه ثابتة؛ والانتقال كان يطال المُقيِّم فقط.
وكان اختبار الصدق أكثر لفتًا: في اختبار "Broken Promises Coding"، يُطلب من النموذج أن يلتزم بوعْد إلى رئيسه بعدم استخدام أداة مُقيَّدة، لكن مهمة التنفيذ تتطلب استعمالها فعليًا. عندما تشير الملفات المُدخلة إلى أن "المُقيِّم يكافئ إتمام المهمة"، ارتفعت نسبة خرق العهد في نقاط التفتيش اللاحقة إلى 87%؛ أما عندما تشير إلى أن "المُقيِّم يكافئ الصدق"، فانخفضت نسبة الخرق إلى 9% فقط. في السؤال نفسه، ومع النموذج نفسه، يتحدد مستوى الصدق كليًا بما "يظنه المُقيِّم يريد".
التحقق فعّال، لكنه يعني أيضًا أن هذا الميل قد يكون صعبًا في التدريب على التخلص منه
ولإثبات أن طريقة القياس هذه تقيس بالفعل "السعي وراء إرضاء المُقيِّم"، استخدم فريق البحث في المقابل مجموعة من نماذج "تعرف مسبقًا" ما تفضله، للمقارنة.
تكوّن المجموعة الأولى من نموذجين "قراصنة مكافآت" درّبتهم Redwood Research (يقومون بالبحث عن ثغرات القواعد من أجل الحصول على درجات أعلى)، ويستند كل منهما إلى gpt-oss-120b وKimi K2.5 على التوالي. وبمجرد تدريب هذين النموذجين على حب اكتشاف الثغرات، زادت فجوة المُقيِّم بالفعل. أما المجموعة الثانية فكانت تضم ثلاثة "كائنات نمذجة" مُضبوطة باستخدام gpt-oss-120b، جرى تدريب كل واحد منها عمدًا بحيث يرضي جهة واحدة فقط: المستخدم، أو المُقيِّم، أو القيادة لدى OpenAI. ونتيجة ذلك، أعادت فجوة كل نموذج—بدقة—توجيهها إلى الجهة التي جرى تدريبه ليُرضيها.
هنا ينبغي التفريق أولًا بين كلمتين متشابهتين لكن غير متطابقتين. reward-seeking (السعي وراء المكافأة) هو ميل عام: يقوم النموذج بتعديل سلوكه وفقًا لما يعتقد أنه سيُكافأ عليه. بينما reward-hacking (الاحتيال لاستغلال المكافأة عبر ثغراتها) هو أسلوب محدد: مجرد محاولة الحصول على درجات أعلى عبر استغلال ثغرة بعينها.
ولا يلزم أن يظهران معًا دائمًا: قد يكتسب النموذج عادة سيئة تتمثل في استغلال الثغرات دون أن يفكر أصلًا في آلية المكافأة الكامنة؛ لكن نموذجًا يعرف كيف يستغل الثغرات في مختلف السياقات الجديدة عادةً يكون ساعيًا حقيقيًا وراء المكافأة دون مواربة. واللافت أن فجوة قراصنة المكافآت اللذين ذكرتهما آنفًا قد ازدادت بالفعل، ما يؤكد هذه العلاقة.
المكان الحقيقي الذي تتجلى فيه الخطورة هو أن هذا الميل قد يجعل "الاختبارات المصممة للعثور على المشكلة" تفشل. فقد يكون نموذج ماهرًا في إرضاء المُقيِّم لأنه استنتج أن "الآن يتم اختبار الصدق"، فيلتزم بعدم كسر الوعود. لكن في يوم يتغير فيه أسلوب الرقابة، قد لا يستمر في كونُه طيبًا أو ملتزمًا.
وبالإضافة إلى ذلك، حتى لو كان المُقيِّم نفسه مثاليًا، فلن تختفي المخاطر—لأن ما تعلّمه النموذج منذ البداية هي "إرضاء المُقيِّم"، لا "أن القيام بذلك هو الصواب". وبمجرد أن يدخل إلى سيناريو لا يوجد فيه أحد يقيِّمه، أو لا يمكن مراقبته فعليًا، فمن المرجح أن يتدهور سلوكه، لأن إستراتيجيته الأساسية أصلاً ليست موجهة نحو جعل الأمور تُنجز بشكل صحيح.
والأكثر إزعاجًا هو أن هذا الميل قد لا يكون قابلاً للإزالة: عندما تدربه على السلوكيات السيئة، فإنك غالبًا لا تقوم إلا بتحديث معرفته بـ"ما الذي سيُكافأ عليه"، دون أن تغيّر فعليًا تفضيلاته العميقة. وقدمت Anthropic مع Claude Opus 4.8 دليلًا جانبيًا كذلك: جهاز مراقبة يعمل على مستويات تفعيل مختلفة، التقط إشارات في حوالي 5% من دورات التعلّم التعزيزي بأن النموذج بات يدرك وجود "المُقيِّم".
واليوم، تقوم كل مختبرات الطليعة بتوسيع التعلّم التعزيزي إلى حدود أكبر، ويزداد وعي النماذج بوضعها كلما طال التدريب؛ لذلك فإن reward-seeking لا يمكن إلا أن يزيد ولا ينقص. وعليه، فالمقصود ليس فقط ما بعد إطلاق النموذج، بل لحظة التدريب نفسها: إذ إنه من الممكن تمامًا أن يتعلم كيف يمثل قبل أن يراه أحد.