تخطّ إلى المحتوى
كل الرؤى بنية الذكاء الاصطناعي للقطاع المالي

اختيار النموذج لأعباء العمل المالية، انطلاقًا من المهمة

لا يمكن لقائمة التصنيف أن تخبرك أي نموذج يناسب عبء عملك المالي، بل المهمة ومجموعة تقييم هما من يفعلان ذلك. إليك كيف نختار، وما تكلفة المفاضلات فعليًا.

4 دقائق قراءة #البنية التقنية#النماذج#التقييم
متخصصون في القطاع المالي يعملون على مبادرة للذكاء الاصطناعي

عادةً ما يبدأ اختيار النموذج من السؤال الخاطئ. يتساءل الفريق عن أفضل نموذج، فينظر إلى قائمة تصنيف عامة، ويختار ما يتصدّرها هذا الشهر. المشكلة أن قائمة التصنيف لم تُقَس على مهمتك أنت. فهي لا تعرف إفصاحاتك المالية، ولا قواعد التسوية لديك، ولا تكلفة الإجابة الخاطئة في نهاية الربع.

لذا نبدأ من مكان آخر. دوِّن المهمة بعبارات واضحة، ثم ابنِ مجموعة تقييم صغيرة من أمثلة حقيقية لها. غالبًا ما تكفي خمسون أو مئة حالة لتكون مفيدة: المُدخَل، والإجابة التي ستقبلها، والإجابات التي لن تقبلها. مجموعة التقييم هذه هي ما تُحسِّن عليه فعليًا. وما إن توجد، حتى يتحول اختيار النموذج إلى تجربة يمكنك إجراؤها، بدلًا من رأي تضطر إلى الدفاع عنه.

ما تخبرك به مجموعة التقييم ولا تستطيع قائمة التصنيف إخبارك به

تُبلِّغ قائمة التصنيف عن متوسط عبر مهام ليست مهامك. أما مجموعة التقييم لديك فتُبلِّغ عن أداء النموذج في استخراج البيانات من إفصاحاتك بملفات PDF الفوضوية لديك، أو في ربط الكيانات عبر المورّدين الذين تتعامل معهم فعلًا. هذان سؤالان مختلفان، وكثيرًا ما يكون لكلٍّ منهما فائز مختلف.

كما يلتقط التقييم حالات الفشل التي تهمّ في المجال المالي دون سواه. فالنموذج الذي يسجّل أداءً جيدًا في الاختبارات المرجعية العامة قد يختلق رمز سبب، أو يُغفل إعادة بيان، أو يقرأ بهدوء قيمة لم تكن موجودة في التاريخ المعني. لن ترى ذلك إلا إذا احتوت مجموعة تقييمك على حالات مصمَّمة لإثارته. أما الاختبار المرجعي العام فلن يفعل ذلك أبدًا.

أجرِ المقارنة مرة واحدة، وستجد عادةً أن الترتيب ليس كما أوحت به قائمة التصنيف. أحيانًا يكون النموذج الأرخص في حدود نقطة واحدة من النموذج الرائد في مهمتك. وأحيانًا يكون الفارق كبيرًا، وقد بات هذا معلومًا لديك الآن أيضًا.

المفاضلات التي تشتريها فعلًا

نادرًا ما يكون الاختيار بين النماذج مفتوحة الأوزان والنماذج الرائدة قائمًا على الجودة الخام وحدها. وما إن تتجاوز بضعة نماذج عتبة تقييمك، حتى ينتقل القرار إلى أربعة أمور:

  • التكلفة. سعر الرمز الواحد عبر واجهة برمجة نموذج رائد، الذي يبدو تافهًا في عرض توضيحي، يصبح حقيقيًا حين تعالج كل إفصاح في نطاق تغطيتك. تميل تكلفة LLM وزمن الاستجابة إلى التحرك معًا، وكلاهما يتوسّع مع الحجم بطرق يُخفيها النموذج الأوّلي.
  • زمن الاستجابة. أداة تفاعلية للمحلل ومهمة دفعية ليلية لهما حدود تحمّل مختلفة جدًّا. فالنموذج البطيء أكثر من اللازم لواجهة محادثة قد يكون مناسبًا تمامًا لمهمة تعمل بينما الجميع نائمون.
  • طول السياق. بعض الأعباء تحتاج إلى وضع نموذج 10-K بكامله في النافذة دفعة واحدة؛ وأخرى يخدمها الاسترجاع عبر مستند طويل أفضل من نموذج يدّعي ابتلاع المستند بأكمله.
  • موطن البيانات. إذا كانت البيانات لا يجوز أن تغادر نطاقًا قضائيًا أو شبكة خاصة، فقد تكون واجهة برمجة نموذج رائد مستضاف خارج الحسبان بغضّ النظر عن درجته. النموذج مفتوح الأوزان الذي تشغّله محليًا يُبقي السجلات الحساسة داخل حدودك، وهو أحيانًا القيد الحاسم قبل أن تدخل الجودة في النقاش أصلًا.

هنا تحديدًا يمكن لنموذج صغير مضبوط أو مفتوح أن يتفوّق على واجهة برمجة نموذج رائد تفوّقًا صريحًا. ففي مهمة ضيّقة ومتكررة، كثيرًا ما يضاهي نموذج أصغر مضبوط على أمثلتك النموذجَ الكبير في تقييمك، ويعمل أسرع، ويكلّف أقل لكل نداء، ويمكن أن يستقر على عتاد تتحكم به أنت. تكفّ العمومية عن استحقاق ثمنها حين تكون المهمة غير عامة.

الارتهان ومشكلة التحديث الصامت

واجهة برمجة النموذج الرائد هدف متحرك. يمكن للمزوّد أن يغيّر النموذج خلف النقطة الطرفية نفسها، فتتبدّل درجات تقييمك دون أن يتغير سطر واحد من شيفرتك. وبالنسبة لنظام يُنتج مسار تدقيق، يمثّل ذلك انكشافًا حقيقيًا: فالنموذج الذي أنشأ إشعار إجراء سلبي في الربع الماضي قد لا يكون هو من يجيب اليوم، وقد لا يكون لديك أي سجل بهذا الاستبدال. تثبيت الإصدارات يساعد حيث يتيحه المزوّد. أما إبقاء مجموعة تقييمك قيد الاستخدام المستمر فيساعد أكثر، لأنه يحوّل التحديث الصامت إلى تراجع مرئي يمكنك رصده والتصرف حياله.

تُزيل الأوزان المفتوحة هذا الخطر بعينه. فالنموذج لا يتغير إلا إذا غيّرته أنت، ويمكنك إعادة إنتاج نتيجة سابقة بدقة. لهذه القابلية للتكرار تكلفتها الخاصة في الاستضافة والصيانة، فهي مفاضلة لا مكسب مجاني. ونحن نزنها حالةً بحالة.

وجِّه العمل، ولا تنتقِ فائزًا واحدًا

نادرًا ما يوجد نموذج واحد أفضل لخطّ معالجة بأكمله، ولست مضطرًّا إلى اختيار واحد. فللمهام الفرعية المختلفة احتياجات مختلفة. يمكن لنموذج رخيص وسريع أن يتولّى التصنيف أو الاستخراج عالي الحجم؛ ويمكن لنموذج أقوى أن يأخذ خطوات الاستدلال الأصعب؛ ويمكن لنموذج تستضيفه بنفسك أن يعالج السجلات التي لا يُسمح لها بمغادرة المبنى. كل مرحلة تنال النموذج الذي يفوز في شريحتها من التقييم.

التوجيه على هذا النحو يعني مزيدًا من الأجزاء المتحركة الواجب صيانتها، ولا نلجأ إليه إلا حيث يُظهر التقييم أنه يستحق عناءه. لكنه عادةً ما يكون الشكل الذي ينتهي إليه أي نظام حقيقي، لأن البديل هو دفع ثمن مبالَغ فيه لنموذج رائد كي يؤدي عملًا يؤديه نموذج أصغر بالكفاءة نفسها.

المنهج هو بيت القصيد. ابدأ من المهمة، وقِس على بيانات تشبه الإنتاج، ودع التقييم يقرّر. قائمة التصنيف هي اختبار مرجعي لشخص آخر. أما اختبارك أنت فهو الوحيد الذي يسدّد فواتيرك.

قراءات ذات صلة

#التقييم

التطوير المُوجَّه بالتقييم لأنظمة الذكاء الاصطناعي المالية

اكتب التقييم قبل الميزة. إليك كيف نُشغّل الذكاء الاصطناعي المالي على غرار التطوير المُوجَّه بالاختبارات (test-driven development)، مع مجموعة تقييم مُقيَّمة تحكم كل تغيير.

#البنية المعمارية

بناء منظومة تقييم لأنظمة RAG في المجال المالي

الانطباعات ليست تقييماً. هذه منظومة اختبار الاسترجاع والتوليد التي نبنيها كي يصبح لدى نظام RAG المالي رقم يتحرّك قبل أن يُطرح للإنتاج.

#البنية التقنية

الاسترجاع الهجين للإيداعات التنظيمية والمحاضر وتقارير المحللين

البحث الدلالي المحض يُضيّع الرموز الدقيقة للأسهم والمصطلحات المُعرَّفة التي تتوقف عليها الإجابات المالية. إليك كيف نبني نظام RAG هجين يستطيع المحلل أن يتتبّع إجابته رجوعًا إلى السطر المصدري.

#البنية

كيف تحوّل انطباع "يبدو جيدًا" إلى رقم قبل إطلاق نظام ذكاء اصطناعي مالي

أي نظام ذكاء اصطناعي مالي يحتاج إلى رقم دقة قابل للدفاع قبل دخوله الخدمة. هذه هي مجموعة التقييم التي نبنيها، والأساس المرجعي الذي نقيس عليه، ولماذا يهتم التدقيق بذلك.

تعمل على شيء مشابه؟

أخبِرنا عن بياناتك وسير العمل المحيط بها، وسنعطيك رأياً صريحاً.

احجز مكالمة تعريفية مدتها 30 دقيقة