1. يمثل الذكاء الاصطناعي الوكيل مشكلة أنظمة أكبر، وليست مجرد مشكلة استدلال.
  2. غالبية أدوات الذكاء الاصطناعي الحالية محدودة ولا تقيس الأداء العام للنظام.
  3. يتم تنفيذ سعة الخطة باستخدام الوكلاء لكل كثافة وحدة المعالجة المركزية الافتراضية (vCPU)، وليس عدد الوكلاء.
  4. مراقبة زمن وصول مهمة الوكيل، وليس فقط متوسط ​​استخدام وحدة المعالجة المركزية.
  5. الإعداد الافتراضي هو التوسع لوكلاء استضافة الأنظمة. قم بحجز نطاق أوسع لأحمال العمل ذات القيود الهيكلية أو القيود الهيكلية الأثقل لكل وكيل.

ما وراء الاستدلال: الوكلاء كأتمتة لسير العمل

Agent AI هو أكثر من مجرد استنتاج LLM. تعتمد قيمتها المؤسسية على النظام الكامل، وتنسيق المهام، والوصول إلى البيانات، وتنفيذ الأدوات، وإدارة زمن الوصول، والحوكمة، والبنية التحتية القابلة للتطوير. الوكيل عبارة عن عملية سير عمل مؤسسية مؤتمتة موجهة نحو الهدف: فهو يخطط لمهمة متعددة الخطوات، ويستدعي الأدوات، ويقرأ النتائج، ويعيد المحاولة عندما يفشل شيء ما. ولذلك فإن وكلاء المؤسسة ليسوا مجرد مشكلة استدلال؛ إنها مشكلة أنظمة.

تحديد الشكل الجيد

تركز معظم مقاييس الذكاء الاصطناعي على تقييم LLM المستخدم. تحتاج فرق النظام الأساسي أيضًا إلى معرفة المدة التي تستغرقها المهام، وعدد الوكلاء الذين يمكن للأسطول دعمهم، وما يختبره المستخدمون في نهاية عملية التنفيذ، وكيف تتغير التكاليف مع عمل المزيد من الوكلاء في وقت واحد.

تنظر طريقة عرض المؤسسة الأكثر فائدة إلى ستة مقاييس:

  1. معدل نجاح المهمة
  2. التكلفة لكل مهمة
  3. الوقت لكل مهمة
  4. إنتاجية المهمة
  5. كثافة الوكيل (الوكلاء لكل وحدة معالجة مركزية افتراضية)
  6. كمون

تجيب هذه الأسئلة معًا على الأسئلة التي يهتم بها مشغلو الذكاء الاصطناعي في المؤسسات: هل يعمل النظام كما هو متوقع؟ كم عدد العملاء الذين يستطيع النظام دعمهم؟ كيف ينبغي توسيع نطاقها لدعم المزيد من الوكلاء؟

البناء على أسس متينة

للحصول على نظرة أعمق حول أداء أعباء عمل الذكاء الاصطناعي، قامت Intel بتوسيع Terminal-Bench، وهو أداة قياس مرجعية مفتوحة المصدر لتقييم وكلاء الذكاء الاصطناعي من خلال إمكانيات التوصيف والقياس عن بعد وإعادة التشغيل. هذا جعل من الممكن فهم المكان الذي قضى فيه الوكلاء وقتًا يتجاوز استنتاج LLM.

استخدم الامتداد المعياري إعادة تسجيل حتمية لاستجابات LLM لفصل أداء الوكيل عن تقلبات LLM. تم تسجيل استجابات LLM مرة واحدة وتم إعادتها بشكل مماثل عبر عمليات التشغيل، مما يقلل من تباين التشغيل إلى التشغيل وإنشاء أساس أكثر موثوقية للمقارنة.

كان مزيج المهام Terminal-Bench المستخدم واسعًا عن قصد. وشملت التجميع والاختبار وعمليات قاعدة البيانات والمنطق المنطقي والتفسير وتتبع الشعاع والضغط والجبر الخطي وتحويل ترميز الفيديو والتدريب على التعلم الآلي. وهذا التنوع الواسع جعل النتائج أكثر صلة ببيئات المؤسسات الحقيقية.


اكتشاف المزيد من موقع اشراقات- التقنية تشرق

اشترك للحصول على أحدث التدوينات المرسلة إلى بريدك الإلكتروني.

شاركها.
اترك تعليقاً

اكتشاف المزيد من موقع اشراقات- التقنية تشرق

اشترك الآن للاستمرار في القراءة والحصول على حق الوصول إلى الأرشيف الكامل.

متابعة القراءة