Arabic Agent Eval

Arabic function-calling benchmark — evaluate how well LLMs handle tool calling in Arabic

moshe-ship dd47e60 1.8 KB Updated

File contents

تقييم الوكلاء العرب — Arabic Agent Eval

أول معيار قياس لاستدعاء الأدوات بالعربي.

التثبيت

pip install arabic-agent-eval

الاستخدام

تقييم سريع

aae quick openai

تقييم كامل

aae run

مقارنة بين موفرين

aae compare openai anthropic

فئات التقييم

ست فئات:

  1. استدعاء بسيط — اختيار الدالة الصحيحة واستخراج المعاملات
  2. استخراج المعاملات — استخراج بيانات عربية من نص طبيعي
  3. تفكير متعدد الخطوات — سلسلة استدعاءات متتابعة
  4. معالجة اللهجات — فهم خليجي ومصري وشامي ومغاربي
  5. اختيار الأداة — اختيار الأداة الصحيحة من عشر خيارات
  6. معالجة الأخطاء — التعامل مع ردود الخطأ بالعربي

مجموعة البيانات

  • واحد وخمسين عنصر تقييم
  • خمس لهجات عربية
  • اثنين وعشرين دالة عربية (صلاة، زكاة، قرآن، أسهم تداول، وغيرها)
  • ثلاث مستويات صعوبة

التقييم

لكل عنصر:

  • اختيار الدالة: هل اختار الموديل الدالة الصحيحة؟
  • دقة المعاملات: هل المعاملات المستخرجة صحيحة؟
  • حفظ العربية: هل القيم العربية محفوظة ولا تُرجمت؟
  • فهم اللهجة: هل فهم الموديل اللهجة؟

إحصائيات المجموعة

aae dataset

moshe-ship/hurmoz/tree/main/arabic-agent-eval commit dd47e60ddd

Frequently asked questions

npx skillmds@latest add moshe-ship/arabic-agent-eval