# Arabic Agent Eval

> Arabic function-calling benchmark — evaluate how well LLMs handle tool calling in Arabic

- Skill: `moshe-ship/arabic-agent-eval` (Agent Skill)
- Install (CLI): `npx skillmds@latest add moshe-ship/arabic-agent-eval`
- Raw SKILL.md: https://api.skillmd.com/api/skills/moshe-ship/arabic-agent-eval/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: AI & ML
- License: MIT
- Author: moshe-ship (https://skillmd.com/u/moshe-ship)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/moshe-ship/arabic-agent-eval

---


# تقييم الوكلاء العرب — Arabic Agent Eval

أول معيار قياس لاستدعاء الأدوات بالعربي.

## التثبيت

```bash
pip install arabic-agent-eval
```

## الاستخدام

### تقييم سريع

```bash
aae quick openai
```

### تقييم كامل

```bash
aae run
```

### مقارنة بين موفرين

```bash
aae compare openai anthropic
```

## فئات التقييم

ست فئات:

1. استدعاء بسيط — اختيار الدالة الصحيحة واستخراج المعاملات
2. استخراج المعاملات — استخراج بيانات عربية من نص طبيعي
3. تفكير متعدد الخطوات — سلسلة استدعاءات متتابعة
4. معالجة اللهجات — فهم خليجي ومصري وشامي ومغاربي
5. اختيار الأداة — اختيار الأداة الصحيحة من عشر خيارات
6. معالجة الأخطاء — التعامل مع ردود الخطأ بالعربي

## مجموعة البيانات

- واحد وخمسين عنصر تقييم
- خمس لهجات عربية
- اثنين وعشرين دالة عربية (صلاة، زكاة، قرآن، أسهم تداول، وغيرها)
- ثلاث مستويات صعوبة

## التقييم

لكل عنصر:
- اختيار الدالة: هل اختار الموديل الدالة الصحيحة؟
- دقة المعاملات: هل المعاملات المستخرجة صحيحة؟
- حفظ العربية: هل القيم العربية محفوظة ولا تُرجمت؟
- فهم اللهجة: هل فهم الموديل اللهجة؟

## إحصائيات المجموعة

```bash
aae dataset
```

