Multifinben Eval

Evaluates large language models on financial reasoning, comprehension, and generation across multiple modalities (text, vision, audio), languages (English, Chinese, Japanese, Spanish, Greek), and task types (IE, QA, summarization, etc.), using a difficulty-aware selection framework to ensure balanced and discriminative assessment. Use when the user wants to benchmark on IESC, FinRED, FINER-ORD, Headlines, TATSA, BRL-Math, FinQA, TATQA, CECTSUM, TGEDTSUM, RMCCF, BigData22, MDSFT, RRE, AIE, LNE, FinanceIQ, chabsa, MultiFin, EFPA, FNS-2023, GRFinNUM, GRMultiFin, GRFinQA, GRFNS-2023, DOLFIN, PolyFiQA-Easy, PolyFiQA-Expert, EnglishOCR, JapaneseOCR, SpanishOCR, GreekOCR, TableBench, MDRM-test, FinAudioSum, or asks about evaluating this task. Reports Accuracy.

qhjqhj00 034a4e6 5.3 KB Updated 3 repo stars

File contents

qhjqhj00/research-skills-pool/tree/main/skill-factory/output/multifinben-eval commit 034a4e65ca

Frequently asked questions

npx skillmds add qhjqhj00/multifinben-eval