Category:LLM benchmarks
Jump to navigation
Jump to search
LLM benchmarks
Pages in category "LLM benchmarks"
The following 200 pages are in this category, out of 646 total.
(previous page) (next page)A
- AgentHarm (benchmark) — معيار قياس الضرر لعملاء LLM
- AgentHarm (BG)
- AgentHarm (BN)
- AgentHarm (CS)
- AgentHarm (DE)
- AgentHarm (EL)
- AgentHarm (ES)
- AgentHarm (FA)
- AgentHarm (FR)
- AgentHarm (HI)
- AgentHarm (HU)
- AgentHarm (ID)
- AgentHarm (IT)
- AgentHarm (KO)
- AgentHarm (NL)
- AgentHarm (PL)
- AgentHarm (PT)
- AgentHarm (RO)
- AgentHarm (SV)
- AgentHarm (TH)
- AgentHarm (TL)
- AgentHarm (TR)
- AgentHarm (UR)
- AgentHarm (VI)
- AgentHarm — エージェントハーム
- AgentHarm — 智能体危害基准
- Avaliação de LLMs
B
- BBQ (Bias Benchmark for Question Answering) (BG)
- BBQ (Bias Benchmark for Question Answering) (BN)
- BBQ (Bias Benchmark for Question Answering) (CS)
- BBQ (Bias Benchmark for Question Answering) (DE)
- BBQ (Bias Benchmark for Question Answering) (EL)
- BBQ (Bias Benchmark for Question Answering) (ES)
- BBQ (Bias Benchmark for Question Answering) (FA)
- BBQ (Bias Benchmark for Question Answering) (FR)
- BBQ (Bias Benchmark for Question Answering) (HE)
- BBQ (Bias Benchmark for Question Answering) (HI)
- BBQ (Bias Benchmark for Question Answering) (HU)
- BBQ (Bias Benchmark for Question Answering) (ID)
- BBQ (Bias Benchmark for Question Answering) (IT)
- BBQ (Bias Benchmark for Question Answering) (KO)
- BBQ (Bias Benchmark for Question Answering) (NL)
- BBQ (Bias Benchmark for Question Answering) (PL)
- BBQ (Bias Benchmark for Question Answering) (PT)
- BBQ (Bias Benchmark for Question Answering) (RO)
- BBQ (Bias Benchmark for Question Answering) (SV)
- BBQ (Bias Benchmark for Question Answering) (TH)
- BBQ (Bias Benchmark for Question Answering) (TL)
- BBQ (Bias Benchmark for Question Answering) (TR)
- BBQ (Bias Benchmark for Question Answering) (UR)
- BBQ (Bias Benchmark for Question Answering) (VI)
- BBQ (Bias Benchmark for Question Answering) — معيار التحيز للإجابة على الأسئلة
- BBQ (Bias Benchmark for Question Answering) — 質問応答バイアスベンチマーク
- BBQ (Bias Benchmark for Question Answering) — 问答偏见基准
- Benchmark dei LLM
- Benchmark LLM
- Benchmark-uri LLM
- Benchmarki LLM
- Benchmarks de LLM (ES)
- Benchmarks de LLM (PT)
- Benchmarks des LLM
- Benchmarky LLM
- BIG-bench (benchmark) (BG)
- BIG-bench (benchmark) (BN)
- BIG-bench (benchmark) (CS)
- BIG-bench (benchmark) (DE)
- BIG-bench (benchmark) (EL)
- BIG-bench (benchmark) (ES)
- BIG-bench (benchmark) (FA)
- BIG-bench (benchmark) (FR)
- BIG-bench (benchmark) (HE)
- BIG-bench (benchmark) (HI)
- BIG-bench (benchmark) (HU)
- BIG-bench (benchmark) (ID)
- BIG-bench (benchmark) (IT)
- BIG-bench (benchmark) (KO)
- BIG-bench (benchmark) (NL)
- BIG-bench (benchmark) (PL)
- BIG-bench (benchmark) (PT)
- BIG-bench (benchmark) (RO)
- BIG-bench (benchmark) (SV)
- BIG-bench (benchmark) (TH)
- BIG-bench (benchmark) (TL)
- BIG-bench (benchmark) (TR)
- BIG-bench (benchmark) (UR)
- BIG-bench (benchmark) (VI)
- BIG-bench (benchmark) — معيار بيغ-بنش
- BIG-bench (benchmark) — ビッグベンチ
- BIG-bench (benchmark) — 大规模基准测试
- BOLD (Bias in Open-Ended Language Generation Dataset) (BG)
- BOLD (Bias in Open-Ended Language Generation Dataset) (BN)
- BOLD (Bias in Open-Ended Language Generation Dataset) (CS)
- BOLD (Bias in Open-Ended Language Generation Dataset) (DE)
- BOLD (Bias in Open-Ended Language Generation Dataset) (EL)
- BOLD (Bias in Open-Ended Language Generation Dataset) (ES)
- BOLD (Bias in Open-Ended Language Generation Dataset) (FA)
- BOLD (Bias in Open-Ended Language Generation Dataset) (FR)
- BOLD (Bias in Open-Ended Language Generation Dataset) (HE)
- BOLD (Bias in Open-Ended Language Generation Dataset) (HI)
- BOLD (Bias in Open-Ended Language Generation Dataset) (HU)
- BOLD (Bias in Open-Ended Language Generation Dataset) (ID)
- BOLD (Bias in Open-Ended Language Generation Dataset) (IT)
- BOLD (Bias in Open-Ended Language Generation Dataset) (KO)
- BOLD (Bias in Open-Ended Language Generation Dataset) (NL)
- BOLD (Bias in Open-Ended Language Generation Dataset) (PL)
- BOLD (Bias in Open-Ended Language Generation Dataset) (PT)
- BOLD (Bias in Open-Ended Language Generation Dataset) (RO)
- BOLD (Bias in Open-Ended Language Generation Dataset) (SV)
- BOLD (Bias in Open-Ended Language Generation Dataset) (TH)
- BOLD (Bias in Open-Ended Language Generation Dataset) (TL)
- BOLD (Bias in Open-Ended Language Generation Dataset) (TR)
- BOLD (Bias in Open-Ended Language Generation Dataset) (UR)
- BOLD (Bias in Open-Ended Language Generation Dataset) (VI)
- BOLD (Bias in Open-Ended Language Generation Dataset) — BOLD
- BOLD (Bias in Open-Ended Language Generation Dataset) — オープンエンド言語生成におけるバイアスデータセット
- BOLD (Bias in Open-Ended Language Generation Dataset) — 开放式语言生成偏见数据集
E
- Elo ranking of language models (CS)
- Elo ranking of language models — ELO-κατάταξη μοντέλων
- Elo ranking of language models — ELO-رتبهبندی مدلها
- Elo ranking of language models — דירוג ELO של מודלי שפה
- Elo ranking of language models — تصنيف ELO للنماذج
- Elo ranking of language models — زبان کے ماڈلز کی درجہ بندی
- Elo ranking of language models — भाषा मॉडलों की ELO-रैंकिंग
- Elo ranking of language models — ভাষা মডেলের ELO র্যাংকিং
- Elo ranking of language models — การจัดอันดับโมเดลด้วย ELO
- Elo ranking of language models — モデルのELOランキング
- Elo ranking of language models — 模型的ELO排名
- Elo ranking of language models — 언어 모델 ELO 랭킹
- ELO Sıralaması
- ELO-clasamentul modelelor
- ELO-Peringkat Model
- ELO-ranggo ng mga modelo
- ELO-rangschikking van modellen
- ELO-rangsorolás modellek
- ELO-ranking dei modelli
- ELO-Ranking von Sprachmodellen
- ELO-rankning av språkmodeller
- ELO-rankowanie modeli
- ELO-ранжиране на модели
- Evaluación de los LLM
- Evaluarea LLM
- Evaluasi LLM
- Evaluatie van LLM
F
- FLORES-200 (BG)
- FLORES-200 (BN)
- FLORES-200 (CS)
- FLORES-200 (DE)
- FLORES-200 (EL)
- FLORES-200 (ES)
- FLORES-200 (FA)
- FLORES-200 (FR)
- FLORES-200 (HE)
- FLORES-200 (HI)
- FLORES-200 (HU)
- FLORES-200 (ID)
- FLORES-200 (IT)
- FLORES-200 (KO)
- FLORES-200 (NL)
- FLORES-200 (PL)
- FLORES-200 (PT)
- FLORES-200 (RO)
- FLORES-200 (SV)
- FLORES-200 (TH)
- FLORES-200 (TL)
- FLORES-200 (TR)
- FLORES-200 (UR)
- FLORES-200 (VI)
- FLORES-200 — FLORES-200
- FLORES-200 — FLORES-200(多语言翻译基准)
- FLORES-200 — فْلورِس-200
G
- GLUE Benchmark (BG)
- GLUE Benchmark (BN)
- GLUE Benchmark (CS)
- GLUE Benchmark (DE)
- GLUE Benchmark (EL)
- GLUE Benchmark (ES)
- GLUE Benchmark (FA)
- GLUE Benchmark (FR)
- GLUE Benchmark (HE)
- GLUE Benchmark (HI)
- GLUE Benchmark (HU)
- GLUE Benchmark (ID)
- GLUE Benchmark (IT)
- GLUE Benchmark (KO)
- GLUE Benchmark (NL)
- GLUE Benchmark (PL)
- GLUE Benchmark (PT)
- GLUE Benchmark (RO)
- GLUE Benchmark (SV)
- GLUE Benchmark (TH)
- GLUE Benchmark (TL)
- GLUE Benchmark (TR)
- GLUE Benchmark (UR)
- GLUE Benchmark (VI)
- GLUE Benchmark — GLUEベンチマーク
- GLUE Benchmark — GLUE基准
- GLUE Benchmark — معيار GLUE
- GSM8K (Grade School Math 8K) (BG)
- GSM8K (Grade School Math 8K) (BN)