Legal Benchmark
Cum este construit HAQQ Legal Benchmark, ce măsoară, ce nu măsoară în mod deliberat și unde găsiți cifrele pe care le produce.
Ce este
Două evaluări sub același nume, efectuate la scări diferite, deoarece răspund la întrebări diferite.
| Evaluare | Scală | Formă | Întrebarea |
|---|---|---|---|
| Benchmark-ul de sarcini | Din 50 | 11 categorii de sarcini juridice în 19 sisteme | Pentru munca pe care o deleagă un avocat în mod real, cine produce cel mai bun rezultat? |
| Studiul cross-domain | Din 100 | 25 de benchmark-uri în 5 domenii | În confruntarea cu modelele de vârf pe propriul lor teren, unde se situează un motor specializat în domeniul juridic? |
Cele două scări nu sunt interschimbabile. Un scor din 50 la benchmark-ul de sarcini și un scor din 100 la studiul cross-domain măsoară activități diferite pe grile diferite. Dublarea unuia nu îl produce pe celălalt, iar cele două nu trebuie să apară niciodată în același tabel sau în aceeași propoziție ca și cum ar fi comparabile.
Benchmark-ul de sarcini
Unsprezece categorii de sarcini măsurate, punctate din 50. Cel mai bun rezultat din fiecare rând este evidențiat cu caractere aldine. Acestea sunt cifrele pe care clasamentul pe arii de practică de pe haqq.ai le grupează în arii de practică.
| Categorie | 1st | 2nd | 3rd | 4th | 5th |
|---|---|---|---|---|---|
| Legal | HAQQ (Justinian) 49 | Anthropic: Claude Fable 5 45 | Anthropic: Claude Opus 4.8 43 | Mike OS 42 | DeepSeek: DeepSeek V4 Pro 40 |
| Contract Drafting | HAQQ (Justinian) 47 | Spellbook 46 | Anthropic: Claude Fable 5 45 | Anthropic: Claude Opus 4.8 43 | Legora 42 |
| Legal Research | HAQQ (Justinian) 47 | LexisNexis +AI 46 | Perplexity Sonar 43 | Anthropic: Claude Fable 5 41 | Thomson Reuters CoCounsel 40 |
| Law Explanation | HAQQ (Justinian) 46 | OpenAI: GPT-5.6 Sol Pro 45 | Anthropic: Claude Fable 5 43 | Google: Gemini 3.1 Pro 41 | Anthropic: Claude Opus 4.8 39 |
| Employment Agreement | HAQQ (Justinian) 48 | Anthropic: Claude Fable 5 43 | Harvey Tenet 42 | Mike OS 41 | Legora 40 |
| Memo Drafting | HAQQ (Justinian) 44 | Thomson Reuters CoCounsel 42 | Anthropic: Claude Fable 5 41 | Anthropic: Claude Opus 4.8 41 | Mike OS 39 |
| License Agreement | HAQQ (Justinian) 46 | Anthropic: Claude Opus 4.8 43 | Anthropic: Claude Fable 5 42 | Spellbook 41 | Legora 40 |
| Shareholder Agreement | HAQQ (Justinian) 47 | Harvey Tenet 44 | Anthropic: Claude Fable 5 42 | Mike OS 41 | Anthropic: Claude Opus 4.8 40 |
| Consultancy Agreement | HAQQ (Justinian) 45 | Anthropic: Claude Fable 5 42 | Legora 41 | Mike OS 40 | Anthropic: Claude Opus 4.8 39 |
| Commercial Agreement | HAQQ (Justinian) 47 | Harvey Tenet 43 | Anthropic: Claude Opus 4.8 42 | Anthropic: Claude Fable 5 41 | Mike OS 40 |
| NDA Drafting | HAQQ (Justinian) 49 | Anthropic: Claude Fable 5 45 | Spellbook 44 | Mike OS 42 | Anthropic: Claude Opus 4.8 41 |
Studiul cross-domain
Douăzeci și cinci de benchmark-uri în cinci domenii, punctate din 100. Aceeași rulare pe care tabelul de sarcini de pe /justinian o sortează și o filtrează.
| Benchmark | HAQQ (Justinian) | Anthropic: Claude Opus 4.8 | Thomson Reuters CoCounsel | Google: Gemini 3.1 Pro | Z.ai: GLM 5.2 | OpenAI: GPT-5.6 Sol Pro | Kimi: K3 | Anthropic: Claude Sonnet 5 | Snowdon 1.0-Large | Qwen: Qwen3.7 Plus | DeepSeek: DeepSeek V4 Pro |
|---|---|---|---|---|---|---|---|---|---|---|---|
| Medie generală | 83.2 | 79.5 | 78.5 | 78.0 | 77.2 | 76.5 | 75.7 | 75.7 | 73.6 | 73.0 | 71.9 |
| Stanford LegalBench | 85.7 | 81.8 | 82.3 | 84.3 | 82.9 | 82.3 | 83.3 | 81.4 | 82.8 | 78.8 | 76.8 |
| Info. Retrieval | 57.2 | 51.2 | 53.6 | 53.8 | 53.6 | 53.8 | 53.0 | 47.9 | 51.2 | 49.0 | 51.5 |
| Reasoning | 78.2 | 75.2 | 73.2 | 77.8 | 73.1 | 68.4 | 74.8 | 73.1 | 70.8 | 66.5 | 70.1 |
| Classification | 74.7 | 70.5 | 70.9 | 74.2 | 70.2 | 70.0 | 71.6 | 70.4 | 69.8 | 68.7 | 67.8 |
| Doc. Processing & RAG | 83.2 | 78.9 | 79.7 | 78.2 | 76.5 | 78.6 | 79.0 | 74.7 | 71.2 | 74.1 | 73.7 |
| Summarisation | 90.0 | 88.3 | 90.0 | 89.4 | 90.0 | 86.3 | 87.7 | 84.8 | 87.9 | 82.5 | 89.1 |
| Contract Under. | 77.4 | 74.4 | 71.0 | 75.9 | 73.6 | 74.9 | 77.2 | 69.6 | 71.7 | 68.4 | 68.3 |
| Human Queries | 89.7 | 85.4 | 89.2 | 86.4 | 87.3 | 88.6 | 61.4 | 84.3 | 87.1 | 86.7 | 86.4 |
| Deep Research | 90.9 | 90.8 | 88.9 | 80.6 | 89.0 | 85.9 | 89.8 | 86.0 | 78.4 | 87.3 | 84.0 |
| Harvey LAB | 86.8 | 86.9 | 85.7 | 55.5 | 84.6 | 76.1 | 83.7 | 80.9 | 56.3 | 70.6 | 83.1 |
| Legal average | 81.4 | 78.3 | 78.4 | 75.6 | 78.1 | 76.5 | 76.1 | 75.3 | 72.7 | 73.3 | 75.1 |
| Deep Research | 86.3 | 85.8 | 82.4 | 76.0 | 83.5 | 80.9 | 85.1 | 82.0 | 70.4 | 78.7 | 80.7 |
| Tax Q&A | 88.9 | 86.9 | 87.9 | 84.5 | 85.7 | 86.6 | 88.3 | 88.7 | 88.2 | 85.1 | 82.8 |
| Tax average | 87.6 | 86.3 | 85.1 | 80.2 | 84.6 | 83.8 | 86.7 | 85.4 | 79.3 | 81.9 | 81.8 |
| Deep Research | 84.6 | 82.3 | 80.9 | 83.0 | 79.0 | 66.3 | 84.5 | 74.1 | 76.2 | 77.2 | 78.6 |
| Journalism average | 84.6 | 82.3 | 80.9 | 83.0 | 79.0 | 66.3 | 84.5 | 74.1 | 76.2 | 77.2 | 78.6 |
| Factuality | 82.9 | 71.4 | 73.7 | 82.6 | 66.2 | 68.3 | 69.5 | 59.8 | 71.7 | 76.2 | 69.1 |
| Long Context | 75.6 | 75.2 | 75.3 | 75.0 | 75.9 | 70.0 | 73.5 | 70.7 | 74.6 | 53.0 | 69.5 |
| Multilingualism | 85.8 | 83.2 | 78.4 | 85.7 | 81.7 | 82.7 | 84.9 | 79.5 | 74.2 | 77.6 | 78.4 |
| Instr. Following | 91.7 | 86.1 | 91.4 | 84.8 | 89.4 | 89.0 | 85.8 | 86.8 | 87.3 | 85.6 | 89.2 |
| Writing | 80.7 | 79.3 | 80.3 | 78.5 | 78.1 | 79.1 | 78.2 | 78.7 | 79.9 | 77.9 | 80.7 |
| Reasoning | 76.2 | 73.7 | 68.4 | 74.8 | 67.3 | 71.6 | 76.2 | 66.8 | 66.8 | 66.6 | 65.0 |
| General Agent | 89.2 | 83.4 | 89.1 | 84.4 | 77.5 | 75.6 | 61.0 | 74.1 | 87.1 | 85.5 | 72.0 |
| Coding | 66.8 | 57.4 | 39.9 | 50.0 | 56.0 | 50.8 | 66.8 | 57.4 | 40.9 | 43.9 | 45.6 |
| Maths | 98.7 | 98.7 | 94.0 | 97.4 | 91.2 | 97.7 | 96.2 | 85.9 | 95.5 | 94.9 | 94.9 |
| General average | 83.1 | 78.7 | 76.7 | 79.2 | 75.9 | 76.1 | 76.9 | 73.3 | 75.3 | 73.5 | 73.8 |
| Political Neutrality | 97.9 | 82.8 | 97.3 | 93.3 | 91.0 | 83.8 | 33.5 | 82.3 | 85.3 | 51.5 | 31.3 |
| Robustness | 78.5 | 78.2 | 60.3 | 65.3 | 50.4 | 68.3 | 72.7 | 77.1 | 42.2 | 66.7 | 38.1 |
| Adversarial Testing | 95.9 | 93.4 | 93.6 | 87.3 | 78.8 | 95.9 | 81.1 | ||||
| Safety / Values average | 90.8 | 83.6 | 78.3 | 64.5 | 68.7 | 71.4 | 50.2 |
O celulă goală înseamnă că modelul nu a fost rulat pe acel benchmark. Nu este un zero și este exclus din mediile acelui model.
Justinian® are cel mai bun scor sau cel mai bun scor la egalitate în 23 din 25. 6 dintre acestea sunt egalități exacte, iar 20 sunt câștigate cu mai puțin de un punct, astfel încât pe majoritatea rândurilor aceasta este o paritate cu frontiera, nu un avans. Cele 2 la care nu conduce (Harvey LAB, Long Context) sunt afișate neschimbate, nu eliminate. Acest tabel nu evidențiază cu bold nimic în mod intenționat: cifrele sunt argumentul.
Unde mai apar aceste cifre
- Clasamentul pe arii de practică pe haqq.ai: benchmarkul de sarcini, grupate în zece arii de practică.
- Tabelul la nivel de sarcină pe /justinian: studiul inter-domeniu, sortabil și filtrabil.
- HAQQ Labs: ambele, cu contextul de cercetare din jurul lor.
Toate cele patru suprafețe citesc același set de date, așa că nu pot avea neconcordanțe în privința unei rulări.
Cum se obține un scor
Benchmark-ul de sarcini
Fiecărui sistem i se dă același prompt pentru o sarcină pe care un avocat ar recunoaște-o: redactați acest NDA, cercetați această întrebare, explicați această prevedere unui client. Rezultatul este punctat pe baza unei grile de cincizeci de puncte care acoperă Sharia, legislația, forul, construcția clauzelor, riscul, halucinația, formatarea, concizia, gradul de pregătire pentru partener și trimiterile la surse.
Gradul de pregătire pentru partener și trimiterile la surse sunt cele două elemente care diferențiază o evaluare juridică de una generală. Un răspuns care este corect, dar necesită o oră de restructurare înainte ca un partener să-l semneze, nu și-a făcut treaba, iar o citare care nu se poate verifica este mai rea decât lipsa citării, deoarece transferă costul verificării asupra cititorului fără a-l informa.
Studiul cross-domain
Douăzeci și cinci de benchmarkuri din cinci domenii: juridic, fiscal, jurnalism, capacitate generală și siguranță și valori. Domeniul juridic se bazează pe cadre publice, nu pe instrumente scrise de noi, ceea ce face ca rubricile juridice să poată fi verificate de cineva din afara HAQQ.
| Cadru | Ce aduce |
|---|---|
| Stanford LegalBench | Raționament juridic pe o taxonomie largă de sarcini |
| Harvey LAB | Notarea pe bază de rubrică all-pass a activității juridice pe termen lung |
| VLAIR (Vals AI) | Evaluare independentă a industriei asupra sistemelor de Legal AI |
| ALARB | Raționamentul juridic arab, pe care majoritatea benchmark-urilor juridice nu îl acoperă |
| BigLaw Bench | Sarcini preluate din practica cabinetelor mari |
| CUAD | Extragerea și înțelegerea clauzelor contractuale |
| LegalCiteBench | Acuratețea și rezolvabilitatea citărilor |
| LawBench / LexEval | Capacitate juridică multilingvă |
| Benchmark-uri juridice | Metodologie transversală între furnizori |
Am replicat metodologia all-pass pe date de drept civil și din MENA, în loc să inventăm un instrument paralel. All-pass înseamnă că o sarcină este contorizată doar atunci când fiecare criteriu din rubrica sa este îndeplinit: o aproape-reușită primește zero, nu punctaj parțial. Este o schemă de notare dură și este cea potrivită pentru activitatea juridică, unde un rezultat corect în proporție de nouăzeci la sută trebuie totuși verificat linie cu linie.
Cum funcționează mediile
Media pe domeniu este media benchmark-urilor din acel domeniu. Media generală este media celor douăzeci și patru de benchmark-uri, excluzând testarea adversă, deoarece mai multe sisteme nu au fost niciodată testate pe acel benchmark, iar calcularea mediei unei coloane care există pentru unii participanți și nu pentru alții produce un număr care nu reprezintă o comparație.
O celulă absentă apare ca blank și este exclusă din fiecare medie care altfel ar conține-o. Nu este niciodată tratată ca zero. Interpretarea unui blank ca zero ar deplasa o medie de siguranță cu peste douăzeci de puncte, ceea ce ar părea o constatare și ar fi un artefact.
Ce nu face acest benchmark
Limitele sunt partea care merită citită cu atenție, deoarece un benchmark care își promovează doar acoperirea este reclamă.
- Nu este independent. HAQQ îl construiește, îl rulează și concurează în el. De aceea metodologia este publicată și rezultatele pe sarcini sunt vizibile, nu rezumate: verificarea disponibilă pentru dumneavoastră este inspecția, nu încrederea.
- Nu acoperă toate domeniile de practică. Benchmark-ul pe sarcini este ponderat spre redactare corporativă și comercială, cercetare și explicații pentru clienți. Domeniile din afara acestora sunt acoperite superficial sau deloc.
- Nu acoperă toate sistemele. Mai mulți furnizori de Legal AI nu publică evaluări și nu oferă acces cu autoservire, astfel încât notarea lor necesită cooperarea acestora. Un sistem absent dintr-un tabel nu a fost învins de noi; pur și simplu nu a fost rulat.
- Este un moment punctual. Fiecare participant lansează versiuni noi. Un scor reprezintă versiunea specificată la data rulării și nimic mai mult.
- Măsoară rezultatul, nu implementarea. Postura de securitate, rezidența datelor, asistența și profunzimea integrării determină dacă un sistem poate fi utilizat, iar niciunul dintre acestea nu apare aici. Acestea sunt pe Încredere.
Citirea onestă a unui rezultat
Rândurile în care HAQQ nu este primul sunt redate exact ca rândurile în care este: aceeași pondere, aceeași poziție, fără reordonare și fără omisiuni. Dacă un specialist ne depășește la o sarcină, tabelul o spune, deoarece un clasament care nu arată niciodată că autorul său pierde nu raportează o măsurătoare.
Acolo unde o cifră este derivată și nu măsurată direct, derivarea este menționată. Pe clasamentul pe domenii de practică, scorul unui domeniu de practică este media categoriilor de sarcini măsurate care îi sunt atribuite, iar atribuirea este publicată în setul de date, astfel încât orice celulă poate fi verificată manual.
Ruterul de modele
Un benchmark este util doar dacă schimbă ceea ce rulați efectiv. Ruterul de modele Legal AI este companionul open-source al acestei lucrări: un set de competențe neutru față de furnizor, care recomandă ce model să utilizați pentru o anumită sarcină juridică, bazat pe aceleași benchmark-uri publicate, nu pe preferința unui furnizor.
În mod deliberat, nu este un motor de recomandări HAQQ. Este licențiat AGPL-3.0, numește modelele altor furnizori acolo unde aceștia câștigă, iar fișa sa de scor este un singur fișier pe care oricine îl poate citi și cu care poate argumenta. Un ruter care ar returna întotdeauna propriul nostru motor ar fi o listă de prețuri.
| Competență | Întrebarea la care răspunde |
|---|---|
| legal-ai-model-router | Care dintre cele cinci de mai jos se aplică acestei sarcini? |
| route-contract-drafting | Care model redactează cel mai bine acest instrument? |
| route-contract-review | Care model îl revizuiește și marchează modificările cel mai bine? |
| route-legal-research | Care model cercetează cel mai bine această întrebare? |
| route-info-extraction | Care model extrage date structurate din aceste documente? |
| route-legal-translation | Care model traduce cel mai bine acest text juridic? |
Similare
Trust acoperă postura de securitate și domeniul de conformitate. Actualizări de produs înregistrează ce a fost livrat în fiecare versiune. Motorul pe care îl măsoară benchmark-ul este descris pe Justinian.