Skip to content

Legal Benchmark

Cum este construit HAQQ Legal Benchmark, ce măsoară, ce nu măsoară în mod deliberat și unde găsiți cifrele pe care le produce.

Ce este

Două evaluări sub același nume, efectuate la scări diferite, deoarece răspund la întrebări diferite.

EvaluareScalăFormăÎntrebarea
Benchmark-ul de sarciniDin 5011 categorii de sarcini juridice în 19 sistemePentru munca pe care o deleagă un avocat în mod real, cine produce cel mai bun rezultat?
Studiul cross-domainDin 10025 de benchmark-uri în 5 domeniiÎn confruntarea cu modelele de vârf pe propriul lor teren, unde se situează un motor specializat în domeniul juridic?

Cele două scări nu sunt interschimbabile. Un scor din 50 la benchmark-ul de sarcini și un scor din 100 la studiul cross-domain măsoară activități diferite pe grile diferite. Dublarea unuia nu îl produce pe celălalt, iar cele două nu trebuie să apară niciodată în același tabel sau în aceeași propoziție ca și cum ar fi comparabile.

Benchmark-ul de sarcini

Unsprezece categorii de sarcini măsurate, punctate din 50. Cel mai bun rezultat din fiecare rând este evidențiat cu caractere aldine. Acestea sunt cifrele pe care clasamentul pe arii de practică de pe haqq.ai le grupează în arii de practică.

Benchmark-ul de sarcini, din 50, primele cinci pe categorie
Categorie1st2nd3rd4th5th
LegalHAQQ (Justinian) 49Anthropic: Claude Fable 5 45Anthropic: Claude Opus 4.8 43Mike OS 42DeepSeek: DeepSeek V4 Pro 40
Contract DraftingHAQQ (Justinian) 47Spellbook 46Anthropic: Claude Fable 5 45Anthropic: Claude Opus 4.8 43Legora 42
Legal ResearchHAQQ (Justinian) 47LexisNexis +AI 46Perplexity Sonar 43Anthropic: Claude Fable 5 41Thomson Reuters CoCounsel 40
Law ExplanationHAQQ (Justinian) 46OpenAI: GPT-5.6 Sol Pro 45Anthropic: Claude Fable 5 43Google: Gemini 3.1 Pro 41Anthropic: Claude Opus 4.8 39
Employment AgreementHAQQ (Justinian) 48Anthropic: Claude Fable 5 43Harvey Tenet 42Mike OS 41Legora 40
Memo DraftingHAQQ (Justinian) 44Thomson Reuters CoCounsel 42Anthropic: Claude Fable 5 41Anthropic: Claude Opus 4.8 41Mike OS 39
License AgreementHAQQ (Justinian) 46Anthropic: Claude Opus 4.8 43Anthropic: Claude Fable 5 42Spellbook 41Legora 40
Shareholder AgreementHAQQ (Justinian) 47Harvey Tenet 44Anthropic: Claude Fable 5 42Mike OS 41Anthropic: Claude Opus 4.8 40
Consultancy AgreementHAQQ (Justinian) 45Anthropic: Claude Fable 5 42Legora 41Mike OS 40Anthropic: Claude Opus 4.8 39
Commercial AgreementHAQQ (Justinian) 47Harvey Tenet 43Anthropic: Claude Opus 4.8 42Anthropic: Claude Fable 5 41Mike OS 40
NDA DraftingHAQQ (Justinian) 49Anthropic: Claude Fable 5 45Spellbook 44Mike OS 42Anthropic: Claude Opus 4.8 41

Studiul cross-domain

Douăzeci și cinci de benchmark-uri în cinci domenii, punctate din 100. Aceeași rulare pe care tabelul de sarcini de pe /justinian o sortează și o filtrează.

Studiu inter-domeniu, din 100
BenchmarkHAQQ (Justinian)Anthropic: Claude Opus 4.8Thomson Reuters CoCounselGoogle: Gemini 3.1 ProZ.ai: GLM 5.2OpenAI: GPT-5.6 Sol ProKimi: K3Anthropic: Claude Sonnet 5Snowdon 1.0-LargeQwen: Qwen3.7 PlusDeepSeek: DeepSeek V4 Pro
Medie generală83.279.578.578.077.276.575.775.773.673.071.9
Stanford LegalBench85.781.882.384.382.982.383.381.482.878.876.8
Info. Retrieval57.251.253.653.853.653.853.047.951.249.051.5
Reasoning78.275.273.277.873.168.474.873.170.866.570.1
Classification74.770.570.974.270.270.071.670.469.868.767.8
Doc. Processing & RAG83.278.979.778.276.578.679.074.771.274.173.7
Summarisation90.088.390.089.490.086.387.784.887.982.589.1
Contract Under.77.474.471.075.973.674.977.269.671.768.468.3
Human Queries89.785.489.286.487.388.661.484.387.186.786.4
Deep Research90.990.888.980.689.085.989.886.078.487.384.0
Harvey LAB86.886.985.755.584.676.183.780.956.370.683.1
Legal average81.478.378.475.678.176.576.175.372.773.375.1
Deep Research86.385.882.476.083.580.985.182.070.478.780.7
Tax Q&A88.986.987.984.585.786.688.388.788.285.182.8
Tax average87.686.385.180.284.683.886.785.479.381.981.8
Deep Research84.682.380.983.079.066.384.574.176.277.278.6
Journalism average84.682.380.983.079.066.384.574.176.277.278.6
Factuality82.971.473.782.666.268.369.559.871.776.269.1
Long Context75.675.275.375.075.970.073.570.774.653.069.5
Multilingualism85.883.278.485.781.782.784.979.574.277.678.4
Instr. Following91.786.191.484.889.489.085.886.887.385.689.2
Writing80.779.380.378.578.179.178.278.779.977.980.7
Reasoning76.273.768.474.867.371.676.266.866.866.665.0
General Agent89.283.489.184.477.575.661.074.187.185.572.0
Coding66.857.439.950.056.050.866.857.440.943.945.6
Maths98.798.794.097.491.297.796.285.995.594.994.9
General average83.178.776.779.275.976.176.973.375.373.573.8
Political Neutrality97.982.897.393.391.083.833.582.385.351.531.3
Robustness78.578.260.365.350.468.372.777.142.266.738.1
Adversarial Testing95.993.493.687.378.895.981.1
Safety / Values average90.883.678.364.568.771.450.2

O celulă goală înseamnă că modelul nu a fost rulat pe acel benchmark. Nu este un zero și este exclus din mediile acelui model.

Justinian® are cel mai bun scor sau cel mai bun scor la egalitate în 23 din 25. 6 dintre acestea sunt egalități exacte, iar 20 sunt câștigate cu mai puțin de un punct, astfel încât pe majoritatea rândurilor aceasta este o paritate cu frontiera, nu un avans. Cele 2 la care nu conduce (Harvey LAB, Long Context) sunt afișate neschimbate, nu eliminate. Acest tabel nu evidențiază cu bold nimic în mod intenționat: cifrele sunt argumentul.

Unde mai apar aceste cifre

Toate cele patru suprafețe citesc același set de date, așa că nu pot avea neconcordanțe în privința unei rulări.

Cum se obține un scor

Benchmark-ul de sarcini

Fiecărui sistem i se dă același prompt pentru o sarcină pe care un avocat ar recunoaște-o: redactați acest NDA, cercetați această întrebare, explicați această prevedere unui client. Rezultatul este punctat pe baza unei grile de cincizeci de puncte care acoperă Sharia, legislația, forul, construcția clauzelor, riscul, halucinația, formatarea, concizia, gradul de pregătire pentru partener și trimiterile la surse.

Gradul de pregătire pentru partener și trimiterile la surse sunt cele două elemente care diferențiază o evaluare juridică de una generală. Un răspuns care este corect, dar necesită o oră de restructurare înainte ca un partener să-l semneze, nu și-a făcut treaba, iar o citare care nu se poate verifica este mai rea decât lipsa citării, deoarece transferă costul verificării asupra cititorului fără a-l informa.

Studiul cross-domain

Douăzeci și cinci de benchmarkuri din cinci domenii: juridic, fiscal, jurnalism, capacitate generală și siguranță și valori. Domeniul juridic se bazează pe cadre publice, nu pe instrumente scrise de noi, ceea ce face ca rubricile juridice să poată fi verificate de cineva din afara HAQQ.

Cadrele publice pe care se bazează acest studiu, fiecare cu link către sursă
CadruCe aduce
Stanford LegalBenchRaționament juridic pe o taxonomie largă de sarcini
Harvey LABNotarea pe bază de rubrică all-pass a activității juridice pe termen lung
VLAIR (Vals AI)Evaluare independentă a industriei asupra sistemelor de Legal AI
ALARBRaționamentul juridic arab, pe care majoritatea benchmark-urilor juridice nu îl acoperă
BigLaw BenchSarcini preluate din practica cabinetelor mari
CUADExtragerea și înțelegerea clauzelor contractuale
LegalCiteBenchAcuratețea și rezolvabilitatea citărilor
LawBench / LexEvalCapacitate juridică multilingvă
Benchmark-uri juridiceMetodologie transversală între furnizori

Am replicat metodologia all-pass pe date de drept civil și din MENA, în loc să inventăm un instrument paralel. All-pass înseamnă că o sarcină este contorizată doar atunci când fiecare criteriu din rubrica sa este îndeplinit: o aproape-reușită primește zero, nu punctaj parțial. Este o schemă de notare dură și este cea potrivită pentru activitatea juridică, unde un rezultat corect în proporție de nouăzeci la sută trebuie totuși verificat linie cu linie.

Cum funcționează mediile

Media pe domeniu este media benchmark-urilor din acel domeniu. Media generală este media celor douăzeci și patru de benchmark-uri, excluzând testarea adversă, deoarece mai multe sisteme nu au fost niciodată testate pe acel benchmark, iar calcularea mediei unei coloane care există pentru unii participanți și nu pentru alții produce un număr care nu reprezintă o comparație.

O celulă absentă apare ca blank și este exclusă din fiecare medie care altfel ar conține-o. Nu este niciodată tratată ca zero. Interpretarea unui blank ca zero ar deplasa o medie de siguranță cu peste douăzeci de puncte, ceea ce ar părea o constatare și ar fi un artefact.

Ce nu face acest benchmark

Limitele sunt partea care merită citită cu atenție, deoarece un benchmark care își promovează doar acoperirea este reclamă.

  • Nu este independent. HAQQ îl construiește, îl rulează și concurează în el. De aceea metodologia este publicată și rezultatele pe sarcini sunt vizibile, nu rezumate: verificarea disponibilă pentru dumneavoastră este inspecția, nu încrederea.
  • Nu acoperă toate domeniile de practică. Benchmark-ul pe sarcini este ponderat spre redactare corporativă și comercială, cercetare și explicații pentru clienți. Domeniile din afara acestora sunt acoperite superficial sau deloc.
  • Nu acoperă toate sistemele. Mai mulți furnizori de Legal AI nu publică evaluări și nu oferă acces cu autoservire, astfel încât notarea lor necesită cooperarea acestora. Un sistem absent dintr-un tabel nu a fost învins de noi; pur și simplu nu a fost rulat.
  • Este un moment punctual. Fiecare participant lansează versiuni noi. Un scor reprezintă versiunea specificată la data rulării și nimic mai mult.
  • Măsoară rezultatul, nu implementarea. Postura de securitate, rezidența datelor, asistența și profunzimea integrării determină dacă un sistem poate fi utilizat, iar niciunul dintre acestea nu apare aici. Acestea sunt pe Încredere.

Citirea onestă a unui rezultat

Rândurile în care HAQQ nu este primul sunt redate exact ca rândurile în care este: aceeași pondere, aceeași poziție, fără reordonare și fără omisiuni. Dacă un specialist ne depășește la o sarcină, tabelul o spune, deoarece un clasament care nu arată niciodată că autorul său pierde nu raportează o măsurătoare.

Acolo unde o cifră este derivată și nu măsurată direct, derivarea este menționată. Pe clasamentul pe domenii de practică, scorul unui domeniu de practică este media categoriilor de sarcini măsurate care îi sunt atribuite, iar atribuirea este publicată în setul de date, astfel încât orice celulă poate fi verificată manual.

Ruterul de modele

Un benchmark este util doar dacă schimbă ceea ce rulați efectiv. Ruterul de modele Legal AI este companionul open-source al acestei lucrări: un set de competențe neutru față de furnizor, care recomandă ce model să utilizați pentru o anumită sarcină juridică, bazat pe aceleași benchmark-uri publicate, nu pe preferința unui furnizor.

În mod deliberat, nu este un motor de recomandări HAQQ. Este licențiat AGPL-3.0, numește modelele altor furnizori acolo unde aceștia câștigă, iar fișa sa de scor este un singur fișier pe care oricine îl poate citi și cu care poate argumenta. Un ruter care ar returna întotdeauna propriul nostru motor ar fi o listă de prețuri.

Ce acoperă ruterul
CompetențăÎntrebarea la care răspunde
legal-ai-model-routerCare dintre cele cinci de mai jos se aplică acestei sarcini?
route-contract-draftingCare model redactează cel mai bine acest instrument?
route-contract-reviewCare model îl revizuiește și marchează modificările cel mai bine?
route-legal-researchCare model cercetează cel mai bine această întrebare?
route-info-extractionCare model extrage date structurate din aceste documente?
route-legal-translationCare model traduce cel mai bine acest text juridic?

Trust acoperă postura de securitate și domeniul de conformitate. Actualizări de produs înregistrează ce a fost livrat în fiecare versiune. Motorul pe care îl măsoară benchmark-ul este descris pe Justinian.

Subiecte conexe

V-a fost utilă această pagină?