refactor: comentarii strict functionale, fara referinte PRD/stories

Curatare globala a comentariilor si docstring-urilor (app, tools, teste,
scripturi): eliminate referintele la PRD-uri, US-xxx, task-uri istorice si
review-uri; pastrata doar informatia functionala, formulata scurt. Regula
adaugata in CLAUDE.md (sectiunea Stil). Fara modificari de cod sau comportament.

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
This commit is contained in:
Claude Agent
2026-07-06 13:48:38 +00:00
parent 86408887e5
commit 44f261e269
226 changed files with 1313 additions and 1760 deletions

View File

@@ -1,6 +1,6 @@
"""Harness de evaluare held-out pentru sistemul de mapare operatii->coduri RAR.
Scop (L14-S5, Decision #19 PRD 5.14):
Scop:
Masurarea ACURATETEI REALE a clasificatorului inainte de a permite orice tier
auto-send peste GOLD propriu.
@@ -19,12 +19,11 @@ Continut:
exclusiv responsabilitatea operatorului.
3. eval_predictions() — date (predictii, gold) -> precizie globala + per-cod
+ matrice confuzie + rata cod-gresit.
4. kill_criterion() — evalueaza daca sistemul indeplineste pragul de acceptanta
(F-E, PRD 5.14).
4. kill_criterion() — evalueaza daca sistemul indeplineste pragul de acceptanta.
Ce NU face:
NU eticheteaza ground-truth-ul. Etichetarea de cod ar fi exact "antrenare pe test"
si ar invalida precizia raportata (Decision #19). Fisierul exportat se completeaza
si ar invalida precizia raportata. Fisierul exportat se completeaza
MANUAL de operatorul uman.
CLI:
@@ -71,10 +70,10 @@ DEFAULT_SEED = 42
_STRAT_HEAD_END_PCT = 0.20
_STRAT_MID_END_PCT = 0.50 # head+mid = 50%, deci mid = 30%
# Kill-criterion (F-E, PRD 5.14):
# Kill-criterion:
#
# DEFAULT_WRONG_CODE_THRESHOLD = 0.005 (0.5%)
# Justificare: un cod gresit = FINALIZATA ireversibila la RAR (Premisa 3).
# Justificare: un cod gresit = FINALIZATA ireversibila la RAR.
# La 200 operatii/zi auto-rezolvate cu 0.5% rata gresita = 1 FINALIZATA
# gresita/zi, ceea ce depaseste toleranta operationala acceptabila.
# Pragul poate fi RELAXAT empiric pe baza de date reale; NU inasprit post-hoc.
@@ -98,7 +97,7 @@ def sample_stratified(
) -> list[dict]:
"""Esantionare stratificata aleatorie pe trei strate Zipf: cap/mijloc/coada.
Determinista cu seed; NU apeleaza LLM (PRD L14-S5).
Determinista cu seed; NU apeleaza LLM.
rows: lista de (denumire, nr) — frecventele absolute.
Nu trebuie sortata in prealabil.
@@ -182,7 +181,7 @@ def export_for_labeling(sample: list[dict], path: str) -> None:
Coloana `cod_gold` ramane GOALA in fisierul exportat.
NU o completa cu etichete LLM sau automate: ar fi "antrenare pe test"
si ar invalida precizia raportata (Decision #19, PRD 5.14).
si ar invalida precizia raportata.
sample: lista de {denumire, nr, strat} returnata de sample_stratified()
path: fisierul CSV de scris (suprascrie daca exista)
@@ -323,7 +322,7 @@ def eval_predictions(
# ---------------------------------------------------------------------------
# Kill-criterion (F-E, PRD 5.14)
# Kill-criterion
# ---------------------------------------------------------------------------
def kill_criterion(
@@ -331,7 +330,7 @@ def kill_criterion(
wrong_code_threshold: float = DEFAULT_WRONG_CODE_THRESHOLD,
coverage_threshold: float = DEFAULT_COVERAGE_THRESHOLD,
) -> dict:
"""Evalueaza daca sistemul de clasificare indeplineste pragul de acceptanta (F-E).
"""Evalueaza daca sistemul de clasificare indeplineste pragul de acceptanta.
Sistemul TRECE daca:
wrong_code_rate < wrong_code_threshold (implicit 0.5%)
@@ -339,7 +338,7 @@ def kill_criterion(
coverage_rate > coverage_threshold (implicit 50%)
Un sistem care nu trece kill-criterion NU trebuie folosit pentru auto-send
dincolo de GOLD propriu (Decision #19, #17, PRD 5.14).
dincolo de GOLD propriu.
metrics: dict returnat de eval_predictions() sau compatibil
(must have keys: wrong_code_rate, coverage_rate).
@@ -375,7 +374,7 @@ def kill_criterion(
elif not cond_wrong_code:
reason = (
f"ESUEAZA: rata cod-gresit {wcr:.2%} >= {wrong_code_threshold:.2%}. "
f"Un cod gresit = FINALIZATA ireversibila la RAR (Premisa 3, PRD 5.14). "
f"Un cod gresit = FINALIZATA ireversibila la RAR. "
f"Auto-send dincolo de GOLD dezactivat pana la recalibrat."
)
else:
@@ -442,7 +441,7 @@ def _load_corpus_from_csvs(data_dir: str) -> list[tuple[str, int]]:
def _print_report(metrics: dict) -> None:
sep = "=" * 70
print(sep)
print("RAPORT EVALUARE HELD-OUT (L14-S5, PRD 5.14)")
print("RAPORT EVALUARE HELD-OUT")
print(sep)
print(f" Total intrari evaluate: {metrics['total']}")
print(f" Corecte: {metrics['correct']}")
@@ -480,7 +479,7 @@ def main() -> None:
import argparse
p = argparse.ArgumentParser(
description="Harness eval held-out L14-S5 (PRD 5.14).",
description="Harness eval held-out pentru mapare operatii->coduri RAR.",
formatter_class=argparse.RawDescriptionHelpFormatter,
epilog="""
Moduri de utilizare:
@@ -559,7 +558,7 @@ Moduri de utilizare:
print(" '?' = incert (clasificatorul nu poate decide)")
print()
print(" ATENTIE: NU folosi etichete LLM drept cod_gold!")
print(" Asta ar fi 'antrenare pe test' (Decision #19, PRD 5.14) si ar")
print(" Asta ar fi 'antrenare pe test' si ar")
print(" invalida orice masurare de acuratete.")