Pure deterministic AI agent trajectory evaluation engine — zero judge-LLM cost, zero non-determinism, zero API latency.
-
Updated
Jul 29, 2026 - Python
Pure deterministic AI agent trajectory evaluation engine — zero judge-LLM cost, zero non-determinism, zero API latency.
A lightweight, from-scratch implementation of standard Retrieval-Augmented Generation (RAG) evaluation metrics. It computes Faithfulness, Answer Relevance, Context Recall, and Context Precision without relying on heavy external evaluation frameworks
Multi-pass agent that grades plans/PRDs on priority-definition quality. Line-cited evidence, deterministic citation verifier, 9887/10000 on a hand-rated calibration set.
Pipeline to investigate structured reasoning and instruction adherence in multimodal LLMs
To associate your repository with the deterministic-eval topic, visit your repo's landing page and select "manage topics."