oh-my-knowledge
esm
Evaluation framework for LLM knowledge inputs — prompts, RAG corpora, skills, agent workflows. Fix the model, vary the artifact. Built-in statistical rigor: bootstrap CI, Krippendorff α, length-debias, saturation curves.
Version 0.51.0 License MIT
Keywords
llm-evaluationevaluation-frameworkprompt-evaluationprompt-testingprompt-regression-testingrag-evaluationagent-evaluationllm-judgemulti-judge-ensemblebootstrap-cikrippendorff-alphaevaluation-as-codebenchmarkskill-evaluationknowledge-engineering
INSTALL