# llm-evals-toolkit > Build LLM evaluation plans, metrics, judge prompts, and test cases for RAG/LLM systems; use when designing evals, benchmarks, or experiment hygiene. - Author: Benny Serra - Repository: Y4rd13/fullstack-ml-ai-agent-skills - Version: 20260130020931 - Stars: 0 - Forks: 0 - Last Updated: 2026-02-08 - Source: https://github.com/Y4rd13/fullstack-ml-ai-agent-skills - Web: https://mule.run/skillshub/@@Y4rd13/fullstack-ml-ai-agent-skills~llm-evals-toolkit:20260130020931 --- --- name: llm-evals-toolkit description: Build LLM evaluation plans, metrics, judge prompts, and test cases for RAG/LLM systems; use when designing evals, benchmarks, or experiment hygiene. license: MIT metadata: author: Y4rd13 version: "1.0.0" --- # llm-evals-toolkit Skill