Optional
RAGAS evaluation: (query + ground truth) — requires LLM judge
Retrieval evaluation: (query → relevant chunk IDs)
Skill routing evaluation: (query → expected skill + hook flag)
RAGAS evaluation: (query + ground truth) — requires LLM judge