DeepEval is an | open-source LLM evaluation framework | that lets you write | automated tests for
DeepEval là một | framework đánh giá LLM mã nguồn mở | cho phép bạn viết | các bài kiểm tra tự động cho
your AI application | in a way that | feels similar to | unit testing with pytest.
ứng dụng AI của bạn | theo một cách | cảm thấy tương tự như | kiểm thử đơn vị với pytest.
It comes with | over 50 built-in metrics | covering accuracy, faithfulness, | relevance, toxicity,
Nó đi kèm với | hơn 50 chỉ số tích hợp | bao gồm độ chính xác, tính trung thực, | mức độ liên quan, độc tính,
and agent behavior, | and it works across | RAG pipelines, chatbots, | and multi-step agents.
và hành vi của tác nhân, | và nó hoạt động trên | các pipeline RAG, chatbot, | và các tác nhân đa bước.
Because it integrates | directly into | CI/CD pipelines, | teams can run evals
Vì nó tích hợp | trực tiếp vào | các pipeline CI/CD, | các đội ngũ có thể chạy đánh giá
automatically on every | code change rather | than treating evaluation | as a manual,
tự động trên mỗi | thay đổi mã thay vì | coi việc đánh giá | là một công việc thủ công,
one-off task.
một lần.
Resources
- DeepEval Docs (official)
- deepeval (opensource)
- How to Setup DeepEval for Fast, Easy, and Powerful LLM Evaluations (video)
References
- https://roadmap.sh/ai-engineer (Node: DeepEval)