DeepEval

DeepEval is an | open-source LLM evaluation framework | that lets you write | automated tests for
DeepEval là một | framework đánh giá LLM mã nguồn mở | cho phép bạn viết | các bài kiểm tra tự động cho

your AI application | in a way that | feels similar to | unit testing with pytest.
ứng dụng AI của bạn | theo một cách | cảm thấy tương tự như | kiểm thử đơn vị với pytest.

It comes with | over 50 built-in metrics | covering accuracy, faithfulness, | relevance, toxicity,
Nó đi kèm với | hơn 50 chỉ số tích hợp | bao gồm độ chính xác, tính trung thực, | mức độ liên quan, độc tính,

and agent behavior, | and it works across | RAG pipelines, chatbots, | and multi-step agents.
và hành vi của tác nhân, | và nó hoạt động trên | các pipeline RAG, chatbot, | và các tác nhân đa bước.

Because it integrates | directly into | CI/CD pipelines, | teams can run evals
Vì nó tích hợp | trực tiếp vào | các pipeline CI/CD, | các đội ngũ có thể chạy đánh giá

automatically on every | code change rather | than treating evaluation | as a manual,
tự động trên mỗi | thay đổi mã thay vì | coi việc đánh giá | là một công việc thủ công,

one-off task.
một lần.

Resources

References


← Regression Testing · AI Engineer Roadmap · RAGAS →