Model-Based Evals

Model-based evals use | a separate AI model | to automatically score | or assess the outputs
Các đánh giá dựa trên mô hình sử dụng | một mô hình AI riêng biệt | để tự động chấm điểm | hoặc đánh giá đầu ra

of your LLM application. | Instead of writing | manual rules or relying | on human reviewers,
của ứng dụng LLM của bạn. | Thay vì viết | các quy tắc thủ công hoặc dựa vào | những người đánh giá là con người,

you delegate the judgment | to another model, | a technique commonly known | as LLM-as-a-Judge.
bạn ủy quyền việc đánh giá | cho một mô hình khác, | một kỹ thuật thường được gọi | là LLM-as-a-Judge.

You write a prompt | describing the evaluation criteria, | and the judge model | rates the response.
Bạn viết một prompt | mô tả các tiêu chí đánh giá, | và mô hình giám khảo | xếp hạng phản hồi.

This approach handles | subjective, open-ended quality dimensions | that rules cannot capture, | while scaling far more
Cách tiếp cận này xử lý | các khía cạnh chất lượng chủ quan, mở | mà các quy tắc không thể nắm bắt, | trong khi mở rộng quy mô hơn nhiều

cheaply than human review, | though it requires | careful prompt design | to avoid bias
với chi phí rẻ hơn so với đánh giá của con người, | mặc dù nó đòi hỏi | thiết kế prompt cẩn thận | để tránh thiên kiến

and inconsistency in | the judges themselves.
và sự không nhất quán | ở chính các giám khảo.

Resources

References


← Deterministic Evals · AI Engineer Roadmap · Human Evals →