Human Evals

Human evals involve | people directly reviewing | and scoring model outputs | against defined criteria.
Đánh giá của con người liên quan đến | việc mọi người trực tiếp xem xét | và chấm điểm đầu ra của mô hình | dựa trên các tiêu chí đã xác định.

They are the | most accurate form | of evaluation for | nuanced or subjective
Chúng là | hình thức chính xác nhất | của việc đánh giá | cho các khía cạnh tinh tế hoặc chủ quan

quality dimensions, | and serve as | the ground truth | that other eval methods
về chất lượng, | và đóng vai trò là | sự thật cơ bản | mà các phương pháp đánh giá khác

are validated against. | Human evals are | slower and more expensive | than automated approaches,
được xác thực dựa trên đó. | Đánh giá của con người | chậm hơn và đắt đỏ hơn | so với các phương pháp tự động,

so they are | typically used for | high-stakes decisions, | calibrating automated evals,
vì vậy chúng | thường được sử dụng cho | các quyết định quan trọng, | hiệu chuẩn các đánh giá tự động,

or reviewing edge cases | flagged by | other methods.
hoặc xem xét các trường hợp biên | được gắn cờ bởi | các phương pháp khác.

Resources

References


← Model-Based Evals · AI Engineer Roadmap · Evaluation Metrics →