Human evals involve | people directly reviewing | and scoring model outputs | against defined criteria.
Đánh giá của con người liên quan đến | việc mọi người trực tiếp xem xét | và chấm điểm đầu ra của mô hình | dựa trên các tiêu chí đã xác định.
They are the | most accurate form | of evaluation for | nuanced or subjective
Chúng là | hình thức chính xác nhất | của việc đánh giá | cho các khía cạnh tinh tế hoặc chủ quan
quality dimensions, | and serve as | the ground truth | that other eval methods
về chất lượng, | và đóng vai trò là | sự thật cơ bản | mà các phương pháp đánh giá khác
are validated against. | Human evals are | slower and more expensive | than automated approaches,
được xác thực dựa trên đó. | Đánh giá của con người | chậm hơn và đắt đỏ hơn | so với các phương pháp tự động,
so they are | typically used for | high-stakes decisions, | calibrating automated evals,
vì vậy chúng | thường được sử dụng cho | các quyết định quan trọng, | hiệu chuẩn các đánh giá tự động,
or reviewing edge cases | flagged by | other methods.
hoặc xem xét các trường hợp biên | được gắn cờ bởi | các phương pháp khác.
Resources
- LLM-as-a-judge vs. human evaluation: Why together is better (article)
- How to run human-in-the-loop evals for LLM apps (article)
References
- https://roadmap.sh/ai-engineer (Node: Human Evals)
← Model-Based Evals · AI Engineer Roadmap · Evaluation Metrics →