Evaluation metrics are | the specific measurements | used to score | LLM outputs against
Các chỉ số đánh giá là | các phép đo cụ thể | được sử dụng để chấm điểm | đầu ra của LLM dựa trên
defined quality criteria. | Each metric targets | a different dimension | of quality, such as
các tiêu chí chất lượng đã xác định. | Mỗi chỉ số nhắm đến | một khía cạnh khác nhau | của chất lượng, chẳng hạn như
whether the response is | factually grounded, | relevant to the question, | free of harmful content,
liệu phản hồi có | dựa trên thực tế, | liên quan đến câu hỏi, | không chứa nội dung độc hại,
or genuinely useful | to the user. | Choosing the right set | of metrics for your
hoặc thực sự hữu ích | cho người dùng. | Việc chọn đúng tập hợp | các chỉ số cho trường hợp sử dụng
use case is one | of the most important | decisions in building | an eval system,
của bạn là một trong | những quyết định quan trọng nhất | trong việc xây dựng | một hệ thống đánh giá,
since metrics determine | what your system | optimizes for and | what failure modes it
vì các chỉ số xác định | những gì hệ thống của bạn | tối ưu hóa và | những chế độ lỗi nào nó
can actually detect.
có thể thực sự phát hiện.
Resources
- LLM evaluation metrics and methods, explained simply (article)
- A list of metrics for evaluating LLM-generated content (article)
References
- https://roadmap.sh/ai-engineer (Node: Evaluation Metrics)