<rss xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title>Evaluation - Tag - Nguyen Ngoc Tin</title><link>https://ngoctin.me/tags/evaluation/</link><description>Evaluation - Tag - Nguyen Ngoc Tin</description><generator>Hugo -- gohugo.io</generator><language>en</language><managingEditor>ngoctin.work@gmail.com (Nguyen Ngoc Tin)</managingEditor><webMaster>ngoctin.work@gmail.com (Nguyen Ngoc Tin)</webMaster><lastBuildDate>Sat, 01 Aug 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://ngoctin.me/tags/evaluation/" rel="self" type="application/rss+xml"/><item><title>LLM Evaluations</title><link>https://ngoctin.me/ai-engineer/11-evaluation-safety-and-ethics/llm-evaluations/</link><pubDate>Sat, 01 Aug 2026 00:00:00 +0000</pubDate><author>ngoctin.work@gmail.com (Nguyen Ngoc Tin)</author><guid>https://ngoctin.me/ai-engineer/11-evaluation-safety-and-ethics/llm-evaluations/</guid><description>LLM evaluations là các bài kiểm tra có cấu trúc đo lường mức độ hiệu quả của một model hoặc hệ thống AI dựa trên một tập hợp các tiêu chí được xác định.</description></item><item><title>LangSmith</title><link>https://ngoctin.me/ai-engineer/11-evaluation-safety-and-ethics/langsmith/</link><pubDate>Sat, 01 Aug 2026 00:00:00 +0000</pubDate><author>ngoctin.work@gmail.com (Nguyen Ngoc Tin)</author><guid>https://ngoctin.me/ai-engineer/11-evaluation-safety-and-ethics/langsmith/</guid><description>LangSmith là một nền tảng quan sát và đánh giá được xây dựng bởi đội ngũ LangChain, được thiết kế đặc biệt cho các ứng dụng LLM.</description></item><item><title>LangFuse</title><link>https://ngoctin.me/ai-engineer/11-evaluation-safety-and-ethics/langfuse/</link><pubDate>Sat, 01 Aug 2026 00:00:00 +0000</pubDate><author>ngoctin.work@gmail.com (Nguyen Ngoc Tin)</author><guid>https://ngoctin.me/ai-engineer/11-evaluation-safety-and-ethics/langfuse/</guid><description>LangFuse là một nền tảng quan sát LLM mã nguồn mở cung cấp các công cụ theo dõi, quản lý prompt và đánh giá.</description></item><item><title>Deterministic Evals</title><link>https://ngoctin.me/ai-engineer/11-evaluation-safety-and-ethics/deterministic-evals/</link><pubDate>Sat, 01 Aug 2026 00:00:00 +0000</pubDate><author>ngoctin.work@gmail.com (Nguyen Ngoc Tin)</author><guid>https://ngoctin.me/ai-engineer/11-evaluation-safety-and-ethics/deterministic-evals/</guid><description>Các đánh giá tất định sử dụng các kiểm tra dựa trên quy tắc cố định để chấm điểm đầu ra của mô hình.</description></item><item><title>Model-Based Evals</title><link>https://ngoctin.me/ai-engineer/11-evaluation-safety-and-ethics/model-based-evals/</link><pubDate>Sat, 01 Aug 2026 00:00:00 +0000</pubDate><author>ngoctin.work@gmail.com (Nguyen Ngoc Tin)</author><guid>https://ngoctin.me/ai-engineer/11-evaluation-safety-and-ethics/model-based-evals/</guid><description>Các đánh giá dựa trên mô hình sử dụng một mô hình AI riêng biệt để tự động chấm điểm hoặc đánh giá đầu ra của ứng dụng LLM của bạn.</description></item><item><title>Human Evals</title><link>https://ngoctin.me/ai-engineer/11-evaluation-safety-and-ethics/human-evals/</link><pubDate>Sat, 01 Aug 2026 00:00:00 +0000</pubDate><author>ngoctin.work@gmail.com (Nguyen Ngoc Tin)</author><guid>https://ngoctin.me/ai-engineer/11-evaluation-safety-and-ethics/human-evals/</guid><description>Đánh giá của con người liên quan đến việc mọi người trực tiếp xem xét và chấm điểm đầu ra của mô hình dựa trên các tiêu chí đã xác định.</description></item><item><title>Evaluation Metrics</title><link>https://ngoctin.me/ai-engineer/11-evaluation-safety-and-ethics/evaluation-metrics/</link><pubDate>Sat, 01 Aug 2026 00:00:00 +0000</pubDate><author>ngoctin.work@gmail.com (Nguyen Ngoc Tin)</author><guid>https://ngoctin.me/ai-engineer/11-evaluation-safety-and-ethics/evaluation-metrics/</guid><description>Các chỉ số đánh giá là các phép đo cụ thể được sử dụng để chấm điểm đầu ra của LLM dựa trên các tiêu chí chất lượng đã xác định.</description></item><item><title>DeepEval</title><link>https://ngoctin.me/ai-engineer/11-evaluation-safety-and-ethics/deepeval/</link><pubDate>Sat, 01 Aug 2026 00:00:00 +0000</pubDate><author>ngoctin.work@gmail.com (Nguyen Ngoc Tin)</author><guid>https://ngoctin.me/ai-engineer/11-evaluation-safety-and-ethics/deepeval/</guid><description>DeepEval là một framework đánh giá LLM mã nguồn mở cho phép bạn viết các bài kiểm tra tự động cho ứng dụng AI của mình theo cách tương tự như kiểm thử đơn vị với pytest.</description></item><item><title>RAGAS</title><link>https://ngoctin.me/ai-engineer/11-evaluation-safety-and-ethics/ragas/</link><pubDate>Sat, 01 Aug 2026 00:00:00 +0000</pubDate><author>ngoctin.work@gmail.com (Nguyen Ngoc Tin)</author><guid>https://ngoctin.me/ai-engineer/11-evaluation-safety-and-ethics/ragas/</guid><description>RAGAS là một framework mã nguồn mở được thiết kế đặc biệt để đánh giá các pipeline RAG.</description></item></channel></rss>