<rss xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title>Gini-Impurity - Nhãn - NZQIRC</title><link>https://nzqirc.xyz/tags/gini-impurity/</link><description>Gini-Impurity - Nhãn - NZQIRC</description><generator>Hugo -- gohugo.io</generator><language>vi</language><copyright>This work is licensed under a Creative Commons Attribution-NonCommercial 4.0 International License.</copyright><lastBuildDate>Tue, 08 Sep 2026 14:48:00 +0700</lastBuildDate><atom:link href="https://nzqirc.xyz/tags/gini-impurity/" rel="self" type="application/rss+xml"/><item><title>So sánh ba thước đo độ hỗn tạp: Gini, Entropy và Sai số phân loại</title><link>https://nzqirc.xyz/posts/math/stats/gini-entropy-misclassification-error/</link><pubDate>Tue, 08 Sep 2026 14:48:00 +0700</pubDate><author>Du Mã</author><guid>https://nzqirc.xyz/posts/math/stats/gini-entropy-misclassification-error/</guid><description><![CDATA[<p>Khi huấn luyện một <a href="https://nzqirc.xyz/posts/math/stats/decision-tree/" rel="">cây quyết định phân loại (Decision Tree)</a>, giảm tỷ lệ dự đoán sai ngoài mẫu thường là một mục tiêu quan trọng. Vậy tại sao các thuật toán kinh điển như CART (Breiman et al., 1984) và C4.5 (Quinlan, 1993) không dùng trực tiếp <strong>Sai số phân loại</strong> (<em>Misclassification Error</em>) để tìm điểm phân nhánh, mà dùng <a href="https://nzqirc.xyz/posts/math/stats/gini-impurity/" rel="">Độ hỗn tạp Gini</a> hoặc tiêu chí dựa trên <a href="https://nzqirc.xyz/posts/math/stats/entropy/" rel="">Shannon Entropy</a>?</p>
<p>Bài viết này so sánh trực diện ba thước đo độ hỗn tạp, làm sáng tỏ &ldquo;điểm mù&rdquo; của sai số phân loại, và chứng minh bất đẳng thức toán học $E(t) \le G(t)$ liên kết chúng với nhau.</p>]]></description></item><item><title>Entropy (Shannon Entropy): Đo lường sự bất ngờ và độ bất định</title><link>https://nzqirc.xyz/posts/math/stats/entropy/</link><pubDate>Tue, 08 Sep 2026 14:45:00 +0700</pubDate><author>Du Mã</author><guid>https://nzqirc.xyz/posts/math/stats/entropy/</guid><description><![CDATA[<p>Năm 1948, Claude Shannon công bố bài báo <em>&ldquo;A Mathematical Theory of Communication&rdquo;</em>, xây dựng một khuôn khổ toán học cho truyền thông. Một câu hỏi trung tâm của khuôn khổ ấy là: <strong>Làm thế nào để lượng hoá &ldquo;lượng thông tin&rdquo; chứa trong một thông điệp?</strong></p>
<p>Một khái niệm trung tâm trong câu trả lời là <strong>Entropy</strong> — thước đo độ bất định (<em>uncertainty</em>) trung bình của một nguồn. Trong học máy, Entropy là cơ sở của Information Gain trong ID3 và Gain Ratio trong C4.5.</p>]]></description></item><item><title>Chỉ số Gini (Gini Impurity): Đo độ hỗn tạp từ một trò chơi xác suất</title><link>https://nzqirc.xyz/posts/math/stats/gini-impurity/</link><pubDate>Sun, 30 Aug 2026 16:00:00 +0700</pubDate><author>Du Mã</author><guid>https://nzqirc.xyz/posts/math/stats/gini-impurity/</guid><description><![CDATA[<p>Thuật toán cây phân loại <a href="https://nzqirc.xyz/posts/math/stats/decision-tree/" rel="">CART (Classification and Regression Trees)</a> thực chất là bài toán <strong>Cô Tấm lựa đậu</strong> được tự động hoá, vận hành nhờ sự phối hợp nhịp nhàng giữa hai vai trò: <strong>The Doer</strong> (người thực thi) và <strong>The Tester</strong> (giám khảo đánh giá).</p>
<ul>
<li><strong>Cô Tấm (The Doer — Bộ phân nhánh):</strong> Bắt đầu với một rổ đậu lẫn lộn (tập dữ liệu), nhiệm vụ của Tấm là liên tục đề xuất phương pháp phân loại.</li>
<li><strong>Thước đo Gini (The Tester — Giám khảo):</strong> Mỗi khi Tấm chia thử, &ldquo;máy đo Gini&rdquo; sẽ quét qua hai rổ mới để định lượng độ hỗn tạp:
<ul>
<li><strong>$\text{Gini} = 0$:</strong> Rổ <strong>thuần khiết tuyệt đối</strong> (chỉ còn một loại hạt) $\to$ Tấm cất rổ đó đi, nhánh này hoàn tất.</li>
<li><strong>$\text{Gini} &gt; 0$:</strong> Rổ vẫn <strong>hỗn tạp</strong> (còn lẫn nhiều loại hạt) $\to$ Tấm phải tiếp tục tìm tiêu chí để lựa tiếp.</li>
</ul>
</li>
</ul>
<p>&ldquo;Doer&rdquo; thử mọi cách chia khả dĩ, còn &ldquo;Tester&rdquo; kiên nhẫn chấm điểm mức độ giảm độ hỗn tạp $\Delta G$ — tức hiệu số giữa độ hỗn tạp của rổ ban đầu trừ đi độ hỗn tạp trung bình của các rổ con sau khi chia ($\Delta G = G_{\text{trước}} - G_{\text{sau}}$). Cách lựa nào mang lại $\Delta G$ lớn nhất (giúp rổ đậu sạch nhanh nhất) sẽ được chốt hạ, và chu trình cứ thế lặp lại cho đến khi các rổ đạt độ thuần khiết mong muốn (hoặc chạm ngưỡng dừng của cây).</p>]]></description></item></channel></rss>