<rss xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title>Cart - Nhãn - NZQIRC</title><link>https://nzqirc.xyz/tags/cart/</link><description>Cart - Nhãn - NZQIRC</description><generator>Hugo -- gohugo.io</generator><language>vi</language><copyright>This work is licensed under a Creative Commons Attribution-NonCommercial 4.0 International License.</copyright><lastBuildDate>Tue, 08 Sep 2026 14:48:00 +0700</lastBuildDate><atom:link href="https://nzqirc.xyz/tags/cart/" rel="self" type="application/rss+xml"/><item><title>So sánh ba thước đo độ hỗn tạp: Gini, Entropy và Sai số phân loại</title><link>https://nzqirc.xyz/posts/math/stats/gini-entropy-misclassification-error/</link><pubDate>Tue, 08 Sep 2026 14:48:00 +0700</pubDate><author>Du Mã</author><guid>https://nzqirc.xyz/posts/math/stats/gini-entropy-misclassification-error/</guid><description><![CDATA[<p>Khi huấn luyện một <a href="https://nzqirc.xyz/posts/math/stats/decision-tree/" rel="">cây quyết định phân loại (Decision Tree)</a>, giảm tỷ lệ dự đoán sai ngoài mẫu thường là một mục tiêu quan trọng. Vậy tại sao các thuật toán kinh điển như CART (Breiman et al., 1984) và C4.5 (Quinlan, 1993) không dùng trực tiếp <strong>Sai số phân loại</strong> (<em>Misclassification Error</em>) để tìm điểm phân nhánh, mà dùng <a href="https://nzqirc.xyz/posts/math/stats/gini-impurity/" rel="">Độ hỗn tạp Gini</a> hoặc tiêu chí dựa trên <a href="https://nzqirc.xyz/posts/math/stats/entropy/" rel="">Shannon Entropy</a>?</p>
<p>Bài viết này so sánh trực diện ba thước đo độ hỗn tạp, làm sáng tỏ &ldquo;điểm mù&rdquo; của sai số phân loại, và chứng minh bất đẳng thức toán học $E(t) \le G(t)$ liên kết chúng với nhau.</p>]]></description></item><item><title>Chỉ số Gini (Gini Impurity): Đo độ hỗn tạp từ một trò chơi xác suất</title><link>https://nzqirc.xyz/posts/math/stats/gini-impurity/</link><pubDate>Sun, 30 Aug 2026 16:00:00 +0700</pubDate><author>Du Mã</author><guid>https://nzqirc.xyz/posts/math/stats/gini-impurity/</guid><description><![CDATA[<p>Thuật toán cây phân loại <a href="https://nzqirc.xyz/posts/math/stats/decision-tree/" rel="">CART (Classification and Regression Trees)</a> thực chất là bài toán <strong>Cô Tấm lựa đậu</strong> được tự động hoá, vận hành nhờ sự phối hợp nhịp nhàng giữa hai vai trò: <strong>The Doer</strong> (người thực thi) và <strong>The Tester</strong> (giám khảo đánh giá).</p>
<ul>
<li><strong>Cô Tấm (The Doer — Bộ phân nhánh):</strong> Bắt đầu với một rổ đậu lẫn lộn (tập dữ liệu), nhiệm vụ của Tấm là liên tục đề xuất phương pháp phân loại.</li>
<li><strong>Thước đo Gini (The Tester — Giám khảo):</strong> Mỗi khi Tấm chia thử, &ldquo;máy đo Gini&rdquo; sẽ quét qua hai rổ mới để định lượng độ hỗn tạp:
<ul>
<li><strong>$\text{Gini} = 0$:</strong> Rổ <strong>thuần khiết tuyệt đối</strong> (chỉ còn một loại hạt) $\to$ Tấm cất rổ đó đi, nhánh này hoàn tất.</li>
<li><strong>$\text{Gini} &gt; 0$:</strong> Rổ vẫn <strong>hỗn tạp</strong> (còn lẫn nhiều loại hạt) $\to$ Tấm phải tiếp tục tìm tiêu chí để lựa tiếp.</li>
</ul>
</li>
</ul>
<p>&ldquo;Doer&rdquo; thử mọi cách chia khả dĩ, còn &ldquo;Tester&rdquo; kiên nhẫn chấm điểm mức độ giảm độ hỗn tạp $\Delta G$ — tức hiệu số giữa độ hỗn tạp của rổ ban đầu trừ đi độ hỗn tạp trung bình của các rổ con sau khi chia ($\Delta G = G_{\text{trước}} - G_{\text{sau}}$). Cách lựa nào mang lại $\Delta G$ lớn nhất (giúp rổ đậu sạch nhanh nhất) sẽ được chốt hạ, và chu trình cứ thế lặp lại cho đến khi các rổ đạt độ thuần khiết mong muốn (hoặc chạm ngưỡng dừng của cây).</p>]]></description></item><item><title>Cây quyết định (Decision Tree): Một câu hỏi chia đôi dữ liệu</title><link>https://nzqirc.xyz/posts/math/stats/decision-tree/</link><pubDate>Sun, 30 Aug 2026 13:00:00 +0700</pubDate><author>Du Mã</author><guid>https://nzqirc.xyz/posts/math/stats/decision-tree/</guid><description><![CDATA[<p>Một <a href="https://nzqirc.xyz/glossary/#decision-tree" rel="">cây quyết định</a> học bằng cách đặt liên tiếp những câu hỏi đơn giản. Chẳng hạn, với một hồ sơ tín dụng, cây có thể hỏi “tỷ lệ nợ có vượt 40% không?”, rồi ở mỗi nhánh lại hỏi thêm về thu nhập hoặc lịch sử trả nợ. Đi hết một đường từ gốc tới lá, ta nhận được một dự đoán.</p>
<p>Sự đơn giản này dễ tạo cảm giác rằng cây chỉ là một sơ đồ <em>if–else</em> được viết bằng tay. Điểm khác biệt nằm ở chỗ <strong>dữ liệu quyết định câu hỏi nào được đặt, đặt ở đâu và khi nào dừng lại</strong>. Bài viết sẽ đi từ một phép chia duy nhất tới toàn bộ cây, sau đó chỉ ra vì sao một cây đơn thường được dùng làm mô hình cơ sở (base learner) cho <a href="https://nzqirc.xyz/posts/math/stats/random-forest/" rel="">Random Forest</a>.</p>]]></description></item></channel></rss>