<rss xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title>Entropy - Nhãn - NZQIRC</title><link>https://nzqirc.xyz/tags/entropy/</link><description>Entropy - Nhãn - NZQIRC</description><generator>Hugo -- gohugo.io</generator><language>vi</language><copyright>This work is licensed under a Creative Commons Attribution-NonCommercial 4.0 International License.</copyright><lastBuildDate>Fri, 18 Sep 2026 18:00:00 +0700</lastBuildDate><atom:link href="https://nzqirc.xyz/tags/entropy/" rel="self" type="application/rss+xml"/><item><title>Tại Sao 'Thông Tin' Lại Dùng Logarit?</title><link>https://nzqirc.xyz/posts/math/stats/why-information-uses-log/</link><pubDate>Fri, 18 Sep 2026 18:00:00 +0700</pubDate><author>Du Mã</author><guid>https://nzqirc.xyz/posts/math/stats/why-information-uses-log/</guid><description><![CDATA[<p>Vì log gần như là hàm tự nhiên nhất khi ta muốn một đại lượng gọi là <strong>“information”</strong>.</p>
<h2 id="1-trực-giác-cốt-lõi-xác-suất-nhân-thông-tin-cộng">1. Trực giác cốt lõi: Xác suất nhân, thông tin cộng</h2>
<p>Nếu hai sự kiện độc lập xảy ra với xác suất $p$ và $q$, thì xác suất để cả hai cùng xảy ra là $pq$.</p>
<p>Nhưng ta muốn lượng thông tin thu được phải <strong>cộng dồn</strong>:</p>
$$
I(pq) = I(p) + I(q).
$$<p>Hàm liên tục thỏa mãn tính chất này có dạng:</p>]]></description></item><item><title>So sánh ba thước đo độ hỗn tạp: Gini, Entropy và Sai số phân loại</title><link>https://nzqirc.xyz/posts/math/stats/gini-entropy-misclassification-error/</link><pubDate>Tue, 08 Sep 2026 14:48:00 +0700</pubDate><author>Du Mã</author><guid>https://nzqirc.xyz/posts/math/stats/gini-entropy-misclassification-error/</guid><description><![CDATA[<p>Khi huấn luyện một <a href="https://nzqirc.xyz/posts/math/stats/decision-tree/" rel="">cây quyết định phân loại (Decision Tree)</a>, giảm tỷ lệ dự đoán sai ngoài mẫu thường là một mục tiêu quan trọng. Vậy tại sao các thuật toán kinh điển như CART (Breiman et al., 1984) và C4.5 (Quinlan, 1993) không dùng trực tiếp <strong>Sai số phân loại</strong> (<em>Misclassification Error</em>) để tìm điểm phân nhánh, mà dùng <a href="https://nzqirc.xyz/posts/math/stats/gini-impurity/" rel="">Độ hỗn tạp Gini</a> hoặc tiêu chí dựa trên <a href="https://nzqirc.xyz/posts/math/stats/entropy/" rel="">Shannon Entropy</a>?</p>
<p>Bài viết này so sánh trực diện ba thước đo độ hỗn tạp, làm sáng tỏ &ldquo;điểm mù&rdquo; của sai số phân loại, và chứng minh bất đẳng thức toán học $E(t) \le G(t)$ liên kết chúng với nhau.</p>]]></description></item><item><title>Entropy (Shannon Entropy): Đo lường sự bất ngờ và độ bất định</title><link>https://nzqirc.xyz/posts/math/stats/entropy/</link><pubDate>Tue, 08 Sep 2026 14:45:00 +0700</pubDate><author>Du Mã</author><guid>https://nzqirc.xyz/posts/math/stats/entropy/</guid><description><![CDATA[<p>Năm 1948, Claude Shannon công bố bài báo <em>&ldquo;A Mathematical Theory of Communication&rdquo;</em>, xây dựng một khuôn khổ toán học cho truyền thông. Một câu hỏi trung tâm của khuôn khổ ấy là: <strong>Làm thế nào để lượng hoá &ldquo;lượng thông tin&rdquo; chứa trong một thông điệp?</strong></p>
<p>Một khái niệm trung tâm trong câu trả lời là <strong>Entropy</strong> — thước đo độ bất định (<em>uncertainty</em>) trung bình của một nguồn. Trong học máy, Entropy là cơ sở của Information Gain trong ID3 và Gain Ratio trong C4.5.</p>]]></description></item><item><title>Chỉ số Gini (Gini Impurity): Đo độ hỗn tạp từ một trò chơi xác suất</title><link>https://nzqirc.xyz/posts/math/stats/gini-impurity/</link><pubDate>Sun, 30 Aug 2026 16:00:00 +0700</pubDate><author>Du Mã</author><guid>https://nzqirc.xyz/posts/math/stats/gini-impurity/</guid><description><![CDATA[<p>Thuật toán cây phân loại <a href="https://nzqirc.xyz/posts/math/stats/decision-tree/" rel="">CART (Classification and Regression Trees)</a> thực chất là bài toán <strong>Cô Tấm lựa đậu</strong> được tự động hoá, vận hành nhờ sự phối hợp nhịp nhàng giữa hai vai trò: <strong>The Doer</strong> (người thực thi) và <strong>The Tester</strong> (giám khảo đánh giá).</p>
<ul>
<li><strong>Cô Tấm (The Doer — Bộ phân nhánh):</strong> Bắt đầu với một rổ đậu lẫn lộn (tập dữ liệu), nhiệm vụ của Tấm là liên tục đề xuất phương pháp phân loại.</li>
<li><strong>Thước đo Gini (The Tester — Giám khảo):</strong> Mỗi khi Tấm chia thử, &ldquo;máy đo Gini&rdquo; sẽ quét qua hai rổ mới để định lượng độ hỗn tạp:
<ul>
<li><strong>$\text{Gini} = 0$:</strong> Rổ <strong>thuần khiết tuyệt đối</strong> (chỉ còn một loại hạt) $\to$ Tấm cất rổ đó đi, nhánh này hoàn tất.</li>
<li><strong>$\text{Gini} &gt; 0$:</strong> Rổ vẫn <strong>hỗn tạp</strong> (còn lẫn nhiều loại hạt) $\to$ Tấm phải tiếp tục tìm tiêu chí để lựa tiếp.</li>
</ul>
</li>
</ul>
<p>&ldquo;Doer&rdquo; thử mọi cách chia khả dĩ, còn &ldquo;Tester&rdquo; kiên nhẫn chấm điểm mức độ giảm độ hỗn tạp $\Delta G$ — tức hiệu số giữa độ hỗn tạp của rổ ban đầu trừ đi độ hỗn tạp trung bình của các rổ con sau khi chia ($\Delta G = G_{\text{trước}} - G_{\text{sau}}$). Cách lựa nào mang lại $\Delta G$ lớn nhất (giúp rổ đậu sạch nhanh nhất) sẽ được chốt hạ, và chu trình cứ thế lặp lại cho đến khi các rổ đạt độ thuần khiết mong muốn (hoặc chạm ngưỡng dừng của cây).</p>]]></description></item><item><title>Tổng quan về sinh số ngẫu nhiên: từ entropy đến PRNG và CSPRNG</title><link>https://nzqirc.xyz/posts/math/stats/random-number-generation-overview/</link><pubDate>Mon, 03 Aug 2026 11:00:00 +0700</pubDate><author>Du Mã</author><guid>https://nzqirc.xyz/posts/math/stats/random-number-generation-overview/</guid><description><![CDATA[<h2 id="1-số-ngẫu-nhiên-có-thể-đến-từ-hai-nơi">1. “Số ngẫu nhiên” có thể đến từ hai nơi</h2>
<p>Khi một chương trình yêu cầu số ngẫu nhiên, có hai công việc rất khác nhau có thể đang diễn ra:</p>
<ol>
<li><strong>Thu nhận entropy từ thế giới thực:</strong> đo một hiện tượng khó dự đoán như nhiễu điện tử hoặc độ lệch thời gian của các sự kiện hệ thống.</li>
<li><strong>Mở rộng một trạng thái hữu hạn bằng thuật toán tất định:</strong> từ một seed ngắn, sinh nhanh một luồng bit dài có tính chất thống kê hoặc tính chất mật mã mong muốn.</li>
</ol>
<p>Hệ điều hành hiện đại thường kết hợp cả hai. Nó gom các tín hiệu khó dự đoán, kiểm tra và trộn chúng thành seed; sau đó một <strong>bộ sinh số giả ngẫu nhiên an toàn mật mã</strong> (cryptographically secure pseudorandom number generator, CSPRNG) mở rộng seed đó thành lượng dữ liệu lớn. Vì vậy, “ngẫu nhiên vật lý” và “PRNG tất định” không nhất thiết là hai lựa chọn loại trừ nhau: nhánh thứ nhất thường nuôi seed và reseed cho nhánh thứ hai.</p>]]></description></item></channel></rss>