<rss xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title>Interactive - Nhãn - NZQIRC</title><link>https://nzqirc.xyz/tags/interactive/</link><description>Interactive - Nhãn - NZQIRC</description><generator>Hugo -- gohugo.io</generator><language>vi</language><copyright>This work is licensed under a Creative Commons Attribution-NonCommercial 4.0 International License.</copyright><lastBuildDate>Tue, 08 Sep 2026 14:48:00 +0700</lastBuildDate><atom:link href="https://nzqirc.xyz/tags/interactive/" rel="self" type="application/rss+xml"/><item><title>So sánh ba thước đo độ hỗn tạp: Gini, Entropy và Sai số phân loại</title><link>https://nzqirc.xyz/posts/math/stats/gini-entropy-misclassification-error/</link><pubDate>Tue, 08 Sep 2026 14:48:00 +0700</pubDate><author>Du Mã</author><guid>https://nzqirc.xyz/posts/math/stats/gini-entropy-misclassification-error/</guid><description><![CDATA[<p>Khi huấn luyện một <a href="https://nzqirc.xyz/posts/math/stats/decision-tree/" rel="">cây quyết định phân loại (Decision Tree)</a>, giảm tỷ lệ dự đoán sai ngoài mẫu thường là một mục tiêu quan trọng. Vậy tại sao các thuật toán kinh điển như CART (Breiman et al., 1984) và C4.5 (Quinlan, 1993) không dùng trực tiếp <strong>Sai số phân loại</strong> (<em>Misclassification Error</em>) để tìm điểm phân nhánh, mà dùng <a href="https://nzqirc.xyz/posts/math/stats/gini-impurity/" rel="">Độ hỗn tạp Gini</a> hoặc tiêu chí dựa trên <a href="https://nzqirc.xyz/posts/math/stats/entropy/" rel="">Shannon Entropy</a>?</p>
<p>Bài viết này so sánh trực diện ba thước đo độ hỗn tạp, làm sáng tỏ &ldquo;điểm mù&rdquo; của sai số phân loại, và chứng minh bất đẳng thức toán học $E(t) \le G(t)$ liên kết chúng với nhau.</p>]]></description></item><item><title>Bất đẳng thức Jensen: Trực giác hình học từ hàm lồi đến kỳ vọng xác suất</title><link>https://nzqirc.xyz/posts/math/analysis/jensen-inequality/</link><pubDate>Sun, 30 Aug 2026 17:00:00 +0700</pubDate><author>Du Mã</author><guid>https://nzqirc.xyz/posts/math/analysis/jensen-inequality/</guid><description><![CDATA[<p>Trong toán học và xác suất, phép lấy trung bình (hay kỳ vọng toán học $\mathbb{E}$) là một toán tử tuyến tính mẫu mực. Nếu ta có một hàm tuyến tính $f(x) = ax + b$, việc áp dụng hàm trước rồi lấy trung bình hay lấy trung bình trước rồi áp dụng hàm luôn cho cùng một kết quả:</p>
$$
f(\mathbb{E}[X]) = \mathbb{E}[f(X)].
$$<p>Tuy nhiên, thế giới tự nhiên và các mô hình thống kê hiếm khi tuyến tính. Khi $f$ là một hàm phi tuyến (như $x^2, e^x, \ln x$), câu hỏi căn bản xuất hiện: <strong>$f(\mathbb{E}[X])$ và $\mathbb{E}[f(X)]$, đại lượng nào lớn hơn?</strong></p>]]></description></item><item><title>Chỉ số Gini (Gini Impurity): Đo độ hỗn tạp từ một trò chơi xác suất</title><link>https://nzqirc.xyz/posts/math/stats/gini-impurity/</link><pubDate>Sun, 30 Aug 2026 16:00:00 +0700</pubDate><author>Du Mã</author><guid>https://nzqirc.xyz/posts/math/stats/gini-impurity/</guid><description><![CDATA[<p>Thuật toán cây phân loại <a href="https://nzqirc.xyz/posts/math/stats/decision-tree/" rel="">CART (Classification and Regression Trees)</a> thực chất là bài toán <strong>Cô Tấm lựa đậu</strong> được tự động hoá, vận hành nhờ sự phối hợp nhịp nhàng giữa hai vai trò: <strong>The Doer</strong> (người thực thi) và <strong>The Tester</strong> (giám khảo đánh giá).</p>
<ul>
<li><strong>Cô Tấm (The Doer — Bộ phân nhánh):</strong> Bắt đầu với một rổ đậu lẫn lộn (tập dữ liệu), nhiệm vụ của Tấm là liên tục đề xuất phương pháp phân loại.</li>
<li><strong>Thước đo Gini (The Tester — Giám khảo):</strong> Mỗi khi Tấm chia thử, &ldquo;máy đo Gini&rdquo; sẽ quét qua hai rổ mới để định lượng độ hỗn tạp:
<ul>
<li><strong>$\text{Gini} = 0$:</strong> Rổ <strong>thuần khiết tuyệt đối</strong> (chỉ còn một loại hạt) $\to$ Tấm cất rổ đó đi, nhánh này hoàn tất.</li>
<li><strong>$\text{Gini} &gt; 0$:</strong> Rổ vẫn <strong>hỗn tạp</strong> (còn lẫn nhiều loại hạt) $\to$ Tấm phải tiếp tục tìm tiêu chí để lựa tiếp.</li>
</ul>
</li>
</ul>
<p>&ldquo;Doer&rdquo; thử mọi cách chia khả dĩ, còn &ldquo;Tester&rdquo; kiên nhẫn chấm điểm mức độ giảm độ hỗn tạp $\Delta G$ — tức hiệu số giữa độ hỗn tạp của rổ ban đầu trừ đi độ hỗn tạp trung bình của các rổ con sau khi chia ($\Delta G = G_{\text{trước}} - G_{\text{sau}}$). Cách lựa nào mang lại $\Delta G$ lớn nhất (giúp rổ đậu sạch nhanh nhất) sẽ được chốt hạ, và chu trình cứ thế lặp lại cho đến khi các rổ đạt độ thuần khiết mong muốn (hoặc chạm ngưỡng dừng của cây).</p>]]></description></item><item><title>Random Forest: Khi nhiều cây quyết định cùng bỏ phiếu</title><link>https://nzqirc.xyz/posts/math/stats/random-forest/</link><pubDate>Sun, 30 Aug 2026 14:00:00 +0700</pubDate><author>Du Mã</author><guid>https://nzqirc.xyz/posts/math/stats/random-forest/</guid><description><![CDATA[<p>Một <a href="https://nzqirc.xyz/posts/math/stats/decision-tree/" rel="">cây quyết định (Decision Tree)</a> có cách suy luận trực quan và dễ theo dõi: đặt liên tiếp các câu hỏi để chia nhỏ dữ liệu. Tuy nhiên, một cây đơn lẻ có thể <strong>dao động rất mạnh theo mẫu huấn luyện</strong> (phương sai cao) — chỉ vài quan sát thay đổi cũng có thể làm phép chia gần gốc đổi chỗ và kéo theo toàn bộ cấu trúc cây đảo lộn.</p>]]></description></item><item><title>Cây quyết định (Decision Tree): Một câu hỏi chia đôi dữ liệu</title><link>https://nzqirc.xyz/posts/math/stats/decision-tree/</link><pubDate>Sun, 30 Aug 2026 13:00:00 +0700</pubDate><author>Du Mã</author><guid>https://nzqirc.xyz/posts/math/stats/decision-tree/</guid><description><![CDATA[<p>Một <a href="https://nzqirc.xyz/glossary/#decision-tree" rel="">cây quyết định</a> học bằng cách đặt liên tiếp những câu hỏi đơn giản. Chẳng hạn, với một hồ sơ tín dụng, cây có thể hỏi “tỷ lệ nợ có vượt 40% không?”, rồi ở mỗi nhánh lại hỏi thêm về thu nhập hoặc lịch sử trả nợ. Đi hết một đường từ gốc tới lá, ta nhận được một dự đoán.</p>
<p>Sự đơn giản này dễ tạo cảm giác rằng cây chỉ là một sơ đồ <em>if–else</em> được viết bằng tay. Điểm khác biệt nằm ở chỗ <strong>dữ liệu quyết định câu hỏi nào được đặt, đặt ở đâu và khi nào dừng lại</strong>. Bài viết sẽ đi từ một phép chia duy nhất tới toàn bộ cây, sau đó chỉ ra vì sao một cây đơn thường được dùng làm mô hình cơ sở (base learner) cho <a href="https://nzqirc.xyz/posts/math/stats/random-forest/" rel="">Random Forest</a>.</p>]]></description></item><item><title>Modern Portfolio Theory: Nghệ thuật kết hợp rủi ro</title><link>https://nzqirc.xyz/posts/math/stats/modern-portfolio-theory/</link><pubDate>Sun, 16 Aug 2026 11:00:00 +0700</pubDate><author>Du Mã</author><guid>https://nzqirc.xyz/posts/math/stats/modern-portfolio-theory/</guid><description><![CDATA[<p>Năm 1952, Harry Markowitz xuất bản một bài báo thay đổi hoàn toàn cách thế giới tài chính vận hành, đem về cho ông giải Nobel Kinh tế năm 1990. Lý thuyết đó mang tên <strong>Modern Portfolio Theory (MPT) - Lý thuyết Danh mục Đầu tư Hiện đại</strong>.</p>
<p>Trước MPT, người ta đầu tư đơn giản bằng cách chọn ra những cổ phiếu có lợi nhuận kỳ vọng cao nhất. Markowitz chỉ ra một sự thật cơ bản nhưng thường bị phớt lờ: <em>&ldquo;Don&rsquo;t put all your eggs in one basket&rdquo;</em> (Đừng bỏ tất cả trứng vào một rổ). Nhưng rổ nào, và bao nhiêu trứng mỗi rổ?</p>]]></description></item><item><title>Ma trận Hiệp phương sai &amp; Tương quan: Thấu kính nhìn vào rủi ro tài chính</title><link>https://nzqirc.xyz/posts/math/stats/covariance-and-correlation-matrix/</link><pubDate>Sat, 15 Aug 2026 21:02:00 +0700</pubDate><author>Du Mã</author><guid>https://nzqirc.xyz/posts/math/stats/covariance-and-correlation-matrix/</guid><description><![CDATA[<p>Trong tài chính, định lý Modern Portfolio Theory (Lý thuyết Danh mục Đầu tư Hiện đại) của Harry Markowitz nói rằng: Đừng chỉ nhìn vào rủi ro của từng tài sản đơn lẻ, hãy nhìn vào cách chúng &ldquo;nhảy múa&rdquo; cùng nhau.</p>
<p>Giả sử bạn đang xem xét tỷ suất sinh lời hàng ngày của hai tài sản:</p>
<ul>
<li><strong>Tài sản X (Ví dụ: Trái phiếu Chính phủ):</strong> An toàn, biến động thấp.</li>
<li><strong>Tài sản Y (Ví dụ: Cổ phiếu Bất động sản):</strong> Rủi ro cao, biến động cực mạnh.</li>
</ul>
<p>Để đo lường rủi ro (sự phân tán), chúng ta dùng <strong>Phương sai (Variance)</strong> cho từng tài sản. Nhưng để biết chúng đi cùng nhau hay ngược nhau (để đa dạng hoá danh mục), chúng ta cần đến <strong>Hiệp phương sai (Covariance)</strong> và <strong>Tương quan (Correlation)</strong>.</p>]]></description></item><item><title>Hồi quy Logistic (Logistic Regression): Khi đường thẳng không còn phù hợp</title><link>https://nzqirc.xyz/posts/math/stats/logistic-regression/</link><pubDate>Sat, 15 Aug 2026 21:01:00 +0700</pubDate><author>Du Mã</author><guid>https://nzqirc.xyz/posts/math/stats/logistic-regression/</guid><description><![CDATA[<p>Trong bài viết trước về <a href="https://nzqirc.xyz/posts/math/stats/linear-regression/" rel="">Hồi quy tuyến tính</a>, chúng ta dùng một đường thẳng để dự đoán một giá trị liên tục (như giá nhà). Nhưng điều gì sẽ xảy ra nếu chúng ta muốn dự đoán một biến phân loại? Ví dụ: Dựa vào số giờ ôn thi, liệu học sinh có <strong>Đậu (1)</strong> hay <strong>Rớt (0)</strong>?</p>
<p>Nếu chúng ta cố gắng dùng một đường thẳng (Hồi quy tuyến tính) cho bài toán này, kết quả sẽ rất kỳ cục. Đường thẳng có thể trả về các giá trị như $1.5$ (hơn cả mức Đậu) hoặc $-0.3$ (dưới cả mức Rớt). Điều này không có ý nghĩa toán học khi ta muốn một xác suất nằm trong khoảng $[0, 1]$.</p>]]></description></item><item><title>Hồi quy tuyến tính (Linear Regression): Trực giác đằng sau đường thẳng khớp nhất</title><link>https://nzqirc.xyz/posts/math/stats/linear-regression/</link><pubDate>Sat, 15 Aug 2026 21:00:00 +0700</pubDate><author>Du Mã</author><guid>https://nzqirc.xyz/posts/math/stats/linear-regression/</guid><description><![CDATA[<p>Hồi quy tuyến tính (Linear Regression) có lẽ là thuật toán học máy (machine learning) cơ bản và lâu đời nhất. Mặc dù có chữ &ldquo;machine learning&rdquo; nghe rất hiện đại, gốc rễ của nó đã được các nhà toán học như Gauss và Legendre tìm ra từ đầu thế kỷ 19.</p>
<p>Khi bạn có một tập hợp các điểm dữ liệu và bạn nhận thấy chúng có vẻ tuân theo một xu hướng tăng hoặc giảm, câu hỏi tự nhiên là: <strong>Làm sao để vẽ một đường thẳng đại diện tốt nhất cho xu hướng đó?</strong></p>]]></description></item><item><title>Thuật toán tính đa thức dual stable Grothendieck</title><link>https://nzqirc.xyz/posts/computer-science/dual-grothendieck-algorithm/</link><pubDate>Sun, 09 Aug 2026 08:30:00 +0700</pubDate><author>Du Mã</author><guid>https://nzqirc.xyz/posts/computer-science/dual-grothendieck-algorithm/</guid><description><![CDATA[<p>Đa thức <strong>dual Grothendieck</strong> \(g_\lambda(x_1,\dots,x_n)\) xuất phát từ các <a href="https://nzqirc.xyz/posts/math/combinatorics/reverse-plane-partition/" rel=""><em>reverse plane partition</em> (RPP)</a> với quy tắc trọng số đo bằng số cột thay vì số ô. Cách tiếp cận tổ hợp kinh điển thường giải recurrence trên cặp \((\text{Partition}, \text{Powers})\): theo dõi hình Young 2D trên dàn poset dày đặc và duy trì bảng băm rời rạc cho từng đơn thức — mô hình sớm chạm trần hiệu năng vì kiểm tra bao hàm 2D tốn kém và bùng nổ hoán vị biến trên heap.</p>]]></description></item></channel></rss>