Kết nối tri thức nhân loại

Học không giám sát phát hiện cấu trúc dữ liệu thế nào?

Học không giám sát tìm cấu trúc trong dữ liệu chưa gắn nhãn bằng cách tối ưu các tiêu chí như độ gần, mật độ hoặc phương sai. Cơ chế hình thành cụm, phát hiện trục biến thiên và kiểm tra độ tin cậy cho thấy vì sao một mẫu có thể hữu ích hoặc chỉ là hệ quả của cách biểu diễn dữ liệu.
Học không giám sát làm việc với các quan sát chưa có nhãn mục tiêu. Thay vì học một ánh xạ từ dữ liệu đầu vào tới đáp án đã biết, thuật toán tìm những quy luật nội tại theo một tiêu chí toán học: điểm nào gần nhau, vùng nào có mật độ cao, hướng nào chứa nhiều biến thiên hoặc quan sát nào khác biệt rõ so với phần còn lại.
Học không giám sát phát hiện cấu trúc dữ liệu thế nào?

Điểm quan trọng là “cấu trúc” không tự tồn tại độc lập với cách dữ liệu được biểu diễn. Nếu đổi thang đo biến, cách tính khoảng cách hoặc giả định của thuật toán, cấu trúc thu được có thể thay đổi. Vì vậy, học không giám sát phát hiện cấu trúc phù hợp với một định nghĩa về độ giống nhau hay mức độ biến thiên; nó không tự chứng minh rằng các nhóm tìm được là “nhóm thật” theo ý nghĩa nghiệp vụ.

Học không giám sát là gì và nó học từ dữ liệu ra sao?

Với dữ liệu có giám sát, mỗi mẫu thường đi kèm một nhãn y, chẳng hạn “gian lận/không gian lận” hoặc giá nhà. Mô hình học cách dự đoán nhãn đó từ các đặc trưng X. Trong học không giám sát, mô hình chủ yếu chỉ nhận X. Không có nhãn chuẩn để nói ngay một cách trực tiếp rằng dự đoán nào đúng hay sai.

Do thiếu nhãn, thuật toán phải thay câu hỏi “dự đoán đáp án nào?” bằng một mục tiêu cấu trúc. K-means tìm cách làm các điểm trong cùng cụm gần tâm cụm nhất có thể. PCA tìm các hướng chiếu giữ lại nhiều phương sai của dữ liệu. DBSCAN tìm các vùng mà điểm dữ liệu tập trung đủ dày và tách chúng khỏi vùng thưa.

Vì thế, từ “học” ở đây không có nghĩa là hệ thống tự hiểu ý nghĩa của dữ liệu. Nó ước lượng tham số, quan hệ hoặc cách phân chia sao cho tối ưu một tiêu chí đã được xác định. Tiêu chí càng phù hợp với kiểu cấu trúc đang tồn tại, kết quả càng có khả năng hữu ích; nếu tiêu chí không phù hợp, thuật toán vẫn có thể tạo ra một kết quả có vẻ có tổ chức nhưng không phản ánh điều người phân tích quan tâm.

Học không giám sát và cách tìm mẫu, nhóm trong dữ liệu chưa gắn nhãn

Cấu trúc trong dữ liệu chưa gắn nhãn có thể xuất hiện dưới những dạng nào?

Cụm: các quan sát giống nhau nằm gần nhau

Một cụm là tập các quan sát có độ tương đồng nội bộ cao hơn so với các quan sát bên ngoài, theo một thước đo cụ thể. Với dữ liệu số, khoảng cách Euclid thường được dùng; với loại dữ liệu khác, độ tương đồng có thể cần được định nghĩa theo cách khác. Do đó, “giống nhau” là một giả định kỹ thuật chứ không phải thuộc tính tuyệt đối.

Nếu dữ liệu khách hàng gồm tần suất mua và giá trị đơn hàng, một vùng điểm dày có thể đại diện cho nhóm mua thường xuyên với giá trị cao. Tuy nhiên, nếu biến giá trị đơn hàng lớn hơn biến tần suất hàng trăm lần về thang đo, khoảng cách Euclid có thể bị biến đó chi phối. Chuẩn hóa dữ liệu khi phù hợp vì vậy có thể thay đổi đáng kể hình dạng cụm.

Trục biến thiên: nhiều biến cùng thay đổi theo một hướng chung

Cấu trúc không nhất thiết phải là các nhóm rời rạc. Nhiều biến có thể đồng biến vì chúng phản ánh một yếu tố tiềm ẩn chung. PCA khai thác dạng cấu trúc này bằng cách tìm các hướng tuyến tính mà dữ liệu biến thiên mạnh nhất, rồi biểu diễn mỗi quan sát trên các hướng đó.

Nếu mười cảm biến có nhiều tín hiệu tương quan, một vài thành phần chính có thể tóm tắt phần lớn biến thiên. Điều này làm lộ ra hình dạng dữ liệu trong không gian ít chiều hơn và cho thấy biến nào cùng đóng góp vào một hướng biến thiên.

Mật độ và ngoại lệ: vùng dày, vùng thưa và điểm khác biệt

Một số cấu trúc được nhận ra thông qua mật độ thay vì khoảng cách tới tâm. DBSCAN xem các vùng có đủ nhiều điểm lân cận là phần lõi của cụm và có thể đánh dấu điểm nằm ở vùng quá thưa là nhiễu. Cách nhìn này phù hợp khi cụm có hình dạng không gần hình cầu.

Ngoại lệ cũng là một dạng cấu trúc tương đối: một điểm chỉ “bất thường” khi nó khác đáng kể so với phân bố hoặc vùng lân cận đang dùng làm chuẩn. Vì thế, phát hiện ngoại lệ không đồng nghĩa với phát hiện lỗi hay gian lận; ý nghĩa cuối cùng vẫn cần được kiểm tra trong ngữ cảnh của dữ liệu.

Thuật toán tạo nhóm từ độ gần và mật độ như thế nào?

K-means tối thiểu hóa độ phân tán trong cụm

K-means bắt đầu với K tâm cụm. Mỗi điểm được gán vào tâm gần nhất, sau đó tâm được cập nhật bằng trung bình của các điểm trong cụm. Hai bước gán điểm và cập nhật tâm lặp lại cho tới khi nghiệm ổn định theo tiêu chí dừng.

Hàm mục tiêu thường được viết dưới dạng tổng bình phương khoảng cách trong cụm:

i∑​∥xi​−μc(i)​∥2

Trong đó xi​ là một quan sát và μc(i)​ là tâm của cụm chứa quan sát đó. Việc tối thiểu hóa đại lượng này giải thích vì sao k-means có xu hướng tạo các cụm gọn quanh tâm và hoạt động tự nhiên nhất khi cấu trúc gần dạng cầu trong không gian đo khoảng cách. Nghiệm tìm được cũng không nhất thiết là tối ưu toàn cục, nên những lần khởi tạo khác nhau có thể dẫn đến kết quả khác nhau.

K-means luôn cố phân dữ liệu thành K cụm khi người dùng yêu cầu K, ngay cả khi dữ liệu không có K nhóm tự nhiên. Đây là giới hạn quan trọng: kết quả phân cụm không phải bằng chứng rằng số nhóm đã chọn thực sự tồn tại trong dữ liệu.

Phân cụm phân cấp giữ lại quan hệ gần xa ở nhiều mức

Phân cụm phân cấp không chỉ trả về một lần chia nhóm. Ở dạng kết tụ, mỗi quan sát ban đầu là một cụm, sau đó các cụm gần nhau được ghép dần dựa trên quy tắc liên kết như single, complete hoặc average linkage. Kết quả có thể biểu diễn bằng dendrogram, cho thấy thứ tự và khoảng cách tương đối của các lần ghép.

Người phân tích có thể cắt cây ở một mức để lấy số cụm mong muốn. Lợi ích là nhìn được cấu trúc theo nhiều độ phân giải; đổi quy tắc liên kết hoặc thước đo khoảng cách vẫn có thể dẫn tới cây khác, nên dendrogram cũng phụ thuộc vào giả định kỹ thuật.

DBSCAN nối các vùng có mật độ đủ cao

DBSCAN dùng hai tham số chính: bán kính lân cận ε và số điểm tối thiểu min_samples. Một điểm có đủ số láng giềng trong bán kính quy định được xem là điểm lõi; các điểm lõi có thể kết nối qua chuỗi lân cận để hình thành cụm. Điểm không thuộc vùng mật độ đủ cao có thể bị đánh dấu là nhiễu.

Cơ chế này không yêu cầu đặt trước số cụm và có thể tìm cụm có hình dạng phức tạp hơn k-means. Đổi ε hoặc min_samples có thể làm các vùng bị tách, nhập hoặc biến thành nhiễu; khi các cụm có mật độ rất khác nhau, một bộ tham số duy nhất cũng có thể không mô tả tốt toàn bộ dữ liệu.

Giảm chiều làm lộ ra mẫu và trục tiềm ẩn như thế nào?

PCA bắt đầu bằng việc đặt dữ liệu quanh trung tâm, sau đó tìm các hướng trực giao lần lượt giải thích lượng phương sai lớn nhất. Về mặt đại số, các hướng này có thể thu được từ các vector riêng của ma trận hiệp phương sai hoặc thông qua phân rã giá trị kỳ dị. Quan sát được chiếu lên các hướng đó để tạo ra các thành phần chính.

Mức đóng góp của thành phần thứ j thường được mô tả bằng tỷ lệ phương sai giải thích:

EVRj​=∑k​λk​λj​​

với λj​ là phương sai theo thành phần đó. Tổng tỷ lệ của tất cả thành phần bằng 1. Nếu vài thành phần đầu chiếm phần lớn tổng phương sai, dữ liệu có thể được mô tả trong ít chiều hơn mà vẫn giữ lại phần lớn biến thiên theo nghĩa tuyến tính.

Cơ chế này khác phân cụm. PCA không cố tìm ranh giới giữa các nhóm; nó tìm hệ trục mới. Sau phép chiếu, các cụm có thể trở nên dễ quan sát hơn nếu sự khác biệt giữa chúng trùng với các hướng có phương sai lớn, nhưng cũng có thể không lộ ra nếu tín hiệu phân nhóm nằm ở hướng phương sai nhỏ.

Thang đo tiếp tục là một điều kiện quan trọng. Nếu các biến dùng đơn vị rất khác nhau, biến có phương sai số học lớn có thể chi phối thành phần chính. Chuẩn hóa trước PCA thường hợp lý khi đơn vị đo không nên quyết định tầm quan trọng; ngược lại, chuẩn hóa máy móc có thể làm mất ý nghĩa khi độ lớn tuyệt đối của phương sai chính là thông tin cần giữ.

Làm sao biết cấu trúc tìm được có đáng tin?

Không có nhãn chuẩn đồng nghĩa với việc không thể dùng “accuracy” theo cách quen thuộc để đánh giá mọi bài toán học không giám sát. Việc kiểm tra phải bám vào loại cấu trúc và mục tiêu của thuật toán.

Với phân cụm, silhouette coefficient là một chỉ số nội bộ phổ biến. Với mỗi điểm, a là khoảng cách trung bình tới các điểm trong cùng cụm và b là khoảng cách trung bình nhỏ nhất tới một cụm khác; hệ số được tính bằng:

s=max(a,b)b−a​

Theo định nghĩa kỹ thuật được dùng trong scikit-learn, s nằm trong khoảng [−1,1]. Giá trị gần 1 cho thấy điểm nằm gọn trong cụm của mình và tách khỏi cụm gần nhất; gần 0 thường phản ánh vùng chồng lấn; giá trị âm cho thấy điểm có thể gần cụm khác hơn. Đây không phải một ngưỡng chất lượng phổ quát: hình dạng cụm, thước đo khoảng cách và mục tiêu phân tích vẫn quyết định cách diễn giải.

Một cấu trúc đáng tin hơn khi nó còn xuất hiện dưới những thay đổi hợp lý của dữ liệu và quy trình. Có thể chạy lại với nhiều khởi tạo, lấy mẫu lại dữ liệu, thay đổi nhẹ siêu tham số hoặc kiểm tra một số cách tiền xử lý hợp lý. Nếu cụm liên tục đổi mạnh chỉ vì thay đổi nhỏ, kết quả có tính bất ổn và không nên được diễn giải như một phân đoạn chắc chắn.

Kiểm tra tiếp theo là ý nghĩa của cấu trúc. Một cụm chỉ có giá trị thực tế khi các đặc trưng tạo nên sự khác biệt có thể được giải thích và liên hệ với câu hỏi phân tích. Chỉ số nội bộ cao nhưng các nhóm không có ý nghĩa sử dụng vẫn chưa đủ; ngược lại, một cấu trúc hơi chồng lấn có thể vẫn hữu ích nếu nó ổn định và phản ánh khác biệt có ý nghĩa trong bối cảnh cụ thể.

Khi nào cấu trúc phát hiện được có thể gây hiểu sai?

Sai lệch thường xuất hiện từ cách biểu diễn dữ liệu trước khi xuất hiện từ chính thuật toán. Khoảng cách bị lệch bởi thang đo, biến dư thừa làm một tín hiệu bị tính nhiều lần, dữ liệu có quá nhiều chiều có thể làm khoảng cách giữa các điểm trở nên kém phân biệt, hoặc mã hóa biến không phù hợp đều có thể khiến thuật toán “nhìn thấy” một hình học khác với điều người phân tích dự định.

Giả định của thuật toán là nguồn sai lệch thứ hai. K-means ưu tiên cụm gọn quanh tâm; DBSCAN phụ thuộc vào mức mật độ được xác định qua ε và min_samples; PCA chỉ mô tả cấu trúc tuyến tính dựa trên phương sai. Không thuật toán nào đại diện cho mọi dạng cấu trúc. Chọn phương pháp vì quen thuộc thay vì vì phù hợp với hình học dữ liệu có thể tạo ra kết quả rõ ràng nhưng sai câu hỏi.

Một hiểu lầm phổ biến khác là đồng nhất cụm với nhãn thật. Phân cụm chỉ cho biết các điểm giống nhau theo tiêu chí đã chọn. Nó không chứng minh rằng các nhóm là các lớp tự nhiên, không chứng minh quan hệ nhân quả và cũng không tự gán ý nghĩa nghiệp vụ. Ý nghĩa đó phải đến từ việc xem đặc trưng nào phân biệt nhóm, kiểm tra độ ổn định và đối chiếu với kiến thức miền.

Trong thực hành, nên xác định trước loại cấu trúc cần tìm, xử lý thang đo và biểu diễn dữ liệu cho phù hợp, chọn thuật toán có giả định tương thích, rồi đánh giá kết quả bằng nhiều tín hiệu thay vì một chỉ số duy nhất. Nếu kết quả vẫn ổn định khi thay đổi hợp lý các lựa chọn kỹ thuật và có thể giải thích được bằng các đặc trưng thực tế, người phân tích có cơ sở tốt hơn để xem đó là một cấu trúc hữu ích.

Học không giám sát phát hiện cấu trúc bằng cách tối ưu một tiêu chí thay cho việc học từ nhãn. Độ gần và mật độ có thể làm lộ ra cụm, phương sai có thể làm lộ ra các trục tiềm ẩn, còn vùng thưa có thể gợi ý ngoại lệ. Giá trị của kết quả không nằm ở việc thuật toán đã tạo ra một nhóm hay biểu đồ, mà ở việc cấu trúc đó phù hợp với cách dữ liệu được biểu diễn, ổn định trước các thay đổi hợp lý và có ý nghĩa đối với câu hỏi phân tích.

12/10/2026 00:35:23
GỬI Ý KIẾN BÌNH LUẬN