Cách lựa chọn phương pháp xử lý dữ liệu
- Xác định mục tiêu phân tích trước khi xử lý dữ liệu
- Đánh giá trạng thái dữ liệu trước khi chọn phương pháp
- Ghép mục tiêu phân tích với nhóm phương pháp xử lý
- Chọn kỹ thuật theo bản chất từng vấn đề dữ liệu
- Cân bằng giữa làm sạch dữ liệu và bảo toàn thông tin
- Kiểm chứng phương pháp xử lý bằng thực nghiệm
Điểm quan trọng là không đồng nhất “dữ liệu sạch hơn” với “dữ liệu tốt hơn”. Xóa nhiều quan sát, thay thế mọi giá trị thiếu hay chuẩn hóa toàn bộ biến có thể làm tập dữ liệu trông đồng nhất hơn nhưng đồng thời loại bỏ tín hiệu có giá trị. Phương pháp phù hợp là phương pháp giúp dữ liệu đáp ứng tốt hơn yêu cầu của câu hỏi và mô hình phân tích mà không làm sai lệch bản chất hiện tượng.
Xác định mục tiêu phân tích trước khi xử lý dữ liệu
Bước đầu tiên không phải chọn kỹ thuật làm sạch mà là xác định kết quả phân tích cần tạo ra. Mục tiêu này quyết định loại thông tin nào phải được giữ lại, loại sai lệch nào cần kiểm soát và mức biến đổi dữ liệu có thể chấp nhận.
Nếu mục tiêu là mô tả hiện trạng, dữ liệu cần phản ánh phân phối thực tế càng trung thực càng tốt. Việc loại bỏ ngoại lệ quá mạnh có thể làm mất những trường hợp thực sự tồn tại trong tổng thể. Khi mục tiêu là so sánh các nhóm, tính nhất quán về đơn vị đo, cách mã hóa và điều kiện quan sát trở nên đặc biệt quan trọng vì khác biệt kỹ thuật giữa các nhóm có thể bị hiểu nhầm thành khác biệt thực tế.
Với mô hình dự báo hoặc phân loại, cách xử lý còn phụ thuộc vào thuật toán. Các mô hình dựa trên khoảng cách như k-nearest neighbors chịu ảnh hưởng mạnh bởi thang đo của biến, trong khi cây quyết định và nhiều mô hình dựa trên cây thường ít nhạy hơn với việc chuẩn hóa thang đo. Vì thế, chuẩn hóa không phải một bước bắt buộc mặc định mà là một quyết định phụ thuộc cơ chế của mô hình.
Đối với phát hiện bất thường, ngoại lệ lại chính là đối tượng cần nghiên cứu. Một quy trình tự động xóa các điểm cực trị trước khi phân tích có thể loại bỏ chính tín hiệu mà bài toán đang tìm kiếm.
Một câu hỏi hữu ích trước mỗi thao tác là: Nếu thay đổi dữ liệu theo cách này, thông tin nào phục vụ mục tiêu phân tích sẽ được tăng cường và thông tin nào có nguy cơ bị mất?

Đánh giá trạng thái dữ liệu trước khi chọn phương pháp
Sau khi xác định mục tiêu, cần phân biệt các vấn đề thực sự tồn tại trong dữ liệu thay vì áp dụng một danh sách xử lý cố định. Những vấn đề thường gặp gồm giá trị thiếu, bản ghi trùng, sai kiểu dữ liệu, đơn vị đo không thống nhất, giá trị ngoài miền hợp lệ, phân phối lệch, ngoại lệ và các biến có thang đo rất khác nhau.
Điểm khó nằm ở chỗ cùng một biểu hiện có thể xuất phát từ những nguyên nhân khác nhau. Một giá trị bằng 0 chẳng hạn có thể là quan sát hợp lệ, giá trị mặc định của hệ thống hoặc cách mã hóa cho dữ liệu chưa thu thập. Nếu chưa hiểu nguyên nhân mà chuyển toàn bộ số 0 thành giá trị thiếu, dữ liệu có thể bị làm sai.
Giá trị thiếu cũng không nên chỉ được đánh giá bằng tỷ lệ. Hai biến cùng thiếu 10% số quan sát nhưng ý nghĩa xử lý có thể hoàn toàn khác nhau. Nếu các giá trị thiếu xuất hiện gần như ngẫu nhiên, một phương pháp thay thế hợp lý có thể ít gây sai lệch. Ngược lại, nếu việc thiếu dữ liệu liên quan đến chính đặc điểm của đối tượng, phép thay thế đơn giản bằng trung bình có thể che mất một cơ chế quan trọng.
Ngoại lệ cũng cần được phân biệt giữa lỗi dữ liệu và quan sát hiếm nhưng có thật. Một tuổi bằng 350 nhiều khả năng là lỗi nhập liệu; doanh thu của một doanh nghiệp lớn gấp hàng chục lần phần còn lại có thể hoàn toàn hợp lệ. Chỉ trường hợp thứ nhất mới có căn cứ rõ ràng để sửa hoặc loại bỏ dựa trên miền giá trị.
Do đó, chẩn đoán dữ liệu phải đi trước xử lý. Nếu chưa biết một điểm dữ liệu bất thường vì sao xuất hiện, thao tác loại bỏ nó chỉ dựa trên một ngưỡng thống kê có thể tạo ra sai lệch mới.
Ghép mục tiêu phân tích với nhóm phương pháp xử lý
Có thể lựa chọn phương pháp hiệu quả hơn bằng cách nối trực tiếp từng vấn đề dữ liệu với tác động của nó lên mục tiêu phân tích.
|
Nhu cầu phân tích |
Vấn đề cần kiểm soát |
Nhóm phương pháp phù hợp |
|
Mô tả và thống kê |
Sai đơn vị, trùng lặp, giá trị không hợp lệ |
Chuẩn hóa định dạng, kiểm tra miền giá trị, loại bản ghi trùng |
|
So sánh các nhóm |
Khác thang đo hoặc cách mã hóa |
Chuẩn hóa quy ước, tái mã hóa nhất quán |
|
Mô hình dựa trên khoảng cách |
Các biến có độ lớn rất khác nhau |
Standardization hoặc normalization |
|
Mô hình hồi quy |
Phân phối lệch mạnh, quan hệ phi tuyến |
Biến đổi thích hợp, kiểm tra ngoại lệ và dạng quan hệ |
|
Phân loại có biến phân loại |
Thuật toán cần đầu vào số |
Encoding phù hợp với bản chất biến |
|
Phát hiện bất thường |
Giá trị cực trị cần được bảo toàn |
Hạn chế loại ngoại lệ trước phân tích |
|
Dữ liệu có giá trị thiếu |
Mất quan sát hoặc sai lệch phân phối |
Xóa hoặc imputation tùy cơ chế thiếu dữ liệu |
Mối quan hệ này cho thấy phương pháp xử lý không nên được lựa chọn tách rời khỏi phương pháp phân tích.
Ví dụ, standardization thường biến một biến số về dạng có trung bình xấp xỉ 0 và độ lệch chuẩn xấp xỉ 1. Phép biến đổi này có ích khi thuật toán phụ thuộc vào khoảng cách hoặc mức độ lớn của hệ số, nhưng nó không tự động làm dữ liệu “chính xác hơn”.
Tương tự, one-hot encoding phù hợp với nhiều biến phân loại không có thứ tự. Nếu mã hóa các nhãn như “đỏ, xanh, vàng” thành 1, 2, 3, một số thuật toán có thể diễn giải các con số đó như một quan hệ thứ tự hoặc khoảng cách vốn không tồn tại trong dữ liệu.
Vì vậy, quyết định xử lý cần dựa trên cơ chế mà phương pháp phân tích sử dụng dữ liệu chứ không chỉ dựa trên hình thức của dữ liệu đầu vào.
Chọn kỹ thuật theo bản chất từng vấn đề dữ liệu
Sau khi xác định nhóm phương pháp, bước tiếp theo là lựa chọn kỹ thuật cụ thể. Ở đây, điều quan trọng không phải tìm một kỹ thuật “tốt nhất” mà là xác định kỹ thuật có giả định phù hợp nhất.
Xử lý giá trị thiếu
Có ba hướng cơ bản: giữ nguyên nếu phương pháp phân tích hỗ trợ, loại quan sát hoặc biến, và ước lượng giá trị thay thế.
Thay thế bằng trung bình hoặc trung vị tương đối đơn giản nhưng làm giảm mức biến thiên của dữ liệu vì nhiều quan sát nhận cùng một giá trị. Với dữ liệu lệch hoặc có ngoại lệ, trung vị thường ít bị ảnh hưởng bởi các giá trị cực trị hơn trung bình.
Các phương pháp imputation dựa trên quan hệ giữa nhiều biến có thể bảo toàn cấu trúc dữ liệu tốt hơn, nhưng chỉ có ý nghĩa khi những biến dùng để dự đoán giá trị thiếu thực sự chứa thông tin liên quan. Một phương pháp phức tạp không thể bù đắp cho việc thiếu thông tin nền tảng.
Xử lý ngoại lệ
Không nên sử dụng một quy tắc thống kê như “nằm ngoài một khoảng nhất định thì xóa” mà không xét ngữ cảnh. Ngưỡng thống kê chỉ giúp phát hiện điểm cần kiểm tra; nó không chứng minh điểm đó sai.
Nếu ngoại lệ là lỗi đo hoặc lỗi nhập liệu, có thể sửa khi xác định được giá trị đúng hoặc loại bỏ khi không thể phục hồi. Nếu ngoại lệ là quan sát hợp lệ, lựa chọn có thể là giữ nguyên, sử dụng biến đổi giảm độ lệch hoặc chọn phương pháp phân tích robust hơn.
Chuẩn hóa thang đo
Standardization và normalization giải quyết vấn đề về thang đo, không giải quyết lỗi chất lượng dữ liệu. Chúng đặc biệt hữu ích khi thuật toán so sánh khoảng cách hoặc tối ưu dựa trên độ lớn của các đặc trưng.
Nếu biến A có giá trị hàng trăm nghìn và biến B chỉ nằm trong khoảng 0–10, khoảng cách tính trực tiếp có thể bị A chi phối dù A không quan trọng hơn về mặt phân tích. Đưa các biến về thang đo có thể so sánh giúp hạn chế hiệu ứng này.
Mã hóa biến phân loại
Cách mã hóa phải phản ánh cấu trúc của biến. Biến phân loại không thứ tự thường cần cách mã hóa không tạo ra thứ bậc giả. Với biến có thứ tự tự nhiên, mã hóa thứ bậc có thể bảo toàn thông tin đó.
Ranh giới cần lưu ý là encoding cũng có thể làm tăng mạnh số chiều dữ liệu. Một biến có hàng nghìn giá trị phân loại riêng biệt nếu one-hot encoding trực tiếp có thể tạo ra hàng nghìn đặc trưng mới, ảnh hưởng đến bộ nhớ, tốc độ và khả năng tổng quát hóa của mô hình.
Cân bằng giữa làm sạch dữ liệu và bảo toàn thông tin
Một hiểu nhầm phổ biến là càng xử lý nhiều thì dữ liệu càng tốt. Trên thực tế, mỗi phép xử lý đều tạo ra một sự đánh đổi.
Xóa các quan sát thiếu giúp tạo tập dữ liệu hoàn chỉnh nhưng làm giảm kích thước mẫu và có thể gây sai lệch nếu các quan sát bị thiếu không xuất hiện ngẫu nhiên. Imputation giữ lại kích thước mẫu nhưng đưa thêm các giá trị ước lượng vào dữ liệu.
Loại ngoại lệ có thể làm mô hình ổn định hơn nếu đó là lỗi, nhưng cũng có thể khiến mô hình không còn đại diện cho những trường hợp hiếm nhưng quan trọng. Biến đổi log có thể giảm độ lệch của những biến dương có đuôi dài, nhưng đồng thời thay đổi cách diễn giải khoảng cách giữa các giá trị.
Tương tự, giảm số chiều giúp giảm độ phức tạp nhưng có thể đánh đổi khả năng diễn giải hoặc làm mất một phần thông tin.
Vì vậy, tiêu chí đúng không phải “sau xử lý dữ liệu có sạch hơn không?” mà là ba câu hỏi:
· Phép xử lý có giải quyết một vấn đề thực sự của dữ liệu hay phương pháp phân tích không
· Phép xử lý có làm mất tín hiệu liên quan đến mục tiêu không
· Lợi ích của phép xử lý có thể được chứng minh bằng kết quả phân tích hay không
Nếu không trả lời được ba câu hỏi này, chưa có đủ cơ sở để coi thao tác xử lý là cần thiết.
Kiểm chứng phương pháp xử lý bằng thực nghiệm
Lựa chọn phương pháp xử lý không nên kết thúc ở trực giác. Khi có nhiều phương án hợp lý, cần so sánh chúng bằng một quy trình kiểm chứng nhất quán.
Với bài toán mô hình hóa, cách an toàn là giữ riêng dữ liệu dùng để đánh giá và học toàn bộ tham số xử lý chỉ từ dữ liệu huấn luyện. Điều này đặc biệt quan trọng với standardization, imputation, lựa chọn đặc trưng hoặc bất kỳ phép biến đổi nào sử dụng thông tin thống kê của dữ liệu.
Nếu tính trung bình của toàn bộ tập dữ liệu trước khi chia train/test rồi dùng trung bình đó để imputation, thông tin từ tập kiểm tra đã tham gia vào quá trình chuẩn bị dữ liệu. Hiện tượng này là một dạng data leakage và có thể khiến kết quả đánh giá lạc quan hơn khả năng thực tế.
Có thể kiểm chứng lựa chọn bằng cách xây dựng một baseline và thay đổi từng nhóm xử lý. Chẳng hạn:
1. Đánh giá mô hình với quy trình xử lý tối thiểu
2. Thêm phương pháp xử lý đang xem xét
3. Giữ nguyên cách chia dữ liệu và tiêu chí đánh giá
4. So sánh hiệu quả, độ ổn định và mức độ mất thông tin
5. Chỉ giữ thao tác tạo ra lợi ích nhất quán và có thể giải thích
Điểm cần chú ý là chỉ số đánh giá cũng phải phù hợp với mục tiêu. Accuracy có thể gây hiểu nhầm trong bài toán phân loại mất cân bằng mạnh. Sai số trung bình cũng có thể che khuất những nhóm quan sát mà mô hình hoạt động kém. Vì thế, chất lượng của phương pháp xử lý phải được đánh giá thông qua tiêu chí cuối cùng của bài toán, không chỉ qua hình dạng của dữ liệu sau biến đổi.
Cách tiếp cận này biến xử lý dữ liệu từ một chuỗi thao tác mang tính thói quen thành một quá trình kiểm định giả thuyết: vấn đề nào đang tồn tại, phép xử lý nào dự kiến giải quyết nó, và dữ liệu sau thử nghiệm có xác nhận lợi ích đó hay không.
Lựa chọn phương pháp xử lý dữ liệu phù hợp bắt đầu từ mục tiêu phân tích, sau đó mới đến trạng thái dữ liệu và yêu cầu của phương pháp phân tích. Không nên chuẩn hóa, loại ngoại lệ, imputation hay mã hóa chỉ vì đó là những bước thường gặp trong một pipeline.
Một phương pháp xử lý đáng được giữ lại khi có thể giải thích rõ vấn đề nó giải quyết, cơ chế tạo ra lợi ích, thông tin có nguy cơ bị mất và kết quả thực nghiệm cho thấy nó giúp đạt mục tiêu phân tích tốt hơn. Khi áp dụng nguyên tắc đó, xử lý dữ liệu trở thành một phần của lập luận phân tích thay vì một công đoạn kỹ thuật tách biệt.
