🍀 Bước đi đầu tiên
Chào mọi người, mình là Bò Cười Làm Data đây 🐮 Mặc dù bản thân tự tin cũng là một trong những cây bút chia sẻ năng suất và làm về nhiều nội dung về Data trong cộng đồng Data chúng ta (Q&A Shorts mỗi tuần, Thử thách Livestream lập trình 30 ngày với Python, Các bài viết chuyên đề về Thống kê, Truyện tranh về Data). Nhưng ngẫm lại mình vẫn chưa có một bài chia sẻ tất tần tật về “Lộ trình học để trở thành Data Analyst”.
Vậy nên trong bài viết này mình sẻ chia sẻ lộ trình của mình và các nguồn tự học để trở thành Data Analyst dựa trên kinh nghiệm mình đúc kết được trong suốt 6 năm đi làm.
🍀Bạn có từng mông lung khi …
Tự hỏi bản thân: Mất bao lâu? Bắt đầu từ đâu? Thứ tự trau dồi như thế nào? Tự học nguồn nào thì tốt? … để học được các 1kỹ năng, 2kiến thức, 3kinh nghiệm về nghề Data Analyst.
Khi còn “chân ướt chân ráo” bắt đầu tìm hiểu lĩnh vực Data nói chung và các ngành chuyên môn nói riêng mình thật sự cũng rất hoang mang vì:
- Các nội dung chia sẻ kinh nghiệm tại thị trường Việt Nam còn quá sơ sài.
- Các chuyên ngành Data (Data Analyst, Data Engineer, Data Science) cho vẫn đang ở thời kỳ đầu phát triển ở nước ta (nở rộ từ sau năm 2021) so với các ngành 4.0 khác như IT (hơn 20 năm từ những năm 2000).
- Chỉ gần đây thôi một số trường đại học mới đưa vào chương trình giảng dạy chính thức bài bảng, còn trước đó (và tận bây giờ vẫn còn) các trung tâm và cá nhân ra chỉ đi theo hướng giảng dạy về công cụ sử dụng (SQL, PBI, ..) thay vì cho mọi người một bức tranh toàn cảnh, lộ trình phù hợp với từng cá nhân – “Cũng khó trách vì lợi nhuận dựa trên nhu cầu số đông sẽ dễ thực hiện hơn giá trị dựa trên từng cá nhân.”
Nhưng đó là câu chuyện của 6 năm trước, thời điểm hiện tại ta đang phải đối mặt với một thách thức mới: Thông tin tràn ngập nhưng kém chất lượng và Sự cạnh tranh gay gắt giữa các ứng viên.
Thật ra mọi chuyện là hệ quả của của việc suốt 2 năm gần đây cộng đồng chúng ta đã bị “lùa gà” quá nhiều và “xuất xưởng” chung 1-roadmap công nghiệp nhưng sơ sài. Điều này dẫn tới nguồn cung nhiều nhưng quá đồng đều chất lượng nên nguồn cầu không muốn nới ra để tiếp nhận. Buồn một chỗ chính nhiều công ty SME cũng không thật sự hiểu rõ được giá trị mà anh em Data-holic chúng ta sẽ mang lại được những gì vì chính họ cũng đang bị nhiễu (“bias”) trước truyền thông.
Sẽ là kỳ vọng quá cao khi một bài viết chia sẻ của mình có thể thay đổi được thị trường. Nhưng với các nội dung hoàn toàn dựa trên kinh nghiệm suốt 6 năm đi làm ở một số công ty và tập đoàn hàng đầu trong lĩnh vực như Ecommerce, Education và Logistics cùng tìm hiểu của riêng cá nhân thì mình tin sẽ có thể cho các bạn nhiều góc nhìn để tự kiểm chứng và chọn lọc những gì thật cần thiết cho Roadmap – Lộ trình học của bản thân
Liệu 6 tháng có đủ?
🎯 Đầu tiên:
Cùng Bò Cười làm Data phân tích xem liệu 6 tháng có là đủ để trở thành một DA chính hiệu hay không (“Là DA bạn và mình chắc chắn sẽ không thích tin vào những con số thiếu căn cứ đúng chứ? 📈”) thì ta cũng ngẫm lại xem để trở thành một DA thì ta cần biết bao nhiêu kỹ năng và kiến thức từ đó tính xem tương tứng với từng kỹ năng cần bao lâu để thành thạo ở mức Junior nhé
Theo kinh nghiệm của mình thì chúng ta cần 5 kỹ năng cứng quan trọng:

Mình sẽ giải thích từng kỹ năng trên ở phần sau, trước hết chúng ta đều biết một quy tắc: “10, 000 hours to become an expert” hay “Cần 10,000 giờ luyện tập để trở thành một chuyên gia”, và để cho uy tín thì mình xin trích dẫn nguồn gốc của phát biểu này:
Quy tắc trên lần đầu được công bô từ luận văn năm 1993 của Giáo sư Anders Ericsson tại Đại học Colorado, có tên là “The Role of Deliberate Practice in the Acquisition of Expert Performance.” hay dịch ra là “Vai trò của thực hành có chủ đích trong việc đạt được trình độ chuyên môn”.
Bài luận văn này nêu bật lên công trình nghiên cứu của một nhóm các nhà tâm lý học ở Berlin, những người đã nghiên cứu thói quen luyện tập của các học sinh violin ở thời thơ ấu, tuổi vị thành niên và tuổi trưởng thành.
Tất cả đều bắt đầu chơi từ khoảng 5 tuổi với thời gian luyện tập tương tự nhau. Tuy nhiên, khi lên 8 tuổi, thời gian luyện tập bắt đầu khác nhau. Đến năm 20 tuổi, những người biểu diễn ưu tú đã có trung bình hơn 10.000 giờ luyện tập mỗi người, trong khi những người biểu diễn kém hơn chỉ luyện tập được 4.000 giờ.
Các nhà tâm lý học không thấy bất kỳ người biểu diễn tài năng thiên bẩm nào xuất hiện và điều này khiến họ ngạc nhiên. Nếu tài năng thiên bẩm đóng vai trò, thì không có gì lạ khi mong đợi những người biểu diễn tài năng xuất hiện sau, chẳng hạn, 5.000 giờ.
Anders Ericsson kết luận rằng “nhiều đặc điểm từng được cho là phản ánh tài năng bẩm sinh thực sự là kết quả của quá trình luyện tập chuyên sâu kéo dài tối thiểu 10 năm”
Note 💡
Okay, và đó là thời gian để bất kỳ ai “tự luyện tập” để trở thành chuyên gia, góc nhìn ở đây của anh em data-holic chúng ta thì chỉ cần đủ trình độ thành một Fresher để xin việc và tích lũy kinh nghiệm dần thôi nên đừng vội nản nhé 🐮
Ta sẽ làm một vài phép toán đơn giản với các dữ liệu sau:
- Với các ngành kỹ thuật nói chung và Data nói riêng thì mức độ chuyên gia hầu hết là ở vị trí Manager, đi ngược xuống ta lần lượt sẽ có Leader > Senior > Mid Senior > Junior > Fresher. Như vậy là 6 vị trí.
- Tạm thời không xét qua các yếu tố khác để lên được các cấp bậc cao hơn như “Kỹ năng Quản trị con người”, “Thăng tiến vượt bậc hoặc nhảy việc”,…
Ta có:
10,000 : 6 ≈ 1,666
Nếu cho 1 ngày học 8 tiếng và ta liên tục duy trì mỗi ngày trong suốt 6 tháng:
8 x 30 x 6 = 1,440
🚀 Vậy ta có số giờ trên thực tế và số giờ trên giả định quy tắc lệch nhau khoảng 8%. Đây là con số chấp nhận được so với những giả định của chúng ta. Chưa kể khả năng tiếp thu kiến thức của mỗi cá nhân là không đồng đều và biết đâu có nhân tố ẩn bên trong bạn thì việc trở thành một DA chính hiệu là hoàn toàn có thể 🔥
🚀 Ngoài ra trên thực tế chỉ có 20% yêu cầu kỹ năng viết trong Job Description mà ta thực sự dùng nhiều trong công việc thường ngày còn 80% là những gì giúp bạn phát triển trở thành một DA toàn năng 😇 Vậy nên nếu lấy 20% trong 80% số giờ trên để chỉ đầu tư có chiến lược học một hoặc tối đa hai kỹ năng trọng yếu thì ta sẽ có con số là:
288 hours
Điều thú vị là ta cũng có 5 kỹ năng chính và nếu lấy con số 1,440 hrs trên phân bổ đều thì tương ứng mỗi kỹ năng tối thiểu ta cần 288 hrs
Note
❗ Lưu ý đây là thời gian các bạn cần để TỰ HỌC nhen
💡 Như vậy:
Ta hoàn toàn có thể tin lộ trình học 6 tháng là khả thi nếu ta thật sự quyết tâm và nghiêm túc!
Vậy liệu KHÓA HỌC 1 KỸ NĂNG TRONG 1 THÁNG nếu chỉ học 1 buổi 3 tiếng, 1 tuần 2 buổi và 1 tháng học chỉ 24 tiếng.
Mình sẽ không đưa ra bất kỳ kết luận nào do con số trên chỉ là tương đối. Nó có thể còn ảnh hưởng bởi nhiều yếu tố như người dạy giỏi và tận tâm (tiết kiệm rất nhiều thời gian học), sự cô đọng trong nội dung, khả năng tiếp thu của mỗi bạn, bài luyện tập thêm ở nhà và vẫn quan trọng nhất là self-learning .. Ở đây mình chỉ muốn đưa ra góc nhìn kèm một con số để các bạn có một chiến lược học tập hiệu quả hơn và không bị “lùa 🐔”
Note
Học sao cho đúng?
Hurray đọc tới đây thì mình tin bạn đã thừa tự tin để tiếp tục cuộc hành trình sắp tới, yên tâm Bò Cười làm Data sẽ luôn đồng hành cùng bạn 🐮
Tuy nhiên để trả lời câu hỏi Học sao cho đúng? Nên đầu tư học gì? Có nên học sâu về nó không? Chúng ta sẽ dùng phương pháp Top-Down để trả lời, cụ thể:
- Trước tiên ta nhìn rộng ra về bức tranh toàn cảnh trong Quy trình xử lý phân tích dữ liệu & Các vai trò của DA.
- Sau đó ta vào sâu hơn Các kỹ năng cần thiết phục vụ cho từng vai trỏ của DA trong công việc thường ngày.
Quy trình Xử lý & Phân tích dữ liệu
Làm phân tích dữ liệu không phải chỉ làm cho sếp 1-cái Dashboard hoặc 1-Model phân tích là xong mà còn phải cần trình bày được giải pháp xử lý vấn đề “nhức nhói” đó dựa trên việc phân tích dữ liệu. Và khi giải pháp trên mở rộng ra từ chỉ là giải quyết một vấn đề sang để thực hiện 1-dự án thì chúng ta cần một quy trình Xử lý & Phân tích dữ liệu.
Quy trình Xử lý & Phân tích dữ liệu còn có tên tiếng Anh là
NoteData Analytics Framework
Khác với Quản trị phát triển Phần mềm, lĩnh vực Xử lý & Phân tích dữ liệu hiện không có quá nhiều Framework chuẩn và được ứng dụng phổ biến. Ở Việt Nam phần lớn các công ty xây dựng quy trình dựa trên giải pháp công nghệ áp dụng cho từng công đoạn của dự án báo cáo hoặc sản phẩm của công ty, cho nên quy trình sẽ rất khác nhau giữa các công ty vì chỉ dừng ở các công đoạn Must và lược bỏ đi các bước Should (Mình sẽ nói vấn đề này sau).
Một số tập đoàn lớn vẫn cố gắng triển khai hoặc thử áp dụng các Data Analytics Frameworks sau vốn được tinh gọn lại cho hiệu quả:
Note
- SEMMA: Sample, Explore, Modify, Model, and Assess process
- CRISP-DM: Cross-Industry Standard Process Data Mining
Tuy nhiên với các bạn Fresher mới học cần nhìn một bức tranh tổng quát để từ đó xây dựng Lộ trình tự học chi tiết thì sẽ chia sẻ Quy trình xử lý&phân tích dữ liệu sau dựa trên kinh nghiệm 6 năm đi làm và tham khảo một số tài liệu kèm theo. Framework này mình tự gọi là Waterfall vì bạn phải thực hiện các bước cuốn chiếu nhau, xong bước trên mới tới bước dưới:

Lưu ý mình muốn làm rõ là mặc dù bản thân mình đã cố gắng chọn lọc và xây dựng các công đoạn trong Framework đầy đủ và bao quát nhất có thể để giởi thiệu với các bạn Fresher nhưng đây không phải quy trình chuẩn áp dụng cho mọi bài toán và cũng chắc chắn sẽ có những biến thể khác nhau vì:
- Bước cuối của quy trình mình có thể chỉ là bước đầu của một quy trình khác.
Ví dụ:
– Việc trình bày các Insights về các yếu tố nào ảnh hưởng tới một chỉ số “xương sống” nào đó chỉ là bước đầu để xây dựng một mô hình dự đoán cho chỉ số đó trong tương lai.- Định nghĩa các công đoạn có thể khác nhau hoặc chồng chéo lên nhau giữa các doanh nghiệp
Ví dụ:
– Cả ba công đoạnData CollectionData CleaningvàData Manipulatecó thể gộp chung thành 1 quy trình tên làETL - "Extract Transfrom Load"- Nhiều doanh nghiệp dùng 1-công cụ để thực hiện toàn bộ quy trình (điều này không sai vì chính công cụ đó cũng hỗ trợ làm vậy) chỉ là khi mọi thứ all-in-one thì ranh giới giữa các bước trong quy trình sẽ mờ đi.
Ví dụ:
– Power BI: Vốn dĩ ban đầu được tạo ra cho công đoạn Data Visualization nhưng về sau nhờ sức mạnh của nền tảng Cloud Azure và khả năng linh hoạt của functional language DAX và fomular language M nên hầu như nó có thể làm được từ A-Z quy trình phân tích dữ liệu.
– Big Query & Google Studio: Nói cho đúng thì đây là hai dịch vụ khác nhau của Google nhưng vì chúng được tích hợp chung giao diện và chỉ cần 1-click là có thể chuyển đổi nên ta xem nó là 1 công cụ chỉnh thể. Bản thân BigQuery là CSDL dùng công cụ SQL để truy vấn và biến đổi, việc tích hợp trực tiếp GG Studio nên nó mở rộng thêm khả năng Visualization.
Về cơ bản thì công việc dân DA sẽ liên quan các công đoạn chính sau:
⭐ Stage 1: Requirement Specification: Mặc dù là việc dễ nhất nhưng lại là việc quan trọng nhất để tránh hậu quả “lạc đề”.
– Ta cần xác định mục tiêu của bài toán, lựa chọn giải pháp hoặc cải tiến giải pháp đã có…
⭐ Stage 2: Data Collection: Thu thập dữ liệu chiếm phần lớn thời gian trong quy trình.
– Mục tiêu của ta phải kiếm được dữ liệu liên quan và tìm cách đọc/truy xuất được chúng để tải vào các kho chứa hoặc được sử dụng trực tiếp bằng các công cụ EDA như Power BI.
📑 Common data-sources: Database, CSV, JSON, Excel, XML, Parquet, ..
📑 Common data-hub: DataLake (Best practices), Sharepoint, Database, OneLake (Power BI), …
⭐ Stage 3: Data Cleaning: Dữ liệu thì luôn có sai sót, có thể lỗi từ con người, từ hệ thống hay chính từ bản thân nó (dữ liệu thay đổi theo thời gian).
Một số kỹ thuật “Làm sạch dữ liệu”:
📑 Handling missing data (filter out/in): Xử lý dữ liệu rỗng.
📑 Transform data (remove duplicate, mapping, replace values, rename axis indexes, discretization & binning, detect outliners): Biến đổi về dạng thích hợp
📑 Cast type: Khá quan trọng vì trong nhiều trường hợp “ép” đúng kiểu dữ liệu sẽ tối ưu hiệu năng và bộ nhớ lưu trữ rất nhiều (đặc biệt với BigData).
📑 Manipulate string: Các kỹ thuật liên quan tới việc tìm pattern và searching là chính
📑 Categorize data: Đây là bước định hình để xây dựng bảng Dimension trong Datawarehouse.
⭐ Stage 4: Data Manipulation ("Data Wrangling"): Đây là công đoạn cuối trước khi ta đưa dữ liệu vào phân tích giúp định hình dữ liệu phù hợp với bài toán phân tích công đoạn tiếp theo.
Một số thao tác thường thực hiện:
📑 Reshaping data: Có rất nhiều kỹ thuật phổ biến như hierarchical indexing (Python); pivot & unipivot (SQL)
📑 Combining & Merging: một số kỹ thuật thường thấy là merge/join, concatenation/stacking
Các kỹ thuật kể trên giúp tạo bảng Fact trong Datawarehouse
⭐ Stage 5: Data Exploration ("Data Analysis"): Công đoạn này yêu cầu ta phải khai phá data để đưa ra các insights.
Để làm được việc này ngoài dựa vào statistical techniques ra chúng ta còn cần sử dụng các mảnh ghép khác như domain knowledge, visualization skills và analytical thinking
Các kỹ thuật Khai phá dữ liệu:
📑 Detect changes over time: Tìm thay đổi của xu hướng theo thời gian (tăng/giảm/ổn định/bất thường)
📑 Detect features relationship: Kiểm tra mối quan hệ giữa các biến là positive hay negative (Correlation, Heatmap, Lines chart, Scatter plot)
📑 Intersection: Xác định điểm giao nhau báo hiệu sự thay đổi giữa hai biến ngược chiều.
📑 Forecasting: Dự báo về tương lai
📑 Compare & Contrast: So sánh và đối chiếu để tìm ra các mẫu, phân loại (Behavior customer -> Loyal vs 1-time)
📑 Drill-down: “Chia để trị” hay Top-Down analysis để thấy được nhiều góc nhìn từ khái quát tới chi tiết hơn (Category – Subcategory – Product)
📑 Detect Cluster, Outlier: Tìm những observations đặc biệt
Các bài toán phân tích chính:
📑 Descriptive analytics: “Phân tích mô tả” để tìm ra pattern data
📑 Diagnostic analytics: “Phân tích chẩn đoán” để tìm ra nguyên nhân khiến một sự kiện xảy ra
📑 Predictive analytics: “Phân tích dự đoán” dựa vào dữ liệu lịch sử để đưa ra các dự báo về xu hướng và khả năng xảy ra trong tương lai
📑 Prescriptive analytics: Phân tích đề xuất dựa trên các mô hình ML để đưa ra các đề xuất hành động
⭐ Stage 6.1: Data Visualization: Đây được xem là bước thú vị nhất vì những Insights chúng ta tìm được sẽ được hiển thị sinh động bằng biểu đồ. Để làm được vậy ta cần thực hiện các bước như:
📑 Data Modeling: Nếu data không tới từ Datawarehouse hoặc Datamart thì khả năng cao bạn phải thực hiện bước chuẩn hóa theo Star schema hoặc Snowflake trước khi kéo biểu đồ
📑 Plotting: Trong một vài tình huống việc có được dạng biểu đồ mong muốn đòi hỏi ta phải tùy biến measure/calculated columns hoặc sử dụng add-on charts có trả phí.
📑 Grant permission: Cân nhắc dùng biểu đồ nào, màu sắc hay định dạng ra sao. Sau đó là việc phân quyền, RLS, region access.
⭐ Stage 6.2: Modeling & Evaluate: Đây là công đoạn nâng tầm dự án phân tích của bạn để giải quyết hai bài toán “Predictive analytics” và “Prescriptive analytic”.
– Để làm tốt được công đoạn này đòi hỏi bạn phải thực sự “thấu hiểu” dữ liệu của bạn, nói cách khác bạn phải làm tốt hai bài toán “Descriptive analytics” và “Diagnostic analytics”.- Các từ khóa để bắt đầu: Machine Learning (Regression, Clustering, Classification, Reinforcement, ..) & Deep Learning & Neural Networks
⭐ Stage 7: Communicate Insight: Đây là bước quyết định xem báo cáo của bạn sẽ .. “vào sọt rác” hay được “tôn vinh” vì nếu mọi thứ bạn làm ra nhưng người sử dụng không thấy được giá trị bạn mang lại thì vô ích 😥
Vai trò của Data Analyst
Hurray đọc tới đây thì Bò Cười tin là bạn đã hình dung khai quát được trong đầu một quy trình trọn vẹn là như thế nào rồi.
Để biết được Cần học gì? và Học làm sao? thì còn một bước nữa là ta cần phải nhóm các giai đoạn trên vào cụ thể từng vai trò của DA vì:
- Ta cần một chiến lược học tập tổng quát trước, rồi từ từ học chuyên sâu (Y như cây kỹ năng trong game vậy, phải học được các tuyệt chiêu cơ bản trước thì mới học được tuyệt kỹ bá đạo)
- Còn một lý do nữa là không phải DA nào cũng được làm tất cả đầu việc mà nhiều lúc chỉ tập trung vào một vài vai trò nhất định – Cũng là lý do từ DA lại sinh ra vị trí khác như Business Intelligent.
Định nghĩa vai trò của Data Analyst:
🎯 Là người chịu trách nhiệm 1Tổng hợp dữ liệu, 2Khai phá dữ liệu tìm insights đáng tin cậy 3trực quan hóa các insights đã tìm được và giúp 4hỗ trợ việc ra quyết định của ban lãnh đạo. Nhờ đó giúp cải thiện tình hình kinh doanh hay chất lượng sản phẩm của doanh nghiệp.
❗ Lưu ý:
- Rất nhiều các định nghĩa trên mạng kể cả những bài viết hằng trăm nghìn views lại ghi rằng DA “.. tạo ra những quyết định cải thiện tình hình cho doanh nghiệp ..”. Riêng cá nhân mình thì chỉ nhìn nhận dân DA tụi mình chỉ “hỗ trợ” thôi vì bất kỳ quyết định nào đều là từ ban lãnh đạo.
Trên thực tế đôi khi bản thân DA mắc vào một vòng xoáy phải tạo ra những insights chứng minh cho một quyết định hoặc kế hoạch nào đó của sếp. Để tránh mắc vào cạm bẫy này mình sẽ phân tích sâu hơn vào một bài viết khác
Note
- Mặc dù vai trò của DA hoàn chỉnh gồm 4 công đoạn trên nhưng đôi khi mọi thứ không rạch ròi như cách ta định nghĩa và cũng không phải lúc nào ta cũng được làm đầy đủ quy trình từ đầu tới cuối.
Vậy tóm lại thì từ 4-vai trò trên ta sẽ phân nhóm các bước trong quy trình xử lý và phân tích như sau:
- Tổng hợp dữ liệu: gồm các giai đoạn từ 1 tới 4
- Khai phá dữ liệu: Chính là toàn bộ bước 5
- Trực quan hóa dữ liệu: Tương ứng bước 6
- Hỗ trợ ra quyết định: Là bước 7
🍀 Bí kíp chinh phục
Trong phần này với mỗi vai trò mình sẽ nêu ra các kỹ năng cứng (techincal skills) và kỹ năng mềm (soft skills) cần thiết để các bạn có định hướng rõ ràng về việc Cần học gì? và Học như thế nào?
Cần học gì để Tổng hợp dữ liệu tốt?
Đây được xem là bước chiếm nhiều thời gian nhất và trong nhiều trường hợp cần phối hợp giữa các bên stakeholder liên quan để lấy những dữ liệu cần thiết hoặc đảm bảo tính nhất quán cho những dữ liệu mới sau này.
Mình hay nói vui là bước này phải có “căn” lắm mới gặp được stakeholder dễ tính. Kiểu có nhiều stakeholder phải lạy Chư Phật 10 phương 8 hướng mới thuận lợi làm việc với họ.
Đùa chứ cũng có nhiều người dễ thương cute phô mai que lắmmm.
Theo Báo cáo năm 2014 từ tở New York Times thì công việc này chiếm từ 50 – 80% tổng thời gian. Còn trong Khỏa sát bởi CrowdFlower nằm 2016 thì mất 60% thời gian làm sạch và tổ chức dữ liệu để chuẩn bị cho bước phân tích và xây dựng mô hình máy học
Note

SQL
Là một trong những ngôn ngữ phổ biến và quan trọng nhất khi tiếp cận phân tích dữ liệu. Có lẽ lý do lớn nhất để sử dụng SQL là vì hầu hết dữ liệu của các công ty trên thế giới đang nằm trong các CSDL (database). Và thậm chí không có gì bất thường nếu công ty của bạn không chỉ có một mà nhiều CSDL khác nhau (đó là chưa kể đến Cloud Databse được replicate ra nhiều region).
🎯 ĐỊNH HƯỚNG
Bản thân SQL có mặt trong hầu hết các giai đoạn của quy trình xử lý & phân tích dữ liệu nhưng một cách tổng quát có 2 công việc chính khi Tổng hợp dữ liệu:
1. Profiling data: Đây là điều đầu tiên mà mình làm khi bắt đầu với bất kỳ một bộ dữ liệu mới nào. Những điều chúng ta làm là trả lời những câu hỏi sau:
- How the data is arranged into schemas and tables? – Nhìn vào tên của các bảng để có mindset về những chủ thể chính như customers, orders .. từ đó mình liên kết lại thông tin để tạo ra một mô hình tưởng tượng (“mental model”) cách các bảng liên quan với nhau.
- What domain or domains are covered? – Thumb rules là các bảng dữ liệu luôn đại diện cho những hoạt động chính của công ty hoặc những công việc vận hành nào đó có liên quan. Vậy nên ‘profiling’ chúng ta có thể xem xét được data đó đến từ hoạt động nào? Ai là người chịu trách nhiệm tạo ra dữ liệu đó – ‘incoming data’ từ nội bộ hay bên ngoài. Nói chung mình sẽ có được kiến thức về cách mà dữ liệu được tạo ra!
- How history is represented? – Không nhiều công ty có DataWarehouse để lưu trữ các thay đổi dữ liệu vận hành của hệ thống nên việc của chúng ta là cần phải tìm xem dữ liệu những giao dịch trong quá khứ được lưu trữ như thế nào? ở đâu? và truy xuất bằng cách nào? vì lẽ tất yếu bất cứ bước phân tích nào về sau đều phải dựa trên những dữ liệu này
- How is the distributions of data? – Phạm vi phân bố trong một tập dữ liệu? Tần suất xuất hiện – dữ liệu liên tục hay phân loại? Dữ liệu có bị lệch hay không? Liệu có tồn tại các giá trị bất thường, rỗng hay có giá trị âm và dương cùng đồng thời trong một cột dữ liệu?
2. Preparing data: Bước profiling vén màng cho chúng ta thấy chỗ nào cần phải cập nhật và bổ sung để dữ liệu hữu ích khi phân tích hay ít nhất là đảm báo ta không bị chính dữ liệu “thao túng tâm lý” – bias trong dữ liệu. Còn ở bước này ta sẽ phải sắn tay áo lên để “make action”:
- Cleaning data: Có rất nhiều vấn đề liên quan tới dữ liệu và vì vậy … well có rất nhiều cách để làm sạch dữ liệu. Một số ví dụ mình có thể kể ra dưới đây kèm một số giải pháp nhỏ:
📑 Dữ liệu có nhưng không chính xác: Nếu việc sữa lỗi là bất khả thi thì đôi khi thay vì bỏ đi thì nó vẫn hữu ích nếu ta chuẩn hóa lại thành một dạng xác định và nhóm chúng lại theo một dimension nào đó để xác định lý do.
📑 Kiểu dữ liệu sai: Luôn cẩn thận khi ép kiểu nếu không muốn dữ liệu bị xén đi hoặc sai lệch, thường là từfloatsangint
📑 Gía trị null: Hãy cẩn thận xử lý vì khi tính toán giá trị AVG sẽ khác nhau tùy thuộc bạn có tính null vào không nhé.
📑 Missing data: Không phải lúc nào cũng dùng JOIN, hãy nhớ tới LEFT JOIN vì đây là công cụ kiểm tra hiệu quả nhất dữ liệu có bị thiếu hay không. - Shaping data: Đúng như cái tên, đây là công việc tái tạo lại cách mà dữ liệu thể hiện trong các cột và dòng. Hai khai niệm ta cần quan tâm là:
📑 Granularity of data: Phân cấp dữ liệu thành nhiều bảng.
📑 Flattening data: Hiểu đơn giản là thay vì cần nhiều bảng để lưu trữ thông tin thì ta gom về một bảng – Chính là cách ta tạo ra bảng Fact trong Data Warehouse. Khái niệm này cũng hay được dùng trong no-SQL khi ta trải dữ liệu ra từ file JSON
💡 Vì mỗi bảng ta truy vấn ra luôn có một hình dáng nhất định và việc shaping liên quan tới mục đích bạn cần sau bước này (BI, Visualization, Statistics, ML) nhưng tốt nhất hãy cố đảm bảo dữ liệu của bạn ít dòng nhất có thể nhưng vẫn đáp ứng mức độ chi tiết bạn cần – Việc này là cả một nghệ thuật đấy
🎯 KIẾN THỨC SQL CẦN NẮM:
- SELECT GROUP BY + Aggregation functions ▶ Xác định
frequency
- SELECT CASE WHEN hoặc GROUP BY hoặc ntitle( ) ▶ Binning data: Hữu hiệu khi làm việc với continuous values
- SELECT ORDER BY + WINDOW FUNCTIONS ▶ Categorizing data, percent_rank, offset, …
- SUB-QUERY + WINDOW FUNCTIONS ▶ Select Top Grouping
- SELECT DISTINCT ▶ Remove duplicate
- PIVOT / UNPIVOT ▶ Reshaping data
Các nguồn tài nguyên để học:
- SQL for Data Analysis – Cuốn sách định hình tư duy phân tích bằng SQL cho các bạn fresher
- Udacity; Hackerrank; Datacamp platforms – Các nền tảng online học SQL trực quan nổi tiếng.
- SQL Series – Chuỗi series về SQL của mình
- My sharing folder – Folder sưu tầm của mình
- c4uroadmap.vn – Website roadmap chi tiết lộ trình học
PYTHON
Nếu SQL là một ngôn ngữ chuyên dành cho Databse, thì Python lại là một ngôn ngữ đa mục đích có thể giải quyết nhiều bài toán hơn. Nhưng mặt trái của nó là “learning curve” sẽ dốc hơn rất nhiều cho các bạn không có background IT gặp nhiều khó khăn trong quá trình học hơn.
Chắc cũng vì nó khó nên hầu như cũng chẳng có mấy bạn influencer hay trung tâm nào quan tâm nhiều tới việc chia sẻ lộ trình học bắt đầu học Python mà chỉ qua loa hướng dẫn dùng các thư viện như NumPy hay Pandas. Cũng dễ hiểu thôi vì dạy bạn cái dễ tiếp cận thì mới kiếm được nhiều tiền chứ dạy cái khó học quá học viên nản thì lỗ rồi 😥.
Note 💡
Đó là khi bạn chưa đọc bài viết này của mình 😜 Thật ra dựa vào chính quy trình xử lý & phân tích ở trên mà mình tổng hợp cũng đã gợi ý cho bạn từng bước để các bạn có thể bắt đầu học. Trong phần này mình sẽ đi chi tiết hơn những gì các bạn nên học để cho các bạn mới bắt đầu nhanh chóng tiếp cận.
Data Collection
Đọc được dữ liệu hay thiết lập để nó có thể truy cập được là bước quan trọng đầu tiên của hầu hết các công cụ.
Khác với SQL khi bản đã là một ngôn ngữ chuẩn để dùng truy vấn dữ liệu trong công cụ quản trị CSDL bất kỳ (như SSMS, DataGrip, DBeaver, Azure Data Studio, …) thậm chí là webite interface (BigQuery, …)
Còn Python việc này có hơi phức tạp hơn một xíu khi tùy vào data source của bạn là gì và ở đâu mà ta có thể sử dụng các mô-đun có sẵn hoặc cài đặt thêm thư viện bằng trình quản lý package như pip hoặc conda, giúp cho phép ta thiết lập truy cập vào datasource đó.
📑 Một số data source thông dụng gồm:
- Sharepoints, Google drive, FTP/sFTP, ..
- Relational Database như MSSQL, MySQL, Postgres, …
- API public hoặc private
- Cloud Storage như Azure Blob hay AWS S3
- Web crawled data
🎯 ĐỊNH HƯỚNG
Khi làm một Data Analyst thì phần lớn thời gian ta sẽ làm việc với hai thư viện chính là numpy và pandas, vậy nên ở giai đoạn này các bạn chủ yếu học cách:
1. Reading and Writing Data in Text Format: pandas cung cấp công cụ mạnh mẽ để chuyển đổi bất kỳ định dạng dữ liệu văn bản khác nhau về chung một cấu trúc tabular của đối tượng DataFrame. Một số định dạng file văn bản dân DA thường gặp:
📑 Phổ biến nhất là comma-separate values (csv) files với mục đích lưu trữ các dữ liệu dạng delimited formats
Có thể bạn chưa biết chính vì trong thực tế dữ liệu rất lộn xộn nên bảng thân hàm
Note 💡pandas.read_csvcó một danh sách rất dài các tham số tùy chọn để xử lý các trường hợp file “đặc biệt” (cỡ 50 tham số và chắc vẫn sẽ còn bổ sung thêm)
📑 File JSON (Javascript Object Notation) là loại định dạng chuẩn để lưu và truyền dữ liệu giữa các trang web hoặc các ứng dụng thông qua giao thức HTTP
📑 XML và HTML là loại định dạng files để lưu trữ các dữ liệu từ các trang web bằng các kỹ thuật web scraping (crawler)
2. Binary Data Format: Dữ liệu nhị phân là dữ liệu được biểu diễn bằng chuỗi bit 0 và 1 và chỉ với 2 con số đó nó có thể diễn giải ra các loại dữ liệu khác nhau như: Số; Chữ; Hình ảnh; Âm thanh. Trên thực tế chúng tồn tại dưới các định dạng file tương ứng trong số đó một số loại phổ biến gồm:
📑 XLS và XLSR: đúng rồi đó là định dạng của Microsoft Excel Files
📑 Apache Parquet: quá nổi tiếng với dân Data Science và Data Engineer
📑 HDF5 (hierachical data format): một định dạng lưu trữ dữ liệu phân cấp, tương tự như cấu trúc thư mục trên máy tính, được sử dụng rộng rãi trong lĩnh vực khoa học máy tính và dữ liệu
3. Interacting with Web API: Rất nhiều websites có các APIs công khai để cung cấp dữ liệu thông qua định dạng JSON hoặc một vài loại định dạng khác. Bạn có thể dễ tìm kiếm các API public trên google.
4. Query in Databases: Có rất nhiều hệ quản trị CSDL được cung cấp bởi các hãng khác nhau như (MS SQL Server, PostgreSQL, MySQL, ..) được sử dụng rộng rãi. Việc quyết định lựa chọn sử dụng CSDL nào phụ thuộc vào hiệu năng, khả năng tích hợp, mở rộng và kinh phí của doanh nghiệp
🎯 KIẾN THỨC PYTHON CẦN NẮM
Chủ yếu các bạn cần học các hàm được cung cấp bởi Python hoặc từ các thư viện khác như pandas xlrd openpyxl json BeautifulSoup. Thường thì khi làm nhiều rồi ta sẽ có một bộ các hàm xây dựng sẵn của cá nhân để đụng tới việc chỉ cần copy-paste 😜 Bạn nào cần thì comment mail phía dưới mình sẽ gửi cho full-set snippet code nhen.
Data Cleaning
Đây là công đoạn đòi hỏi bạn vận dụng nhiều kỹ năng “lấp liếm” và khá là cực nhưng lại là bước giúp “rác thành vàng” – Thiệt đấy không đùa đâu, trong giới Data Analyst của mình có một câu rất là nổi “Garbage In, Garbage Out”.
🎯 ĐỊNH HƯỚNG
Một số bước gợi ý các bạn có thể làm trong stage này gồm:
1. Handling Missing Data (filter out/in): Chỗ nào thiếu thì đắp, Chỗ nào thừa thì bỏ, đây là mục tiêu chung của bước này.
📑 Có nhiều ký hiệu thể hiện dữ liệu rỗng khác nhau như: Null, Empy, NaN, #N/A, Blank … Và ta cũng có nhiều cách để xử lý như: 1Bỏ đi giá trị trống; 2Điền vào các giá trị đặc biệt; hay thậm chí 3Dùng thuật toán để tìm ra giá trị thích hợp.
2. Transform data: Rất nhiều kỹ thuật để có thể biến đổi để dữ liệu có giá trị hơn như:
📑 Remove duplicate: Không phải lúc nào ta cũng phải lấy distinct mọi thứ
📑 Mapping data: Kết nối các dữ liệu liên quan với nhau
📑 Replace values: Trong một số trường hợp cần thay thế giá trị tối nghĩa hoặc vô dụng thành các giá trị có mục đích nhất định.
📑 Rename Axis Indexes: Làm việc với DataFrame ta cần phải làm quen với Index
📑 Discretization and Binning: Đôi khi dữ liệu liên tục lại bị phân tán hoặc chia làm từng “bins” nên ta có nhiệm vụ gom nhóm chúng để phân tích.
📑 Detect and Filter Outlier: Outlier hay các giá trị ngoại lai là những giá trị khiến các kết quả thống kê sai lệch nên ngay từ bước này ta cần loại bỏ chúng
3. Cast type: Khá quan trọng vì trong nhiều trường hợp cast đúng type thì sẽ tối ưu hiệu năng và bộ nhớ lưu trữ rất nhiều (đặc biệt khi làm việc với BigData) và khác với SQL trong Python ta có rất nhiều kiểu dữ liệu khác nhau được lưu trong đối tượng dtype
4. Manipulate string: Các kỹ thuật liên quan tới việc tìm pattern và searching là chính. Ta có thể dùng kỹ thuật nâng cao như regular expressions hay các hàm xây dựng sẵn trong Python: split, strip , .. để thao tác với strings
5. Categorize data: Đây là bước xây dựng bảng Dimension trong Datawarehouse riêng trong Python ta còn có kiểu đặc biệt categorical
🎯 KIẾN THỨC PYTHON CẦN NẮM
Trên thật tế thì không có giới hạn kiến thức nào cần sử dụng cho bước này vì nó chiếm gần 80% phần cực nhất của bạn trong suốt quy trình phân tích dữ liệu. Nhưng bạn có thể dựa vào một số bước xử lý mình để xuất ở trên để làm kim chỉ nang đi sâu vào những công cụ mà Python và các thư viện cung cấp.
Một lưu ý nhỏ là hay luôn backup dữ liệu của bạn để tránh ghi đè lên những phần không mong muốn nhé
Note 💡
Data Manipulation
Hay còn được gọi là Data Wranngling là công đoạn ta định hình lại dữ liệu đã được làm sạch thành những dạng tiện lợi để phân tích bằng các công cụ như combine, join hay rearrange = pivot/unpivot.
🎯 ĐỊNH HƯỚNG
1. Hierachical Indexing: Nếu các bạn làm quen với DataFrame của pandas đủ lâu thì sẽ biết ý nghĩa của chỉ mục (index) trong DF rất quan trọng. Và khả năng của nó còn được nâng cấp khi ta có thể có nhiều cấp độ chỉ mục (index level) trên cùng 1-trục. Ý nghĩa của việc này giúp ta:
📑 Reordering and Sorting Levels: Ta có thể sắp xếp dữ liệu dựa trên từng phân cấp dữ liệu, việc này cũng giống như việc ta sorting trên tùng windows của SQL.
📑 Summary Statistics by Level: Dùng để thực hiện các phép tính thống kê tổng hợp hay aggragate trên từng cấp chỉ mục
📑 Indexing with columns: Hơi hiếm thấy nhưng có đôi lúc bạn lại cần dùng một cột nào đó trong DataFrame để lấy làm chỉ mục
2. Reshaping data: Bản thân reshape cũng có một phần của việc tạo chỉ mục phân cấp ở trên. Ngoài ra ta còn dùng các hàm như Pivot và Upivot vốn rất quên thuộc với bất kỳ ai sử dụng qua Excel
3. Combining & Merging: Không quá khó để nói về bước này vì đúng như mục đích ta cần:
📑 Merge: Nối các dòng lại với nhau dựa trên một khóa (tương tự hàm JOIN)
📑 Concat: Ghép các DataFrame với nhau (giồng hàm UNION)
📑 Combine: Đại loại là bổ sung dữ liệu trống từ DF khác dựa trên vị trí index.
🎯 KIẾN THỨC PYTHON CẦN NẮM
Những hàm cần học trong phần này thật sự không nhiều. Cái khó là khả năng suy luận logic và kinh nghiệm để định hình một bộ dữ liệu phù hợp với bài toán phân tích ta cần giải quyết mà phàm trên đời thì có rất rất nhiều vấn đề 😂 Kinh nghiệm của mình là các bạn hãy làm thật nhiều bài tập hay dự án mẫu là cách tốt nhất để vững phần này.
Các nguồn tài nguyên để học:
- 30D Challenges Python Bootcamp – Series thử thách 30 ngày học lập trình Python của mình
- Python for Data Analyst (ebook) – Cuốn sách nổi tiếng của cha đẻ thư viện pandas Wes McKinney
- My sharing folder – Folder sưu tầm của mình
- c4uroadmap.vn – Website roadmap chi tiết lộ trình học
POWER BI
Trên thực tế thì có rất nhiều BI tools có khả năng tích hợp các chức năng để prepare data nhưng cá nhân mình thấy Power BI là mạnh và nổi trội hơn cả (Chăc do sản phẩm của ông lớn).
🎯 ĐỊNH HƯỚNG
Trong Power BI có 2 phần lớn bạn cần học:
- Power Query: Hỗ trợ tất cả công cụ phổ biến trong quy trình ETL. Nếu không có sẵn bạn hoàn toàn có thể tự viết cho mình một hàm bằng ngôn ngữ M.
- Power BI: Bộ công cụ trên giao diện này giúp trực quan hoá và phân tích dữ liệu trực quan. Ngoài ra ngôn ngữ DAX rất mạnh mẽ với rất rất nhiều hàm phân tích thông kê, thao tác trên dữ liệu dễ dàng.
🎯 KIẾN THỨC PBI CẦN NẮM
Mặc dù PBI rất xịn và hỗ trợ rất nhiều công cụ cho bạn xử lý rất nhiều vấn đề trong các bài toán phân tích nhưng nếu không có một số kiến thức nền tảng thì rất dễ khiến báo cáo của các bạn nó lộn cào cào. Mình sẽ liệt kê các kiến thức bạn có thể bắt đầu học sau đây theo mức độ ưu tiên:
- Modeling data: Xây dựng một mô hình dữ liệu là điều tối quan trọng để giảm độ phức tạp của công việc phân tích và viết hàm phân tích.
- Built-in functions: PBI hỗ trợ rất nhiều công cụ hữu ích, hãy cố gắng làm quen với các công cụ có sẵn vì nó đã được xây dựng tối ưu, tránh việc tự mình viết lại những gì đã có.
- Combine functions: Cũng là ý ở trên nhưng mục tiêu là bạn cần biết cách kết hợp nhiều bước để cho ra một kết quả mong muốn. Nói thì dễ nhưng thật ra đòi hỏi kinh nghiệm rất nhiều
- DAX language: Mình ưu tiên thành thạo DAX hơn M vì bản thân Microsoft cũng tập trung nâng cấp khả năng xử lý bằng DAX hơn, hơn nữa đây là ngôn ngữ giúp bạn phân tích dữ liệu nên là người làm phân tích bạn cần biết cách dùng nó.
- M language: Nếu muốn thành master của PBI thì không thể tránh khỏi việc tự bản thân bạn lập trình bằng M language.
Trên là lộ trình học PBI nhưng các bạn có thể inbox mình vì mình dự tính tổ chức lớp học nhỏ để dạy PBI vì mình cũng có kha khá kinh nghiệm về nó (5 năm) nên mình rất sẵn sàng giúp lộ trình học của bạn nhanh hơn và hiệu quả hơn.
SOFT SKILLS
Các kỹ năng mềm trong giai đoạn này bạn cần trang bị bao gồm:
- Problem solving: Kỹ năng giải quyết vấn đề là khả năng xác định, phân tích và đưa ra giải pháp cho các vấn đề. Đây là một kỹ năng quan trọng không chỉ trong công việc mà còn trong cuộc sống, giúp chúng ta xử lý các tình huống khó khăn, thách thức và đạt được mục tiêu của mình.
- Critical thinking: Tư duy phản biện là một quá trình tư duy có hệ thống và có phương pháp để đánh giá và phân tích thông tin một cách khách quan, nhằm xác định tính hợp lý, tính chính xác và tính đáng tin cậy của thông tin đó.
- Logical thinking: Suy luận logic đóng vai trò để các kết luận của bạn có cơ sở và xác thực dựa trên việc sử dụng các lý lẽ hoặc luận cứ rõ ràng để đưa ra kết quả.
- Analytical thinking: Tư duy phân tích là kỹ năng rất quan trọng trong suốt các bước trong quy trình. Đây là khả năng bạn tổng hợp và phân tích những thông tin nhận được có thể bằng kỹ thuật hoặc phương pháp suy luận.
Có thể nói mặc dù phân loại nhiều kỹ năng mềm nhưng các kỹ năng không tồn tại độc lập mà phối hợp nhuần nhuyễn với nhau. Mình sẽ có một bài viết chi tiết khác kèm video hướng dẫn cách để rèn luyện cho các bạn sau nhé
Khai phá dữ liệu là công việc “quyến rũ” nhất
Nếu bạn hỏi 10 người nhảy việc sang ngành Phân tích dữ liệu về lý do tại sao lại chọn ngành DA thì mình tin top câu trả lời sẽ là “Được thể hiện khả năng tư duy phân tích dữ liệu”

Mình hoàn toàn đồng ý và thậm chí còn khẳng định đây là công đoạn “quyến rũ” mình nhất khi mới bắt đầu làm.
Sẽ ra sao khi bạn là một nhà khảo cổ, lần mò từng di tích cổ vật hay hóa thạch, sắp xếp chúng để trở thành một vật chứng của lịch sử. Hay trở thành một đầu bếp giữa hằng hà sa số nguyên liệu phải phối hợp để tìm ra được hương vị “umami” độc nhất của cùng một món ăn. Đây chính là lý do mình đã theo đuổi ngành DA vì công việc khai phá dữ liệu để tìm ra “insights” nó cũng nghệ thuật như vậy đấy
Trong công đoạn này bạn cần kết hợp hài hòa giữa 4 kiến thức sau:
- Domain knowledge (Fintech, Logistics, Banking, Marketing, Ecommerce, ..)
- Statistics techniques
- EDA tools (Python, Power BI)
Các bài toán phân tích phổ biến bạn có thể sẽ gặp:
- Time Series Analysis
- Cohort Analysis
- Text Analysis
- Anomaly Detection
- Experiment Analysis (A/B testing)
Cách trau dồi Kiến thức nghiệp vụ
Lời khuyên của mình là nếu bạn đang đi làm tại một lĩnh vực nào đó thì hãy tận dung học các kiến thức nghiệp vụ đó, sau đó tìm hiểu xem liệu quy trình nghiệp vụ hay có công đoạn nào đó có thể tối ưu hay không? Có chỗ nào bạn có thể khai thác thông tin dữ liệu để phân tích? Trong trường hợp bạn bị giới hạn quyền truy cập thì bạn thử chủ động đề xuất ý tưởng và mong muốn với sếp trực tiếp hoặc các bạn phòng IT xem sao, mình tin nếu bạn đủ quyết tâm và có sự chuẩn bị kỹ càng thì rồi cơ hội sẽ đến với bạn.
Còn trong trường hợp bạn đang là sinh viên thì lời khuyên của mình là bạn có thể bắt đầu tìm hiểu từ chuyên ngành bạn đang học, GPT giờ rất lợi hại các bạn chỉ cần hỏi nó Insights từ ngành nghề của các bạn cũng là bước đi đầu tiên để tìm sự liên kết giữa việc ứng dụng kỹ năng phân tích với kiến thức chuyên môn. Thật sự mình tin bất cứ ngành nghề nào cũng có các bài toán để phân tích.
Mình đang xây dựng một website để tổng hợp lại các bài toán và vấn đề cần phân tích kèm theo các bài viết chuyên sâu sắp tới. Hy vọng sẽ sớm hoàn thành chức năng này cho các bạn
(Updating)
Cách luyện tập Các kỹ thuật thống kê
Mình hay ví von nếu các công cụ phân tích là khẩu súng thì “Xác suất thống kê” chính là ống nhắm của cây súng đó vì bạn hoàn toàn có thể bắn mà không cần ống nhắm nhưng để có thể tăng độ chính xác thì bạn biết mình cần gì rồi đó.
Trong quá trình Explore data analysis (EDA), bạn cần vận dụng linh hoạt các kiến thức về thống kê sau:
- Describing data: gồm các kiến thức về Data types; Frequency distribution; Measure of central tendency (Mức độ tập trung) như mean, standard deviation; Skewness và Kurtosis
- Ý nghĩa các biểu đồ thống kê như Scatter plot, Histogram, Box plot.
- Probability concepts (Lý thuyết xác suất): Các công thức xác suất; Covariance vs Correlation
- Common probability distribution (Các phân phối xác suất phổ biến): Nổi tiếng nhất là normal distibution.
- Sampling and Estimate: Chọn mẫu và ước lượng
- Hypothesis testing: Kiểm định giả thuyết
Trong phạm vi bài viết này thì mình sẽ không đi chi tiết từng nội dung được, hẹn các bạn trong bài viết khác nhé
(Updating)
Các nguồn học khác:
Cách sử dụng BI tools để làm EDA
Trên thị trường rất nhiều BI tools và cũng không thiếu công cụ đã được tích hợp công cụ để thực hiện các công việc từ bước Thu thập cho tới Phân tích dữ liệu.
Mình cũng đánh giá rất cao khi dùng BI tools để Phân tích dữ liệu vì nó giúp bạn dê dàng tìm được những pattern đặc trưng trong các bộ dữ liệu từ đó suy luận ra insights, nhất là các bài toán phân tích về time series.
Trực quan hoá dữ liệu
Hồi còn đi học, chúng ta nhồi nhét vào đầu rất nhiều kiến thức về ngôn ngữ hay toán học,
Về mặt ngôn ngữ, ta học cách hình thành một câu hay một câu chuyện hoàn chỉnh từ những chữ cái đơn lẻ.
Còn với toán học, ta học cách sử dụng những con số.
Nhưng dường như thật lạ lẫm khi đặt chúng bên cạnh nhau: Chẳng ai dạy ta cách kể chuyện thông qua số liệu cả. Hơn nữa hiếm có ai vốn thành thạo việc này
Note 💡
Theo kinh nghiệm của mình thì mình đề xuất các bạn bắt dầu học và tìm hiểu về 2 công cụ BI phổ biến nhất bây giờ là PowerBI và Tableau. Ngoài học cách sử dụng các chức năng cơ bản và ngôn ngữ tích hợp theo công cụ, ta cần phải học thêm một số kiến thức liên quan như:
- Ý nghĩa và cách sử dụng các biểu đồ
- Cách thiết kế và xây dựng Dashboard hiệu quả
- Storytelling
Nghe có vẻ ngược đời nhưng thành bại của nghiệp vụ trực quan hóa dữ liệu lại không bắt đầu từ chính nó. Thay vào đó trước khi khăn goi1 bước vào vẽ biểu đồ hay truyền đạt dữ liệu, bạn nên bỏ ra một khoảng thời gian thấu hiểu được bối cảnh

12 loại biểu đồ phổ biến:
- Text,
- Scatterplot,
- Table,
- Line,
- Heatmap,
- Slopegraph,
- Vertical bar
- Horizontal bar
- Stacked vertical bar
- Stacked horizontal bar
- Waterfall
- Square area
Các nguồn tài nguyên để học:
- Power BI:
- Guy in Cube – Kênh Youtube trực quan cho người mới bắt đầu
- Power BI Community – Stackoverflow của DA
- Tableau:
- Alex The Analyst – Chú Alex rất nổi tiếng trong cộng đồng DA chúng ta
- Tableau official – Nguồn chính thống để học Tableau
- Data Storytelling:
- Storytelling with data – Cuốn sách kim chỉ nang cho DA
- My sharing folder – Folder sưu tầm của mình
- Hands-on series – Chuỗi bài viết mẹo dùng biểu đồ của mình
Trình bày kết quả
Dù chỉ chiếm 10% thời gian để giao tiếp và trình bày kết quả nhưng lại quyết định 90% kết quả mình làm ra thành công hay không.
Một số kỹ năng các bạn cần để “thao túng tâm lý” người nghe:
- Chọn những insights giá trị nhất và tập trung các dẫn chứng số liệu để khiến người nghe tin
- Tập trung vào người nghe, phải biết đối tượng người nghe của mình là ai (Dân kỹ thuật phải không? Nếu người nghe đại chúng thì sao? Đừng cố nhồi nhét những từ đao to búa lớn high-tech để cuối cùng chẳng ai hiểu bạn nói gì)
- Luyện tập và luyện tập, trước buổi thuyết trình hãy tập nói để hình dung trong đầu mình sẽ nói gì, phản ứng của người nghe ra sao nhưng phải luôn thoải mái nhé
Kết luận
Trên đây là Lộ trình tự học mà mình muốn chia sẻ với các bạn. Mình sẽ update thêm qua thời gian nên mọi người lâu lâu nhớ nghía qua nhen
Các kênh cộng đồng của mình
- Facebook: https://www.facebook.com/bocuoilamdata
- Youtube: https://www.youtube.com/@CarrY4U_VN
- Website: https://bocuoilamdata.com/
© Bản quyền thuộc về CarrY4U và Bò Cười Làm Data
© Copyright by CarrY4U and bocuoilamdata – Do not reup


Cho em xin full-set snippet code với ạ
Em cho anh xin email hoặc nhắn cho anh tren fanpage hen
Cho em xin set snippet code với ạ <3 email e là: sonak2002003@gmail.com. Em cảm ơn vì những chia sẻ rất thú vị và mang lại rất nhiều giá trị cho em ạ.