Trang Chủ Tin Tức Bài Viết

Chuẩn Bị Dữ Liệu Trước Khi Triển Khai AI | Mahaton

Loc Tan Huynh
Sáu loại dữ liệu cần gom trước khi triển khai AI, cách làm sạch và chuẩn hoá, cùng bài kiểm tra nhanh xem doanh nghiệp đã sẵn sàng hay chưa.
August 29, 2026

Mahaton Project là đơn vị chuyên cung cấp giải pháp Digital Marketing toàn diện cho doanh nghiệp tại Việt Nam, trực thuộc hệ thống Công ty TNHH Minh Phát với hơn 30 năm kinh nghiệm trong ngành sản xuất và thương mại.

Chúng tôi giúp khách hàng:

Tăng trưởng lợi nhuận và mở rộng tệp khách hàng

Cắt giảm đến 60% chi phí nhân sự vận hành

Tiết kiệm thời gian quản lý gấp 5 lần

Cung cấp cho ban lãnh đạo bảng điều khiển trực quan để đo lường hiệu quả thời gian thực

Tất cả thông qua ba trụ cột dịch vụ:

Thiết kế website chuyên nghiệp, chuẩn SEO

Quảng cáo Google/YouTube hiệu suất cao

Ứng dụng trí tuệ nhân tạo (AI) trong vận hành kinh doanh

Với kinh nghiệm phục vụ hơn 10 đối tác trong các lĩnh vực đa dạng — từ hãng hàng không quốc tế (American Airlines), chuỗi F&B (Panda Express, China Queen), bán lẻ (Co.op Mart), truyền thông (HTV1), viễn thông (Viettel), đến các doanh nghiệp sản xuất Việt Nam (TAKI Elevator, Minh Phát EPS, Tấn Đại Bao Bì, Nam Phát Tôn) — chúng tôi hiểu rõ nhu cầu thị trường và cam kết mang đến giải pháp tạo tăng trưởng thực sự cho từng khách hàng.

Điểm chính

  • Phần lớn dự án AI ở doanh nghiệp nhỏ hỏng vì dữ liệu, không phải vì công nghệ. Đây là khâu quyết định nhưng hay bị bỏ qua.
  • Dữ liệu quan trọng nhất của doanh nghiệp Việt thường nằm trong đầu nhân viên và trong tin nhắn, không nằm trong phần mềm nào.
  • Không cần dữ liệu hoàn hảo. Cần dữ liệu đúng, nhất quán, và có một người chịu trách nhiệm cập nhật.
  • Bài kiểm tra mười phút ở cuối bài cho biết doanh nghiệp nên triển khai ngay hay cần dọn dẹp trước.

Vì sao đây là khâu quyết định

Có một hiểu nhầm phổ biến: rằng công nghệ càng hiện đại thì càng bù được cho dữ liệu lộn xộn. Thực tế ngược lại. Một hệ thống mạnh đọc dữ liệu sai sẽ đưa ra câu trả lời sai một cách rất thuyết phục — và đó là tình huống nguy hiểm hơn nhiều so với việc nó không trả lời được.

Ví dụ cụ thể hay gặp: doanh nghiệp lắp trợ lý trả lời khách trên website. Bảng giá được lấy từ một tệp lưu năm ngoái, vì đó là tệp duy nhất tìm thấy. Hệ thống chạy tốt về mặt kỹ thuật và báo giá sai cho khách suốt ba tuần trước khi có người phát hiện.

Không có lỗi kỹ thuật nào ở đây. Lỗi nằm ở chỗ không ai hỏi: dữ liệu này lấy từ đâu, ai cập nhật, cập nhật lần cuối khi nào.

Đây là lý do gốc phía sau phần lớn các thất bại được liệt kê ở bài vì sao dự án AI thất bại ở SME Việt.

Sáu loại dữ liệu cần gom

Không cần gom tất cả mọi thứ. Cần đúng sáu nhóm dưới đây, và chỉ phần liên quan tới việc định tự động hoá.

1. Danh mục sản phẩm hoặc dịch vụ

Tên gọi chính thức, mã, quy cách, đơn vị tính, tình trạng còn bán hay đã ngừng. Vấn đề thường gặp ở doanh nghiệp Việt: một sản phẩm có ba tên — tên trên hoá đơn, tên nhân viên gọi, tên khách quen gọi. Cả ba đều phải được ghi nhận, với một tên là chuẩn.

2. Giá và chính sách giá

Giá niêm yết, mức chiết khấu theo số lượng, điều kiện áp dụng, ngày hiệu lực. Đây là dữ liệu nhạy cảm nhất về độ chính xác — sai ở đây là mất tiền hoặc mất uy tín ngay.

3. Câu hỏi thường gặp và câu trả lời chuẩn

Nguồn tốt nhất không phải trí nhớ mà là lịch sử tin nhắn thật với khách hàng. Đọc lại hai trăm cuộc gần nhất, gom thành nhóm, viết ra câu trả lời chuẩn cho mỗi nhóm.

4. Quy trình xử lý

Khi khách hỏi X thì làm gì, ai duyệt, mất bao lâu. Phần lớn doanh nghiệp nhỏ chưa bao giờ viết cái này ra giấy — và đó chính là lý do mỗi nhân viên làm một kiểu.

5. Thông tin khách hàng

Lịch sử mua, điều khoản riêng, người liên hệ. Phần này kéo theo trách nhiệm bảo vệ dữ liệu cá nhân, xem bài rủi ro bảo mật dữ liệu khi triển khai AI trước khi đưa vào bất kỳ hệ thống nào.

6. Ranh giới — những gì hệ thống KHÔNG được tự quyết

Đây là loại dữ liệu bị quên nhiều nhất và quan trọng không kém năm loại trên. Ví dụ: không tự chốt đơn trên một giá trị nhất định, không cam kết thời gian giao, không hứa điều khoản thanh toán. Viết ra thành danh sách rõ ràng.

Dữ liệu quan trọng nhất của một doanh nghiệp Việt thường không nằm trong phần mềm nào. Nó nằm trong đầu người làm lâu năm nhất — và đó là lý do khâu này tốn công hơn mọi phần kỹ thuật.

Vấn đề khó nhất: tri thức nằm trong đầu người

Ở doanh nghiệp vừa và nhỏ, phần lớn hiểu biết vận hành chưa bao giờ được viết xuống. Người bán hàng lâu năm biết khách nào trả chậm được, đơn nào nên ưu tiên, trường hợp nào phải hỏi sếp. Không có tài liệu nào ghi những điều đó.

Không thể tự động hoá thứ chưa được viết ra. Ba cách rút tri thức đó ra, theo thứ tự hiệu quả:

  1. Ngồi cạnh quan sát nửa ngày. Ghi lại mọi quyết định và lý do. Cách này cho kết quả tốt nhất vì người ta thường không nhớ hết quy tắc mình đang dùng, nhưng làm thì đúng.
  2. Đọc lại lịch sử tin nhắn. Mỗi lần nhân viên phá lệ là một quy tắc chưa được ghi nhận.
  3. Hỏi trực tiếp bằng tình huống cụ thể, không hỏi chung. "Quy trình của anh là gì" sẽ nhận được câu trả lời lý thuyết. "Hôm qua khách A hỏi giảm giá, anh xử lý sao và vì sao" sẽ nhận được sự thật.

Một lưu ý về con người: nhân viên có thể ngần ngại chia sẻ, vì lo rằng viết hết ra thì mình bị thay thế. Cách xử lý trung thực là nói rõ ngay từ đầu hệ thống sẽ gánh phần lặp lại nào, và phần nào vẫn cần họ. Giấu ý định là cách nhanh nhất để nhận được thông tin không đầy đủ.

Làm sạch nghĩa là làm gì

Bốn việc, theo thứ tự:

  1. Thống nhất cách gọi tên. Một sản phẩm, một tên chuẩn, kèm danh sách các tên gọi khác. Đây là việc tốn công nhất và cũng có tác động lớn nhất.
  2. Loại bản trùng và bản cũ. Nếu có ba tệp bảng giá, xác định đúng một bản là bản chính thức. Đổi tên các bản còn lại cho không ai nhầm được nữa.
  3. Gắn ngày và nguồn. Mỗi tập dữ liệu phải trả lời được: ai chịu trách nhiệm, cập nhật lần cuối khi nào. Không có hai thông tin này thì không nên đưa vào hệ thống.
  4. Đánh dấu phần không chắc chắn. Thà ghi rõ "chưa xác nhận" còn hơn để hệ thống tưởng đó là sự thật.

Cần nói rõ để tránh cầu toàn: không cần dữ liệu hoàn hảo mới bắt đầu được. Cần dữ liệu đúng trong phạm vi định dùng. Nếu chỉ tự động hoá phần trả lời câu hỏi kỹ thuật, không cần dọn dữ liệu công nợ.

Ai giữ dữ liệu đúng theo thời gian

Đây là phần quyết định dự án sống được bao lâu, và gần như luôn bị bỏ qua trong hợp đồng.

Dữ liệu doanh nghiệp thay đổi liên tục: giá đổi, sản phẩm ngừng bán, chính sách đổi. Nếu không có cơ chế cập nhật, hệ thống trôi khỏi thực tế trong vài tháng và trở thành nguồn thông tin sai.

Tối thiểu cần ba thứ:

Bài kiểm tra mười phút

Trả lời sáu câu sau. Mỗi câu trả lời được ngay và bằng tài liệu, không phải bằng trí nhớ, tính một điểm.

  1. Bảng giá mới nhất nằm ở đâu, ai cập nhật lần cuối và khi nào?
  2. Có danh sách sản phẩm còn bán, tách khỏi sản phẩm đã ngừng, ở một chỗ duy nhất không?
  3. Mười câu khách hỏi nhiều nhất đã được viết ra kèm câu trả lời chuẩn chưa?
  4. Quy trình xử lý một yêu cầu báo giá đã được viết thành các bước chưa?
  5. Có danh sách rõ ràng những gì hệ thống không được tự quyết chưa?
  6. Với mỗi nhóm dữ liệu, có nêu được tên một người chịu trách nhiệm không?

Cách đọc kết quả:

Điểm thấp không phải tin xấu. Nó cho biết chính xác nên tiêu tiền vào đâu trước — và tiết kiệm được khoản đầu tư vào một hệ thống chưa có gì để đọc. Thứ tự ưu tiên tổng thể nằm ở bài lộ trình chuyển đổi số 12 tháng, và cách tính chi phí nằm ở bài chi phí triển khai AI.

Bước tiếp theo

Nếu doanh nghiệp anh chị chấm dưới ba điểm, khoản đầu tư đúng lúc này không phải công nghệ mà là hai tuần dọn dữ liệu. Mahaton nhận rà soát mức sẵn sàng dữ liệu trước khi bàn tới bất kỳ hệ thống nào — liên hệ qua Zalo hoặc lochuynh@mahatonproject.com.

Về tác giả

Lộc Tấn Huynh là người sáng lập Mahaton Project — agency digital B2B đã triển khai hàng trăm dự án website, Google Ads và AI cho doanh nghiệp Việt, trong đó có Minh Phát EPS, TAKI Elevator và Viettel. Nguyên tắc làm việc của Mahaton không đổi qua từng dự án: mọi đồng ngân sách marketing đều phải truy ngược được về một kết quả kinh doanh đo đếm được.