Theo dõi để nhận Thông báo việc làm mới nhất từ Công ty cổ phần Công nghệ Sapo
Tổng quan
Mô tả công việc
Xây dựng & vận hành Data Pipeline
- Xây dựng, vận hành và tối ưu các Data Pipeline thu thập dữ liệu từ nhiều nguồn như SQL Server, PostgreSQL, MySQL vào hệ thống Data Lakehouse.
- Thiết kế, phát triển và quản lý workflow/DAG trên Airflow, đảm bảo pipeline hoạt động ổn định, chính xác và hiệu quả.
- Xử lý và quản lý dữ liệu xuyên suốt các tầng Raw → Cleansed → Aggregated, đáp ứng nhu cầu khai thác dữ liệu của các phòng ban.
- Tối ưu hiệu năng lưu trữ và truy vấn dữ liệu trên các nền tảng như Dremio và ClickHouse.
- Theo dõi chất lượng dữ liệu, xây dựng cơ chế kiểm tra, cảnh báo và chủ động xử lý các sự cố liên quan đến Data Pipeline.
- Xây dựng và cập nhật các tài liệu kỹ thuật như Data Dictionary, Runbook và tài liệu vận hành nhằm đảm bảo khả năng kế thừa và mở rộng hệ thống.
Bảo mật & vận hành hạ tầng dữ liệu
- Tham gia xây dựng và triển khai cơ chế phân quyền truy cập dữ liệu theo nguyên tắc Least Privilege trên các nền tảng Lakehouse, Dremio, ClickHouse và Power BI.
- Đảm bảo an toàn cho dữ liệu nhạy cảm thông qua các giải pháp như masking, mã hóa và quản lý thông tin bảo mật (secret) theo tiêu chuẩn, hạn chế hardcode trong hệ thống.
- Phối hợp cùng đội ngũ trong việc vận hành và giám sát hạ tầng dữ liệu: dung lượng lưu trữ, tài nguyên xử lý, hiệu năng các Data Job và hệ thống log.
- Tham gia xây dựng và thực hiện các quy trình backup, retention, restore và quản lý log phục vụ nhu cầu kiểm toán và vận hành hệ thống.
Phát triển dữ liệu phục vụ Business & báo cáo
- Xây dựng và duy trì các báo cáo Power BI ở mức cơ bản, bao gồm Data Model, DAX Measure và các hình thức trực quan hóa dữ liệu phổ biến.
- Làm việc trực tiếp với các bộ phận Kinh doanh, Vận hành, Tài chính và Sản phẩm để phân tích nhu cầu, làm rõ bài toán dữ liệu và chuẩn hóa định nghĩa các chỉ số quan trọng.
- Xây dựng và cung cấp các Data Set đáng tin cậy, phục vụ hoạt động phân tích và ra quyết định của doanh nghiệp.
- Đóng vai trò kết nối giữa hệ thống dữ liệu và nhu cầu thực tế của Business, đảm bảo dữ liệu được khai thác đúng mục đích và mang lại giá trị thực tiễn.
Ứng dụng AI trong khai thác dữ liệu
- Nghiên cứu và ứng dụng các công cụ AI/LLM nhằm nâng cao hiệu quả trong quá trình phân tích và xử lý dữ liệu.
- Ứng dụng LLM để hỗ trợ sinh và kiểm tra SQL, xử lý dữ liệu phi cấu trúc như ticket hoặc phản hồi khách hàng.
- Tham gia xây dựng các công cụ AI đơn giản, hỗ trợ các phòng ban khai thác thông tin và giải đáp những câu hỏi phổ biến dựa trên dữ liệu.
- Đảm bảo các kết quả được kiểm tra và xác thực trước khi sử dụng trong báo cáo hoặc phục vụ hoạt động ra quyết định.
- Tuân thủ các quy định về bảo mật dữ liệu, đặc biệt đối với việc sử dụng dữ liệu nhạy cảm trên các công cụ và nền tảng AI bên ngoài.
Yêu cầu ứng viên
- Có từ 2–4 năm kinh nghiệm Data Engineer, từng trực tiếp xây dựng và vận hành Data Pipeline trong môi trường Production.
- Thành thạo SQL và Python cho xử lý dữ liệu; có kinh nghiệm với Pandas/PySpark và tối ưu truy vấn.
- Có kinh nghiệm tự xây dựng, quản lý và vận hành DAG trên Airflow.
- Làm việc được với ít nhất 2 trong các hệ quản trị cơ sở dữ liệu: SQL Server, PostgreSQL, MySQL; hiểu về Incremental Extract hoặc CDC.
- Có kinh nghiệm hoặc kiến thức vận hành hệ sinh thái Hadoop (HDFS, Hive, Spark) và các nền tảng xử lý/truy vấn dữ liệu như ClickHouse, Dremio hoặc tương đương.
- Có khả năng xây dựng báo cáo cơ bản trên Power BI, bao gồm Data Model, DAX, Publish và Refresh.
- Có kiến thức cơ bản về bảo mật và vận hành hệ thống: phân quyền, quản lý Secret, xử lý dữ liệu nhạy cảm, Linux và đọc Log.
- Đã ứng dụng LLM/AI vào công việc và có khả năng kiểm chứng kết quả; thành thạo Git và quy trình Branch/PR.
Kỹ năng & tư duy
- Có tư duy hướng Business, chủ động tìm hiểu mục đích và giá trị của dữ liệu trước khi xây dựng giải pháp.
- Có tinh thần chủ động, trách nhiệm và theo sát công việc đến khi hoàn thành.
- Có thói quen xây dựng tài liệu, chia sẻ kiến thức và đảm bảo công việc có thể được bàn giao hiệu quả.
Ưu Tiên:
- Có kinh nghiệm về Cloudera CDP/CDH, Ranger, Data Modeling, dbt,Docker/Kubernetes, CI/CD
- Từng có kinh nghiệm làm việc trong lĩnh vực E-commerce, Retail hoặc SaaS.
- Có kiến thức về Data Security, AI/LLM (RAG, Text-to-SQL, LangChain, n8n), Machine Learning
- Khả năng đọc hiểu tài liệu tiếng Anh là một lợi thế.
Quyền lợi ứng viên
- Thu nhập cạnh tranh, được xem xét và đánh giá định kỳ dựa trên năng lực và hiệu quả công việc.
- Hưởng đầy đủ các chế độ, chính sách và phúc lợi theo quy định của Công ty và pháp luật.
Trực tiếp làm việc và phát triển trên hệ thống dữ liệu quy mô thực tế, với khối lượng dữ liệu và bài toán nghiệp vụ đa dạng. - Có cơ hội tham gia sâu vào quá trình xây dựng, vận hành và cải tiến hệ thống Data Lakehouse, không chỉ thực hiện các tác vụ xử lý dữ liệu đơn lẻ.
- Được chủ động đề xuất, thử nghiệm và triển khai các giải pháp công nghệ phù hợp với bài toán thực tế.
- Có ngân sách và cơ hội tham gia các khóa đào tạo, chứng chỉ hoặc hội thảo chuyên môn nhằm nâng cao năng lực.
- Làm việc trực tiếp với các Business Stakeholder từ nhiều phòng ban, phát triển chuyên môn về dữ liệu và hiểu sâu hơn về cách một doanh nghiệp công nghệ vận hành và đưa ra quyết định dựa trên dữ liệu.
Địa điểm và thời gian
Địa điểm làm việc
- Hà Nội: Tầng 6, tòa nhà Ladeco, 266 Đội Cấn, Phường Ngọc Hà (quận Ba Đình cũ)
Thời gian làm việc
- Thứ 2 - Thứ 6 (từ 08:00 đến 17:30)
Cách thức ứng tuyển
- Ứng viên nộp hồ sơ trực tuyến bằng cách bấm Ứng tuyển ngay dưới đây.
Hạn ứng tuyển: 09/10/2026
