09/06/2026
NVIDIA VÀ FPT CÔNG BỐ BỘ DỮ LIỆU 900.000 "NGƯỜI VIỆT ẢO" PHỤC VỤ PHÁT TRIỂN AI
Nvidia và FPT vừa công bố một trong những bộ dữ liệu AI lớn nhất từng được xây dựng dành riêng cho Việt Nam, gồm 900.000 hồ sơ nhân khẩu học tổng hợp (synthetic personas) nhằm giúp các mô hình trí tuệ nhân tạo hiểu rõ hơn về ngôn ngữ, văn hóa và đặc điểm xã hội của người Việt.
Bộ dữ liệu mang tên Nemotron-Personas-Vietnam được phát hành ngày 5/6 trên nền tảng Hugging Face theo giấy phép CC-BY-4.0, cho phép bất kỳ cá nhân, doanh nghiệp hay tổ chức nào sử dụng miễn phí, kể cả cho mục đích thương mại.
Điểm đáng chú ý là đây không phải dữ liệu thu thập từ người thật. Toàn bộ 900.000 hồ sơ được tạo ra bằng thuật toán để mô phỏng các đặc điểm dân số ngoài đời thực, qua đó giúp các nhà phát triển AI có thể huấn luyện mô hình mà không phải đối mặt với những rủi ro liên quan đến quyền riêng tư hay dữ liệu cá nhân.
Mỗi hồ sơ bao gồm 31 trường thông tin, phản ánh nhiều khía cạnh của xã hội Việt Nam như nhân khẩu học, phân bố địa lý, đặc điểm nghề nghiệp và sự đa dạng ngôn ngữ. Bộ dữ liệu cũng tương thích với nền tảng NeMo của Nvidia, bộ công cụ được sử dụng để phát triển và tùy chỉnh các mô hình AI thế hệ mới.
Trong dự án này, FPT đóng vai trò cung cấp chuyên môn địa phương nhằm bảo đảm các hồ sơ được xây dựng sát với thực tế văn hóa, xã hội và ngôn ngữ Việt Nam. Hiện FPT cũng là đối tác ưu tiên của Nvidia trong nhiều dự án AI tại Việt Nam và Nhật Bản.
Nemotron-Personas-Vietnam là một phần trong sáng kiến
Nemotron-Personas toàn cầu của Nvidia. Trước Việt Nam, công ty đã phát triển các bộ dữ liệu tương tự cho Mỹ, Singapore và Hàn Quốc. Việc công bố bộ dữ liệu mới diễn ra cùng thời điểm với các sự kiện công nghệ lớn của châu Á như Nvidia GTC Taipei và Computex 2026.
Nvidia hiện đang mở rộng đáng kể sự hiện diện trong lĩnh vực AI tại Việt Nam. Bên cạnh FPT, Viettel cũng đang hợp tác với hãng công nghệ Mỹ để phát triển các ứng dụng AI quy mô quốc gia trên hạ tầng của Nvidia.
Việc phát hành miễn phí bộ dữ liệu này được xem là một bước tiến quan trọng đối với hệ sinh thái AI Việt Nam. Các startup, trường đại học, viện nghiên cứu và doanh nghiệp công nghệ giờ đây có thể tiếp cận nguồn dữ liệu lớn để phát triển các mô hình AI mang tính bản địa hóa cao mà không phải trả chi phí bản quyền.
Trong bối cảnh các quy định về bảo vệ dữ liệu cá nhân ngày càng chặt chẽ trên toàn cầu, dữ liệu tổng hợp cũng đang trở thành xu hướng mới của ngành AI khi cho phép huấn luyện mô hình mà không cần sử dụng thông tin của người dùng thực.
Với Nemotron-Personas-Vietnam, Nvidia và FPT không chỉ công bố một bộ dữ liệu mới mà còn đang góp phần đặt nền móng cho tham vọng xây dựng hệ sinh thái AI "Made for Vietnam" trong những năm tới.
Cre: Read about Vietnam