Sự hợp tác giữa FPT và Nvidia vừa mang lại một cột mốc ý nghĩa cho cộng đồng công nghệ trong nước khi bộ dữ liệu “Nemotron-Personas-Vietnam” chính thức được phát hành trên Hugging Face. Chỉ sau 5 ngày xuất hiện trên nền tảng chia sẻ mã nguồn mở toàn cầu này, dự án đã nhanh chóng lọt vào danh sách 10 bộ dữ liệu thịnh hành nhất. Đây là nguồn tài nguyên chất lượng cao hỗ trợ các nhà phát triển tối ưu hóa, tinh chỉnh và huấn luyện các mô hình trí tuệ nhân tạo (AI) dành riêng cho người Việt.

Bộ dữ liệu chứa khoảng 900.000 “hồ sơ nhân vật” (persona) giả định với tổng dung lượng lên đến 118 triệu token. Dù được tạo ra hoàn toàn bởi hệ thống AI, các nhân vật này không hề xa rời thực tế mà được xây dựng dựa trên phương pháp phân bố thống kê và các quy trình xác thực nghiêm ngặt, phản ánh chân thực bức tranh kinh tế – xã hội tại Việt Nam. Mỗi hồ sơ được mô tả chi tiết thông qua nhiều khía cạnh đa chiều như họ tên, độ tuổi, giới tính, quê quán, trình độ học vấn, tình trạng hôn nhân, nghề nghiệp, thu nhập cho đến các sở thích cá nhân về ẩm thực, du lịch, thể thao, nghệ thuật và mục tiêu nghề nghiệp. Cấu trúc thông tin đa dạng này cho phép các nhà phát triển dễ dàng phân loại, lọc dữ liệu và xây dựng những kịch bản tương tác sát với thực tế của từng nhóm người dùng và lĩnh vực cụ thể.
Sự ra đời của Nemotron-Personas-Vietnam giải quyết một rào cản lớn trong việc phát triển AI nội địa. Hiện nay, hầu hết các mô hình AI lớn trên thế giới đều được huấn luyện chủ yếu bằng dữ liệu tiếng Anh và mang đậm bối cảnh phương Tây. Do đó, chúng thường gặp khó khăn trong việc thấu hiểu sâu sắc các đặc trưng ngôn ngữ, văn hóa vùng miền và thói quen giao tiếp của người Việt Nam. Việc bổ sung nguồn dữ liệu bản địa phong phú này sẽ giúp giảm thiểu các thiên lệch văn hóa trong quá trình huấn luyện, từ đó tạo ra những ứng dụng AI thông minh, tự nhiên và thực tế hơn với nhu cầu xã hội.
Theo chia sẻ từ PGS. TS Ngô Xuân Bách, Giám đốc khối sản phẩm AI tại FPT Smart Cloud, một hệ thống “AI có chủ quyền” thực sự phải được xây dựng từ gốc rễ dựa trên chính ngôn ngữ, văn hóa và nền tảng kinh tế của địa phương đó. Bộ dữ liệu này chính là công cụ đắc lực giúp các kỹ sư công nghệ tiếp cận tài nguyên cần thiết để kiến tạo các giải pháp AI đặc thù cho thị trường Việt Nam và xa hơn là mở rộng ra tầm khu vực.
Dự án được triển khai dựa trên phương pháp xây dựng hồ sơ giả lập Nemotron-Personas tiên tiến của Nvidia – công nghệ đã được áp dụng thành công tại Mỹ với 6 triệu bản ghi và Hàn Quốc với 7 triệu bản ghi. FPT đã tiếp thu phương pháp này, kết hợp cùng sự am hiểu văn hóa sâu sắc, năng lực hạ tầng dữ liệu và công nghệ AI để hoàn thiện bộ dữ liệu bản địa hóa. Hiện tại, Nemotron-Personas-Vietnam được chia sẻ miễn phí cho cả mục đích thương mại lẫn phi thương mại, với yêu cầu duy nhất là người sử dụng phải ghi nhận nguồn đầy đủ.