66B là một mô hình ngôn ngữ gồm khoảng 66 tỷ tham số, được thiết kế để cân bằng giữa hiệu suất và hiệu quả tính toán. Mục tiêu của 66B là cung cấp khả năng hiểu và sinh văn bản tự nhiên ở mức độ linh hoạt cao, đồng thời tối ưu chi phí huấn luyện và inference.
Kiến trúc dựa trên transformer với nhiều lớp self-attention và mạng chuyên sâu feed-forward. Mô hình có cơ chế chuẩn hóa và tối ưu hóa như layer normalization, để ổn định quá trình huấn luyện và tăng khả năng khái quát trên nhiều ngôn ngữ và nhiệm vụ.
66B được huấn luyện trên tập dữ liệu đa ngôn ngữ lớn, kết hợp dữ liệu công khai và dữ liệu cấp phép để học được kiến thức rộng và khả năng làm theo hướng dẫn. Quá trình fine-tuning có thể bao gồm instruction tuning và RLHF nhằm cải thiện tính an toàn và tính tương thích với người dùng.
Với kích thước và khả năng hiểu ngôn ngữ, 66B có thể hỗ trợ viết nội dung, trợ giúp lập trình, phân tích dữ liệu, và hỗ trợ dịch thuật. Nó có thể được tích hợp vào các hệ thống tổng hợp tự động, chatbot thông minh và nền tảng giáo dục để tăng cường trải nghiệm người dùng.
Việc vận hành mô hình quy mô lớn đặt ra các vấn đề về an toàn, riêng tư, và công bằng. Việc đánh giá rủi ro, quản trị dữ liệu và thiết kế cơ chế kiểm soát nội dung là cần thiết để giảm thiểu rủi ro khi áp dụng 66B vào thực tế.