66B là một mô hình ngôn ngữ lớn với khoảng 66 tỷ tham số, được thiết kế để hỗ trợ xử lý ngôn ngữ tự nhiên với hiệu suất cao và khả năng tổng hợp thông tin.
Kiến trúc của 66B dựa trên biến thể của Transformer, với nhiều lớp chú ý tự trọng (self attention) và mạng feed forward, cho phép xử lý ngôn ngữ ở quy mô lớn và tối ưu hoá cho dữ liệu dồi dào.
66B có khả năng trả lời câu hỏi, tóm tắt văn bản, viết sáng tạo, và hỗ trợ các tác vụ có ngôn ngữ tự nhiên như dịch thuật, phân tích cảm xúc, và đối thoại.
Để đạt được hiệu suất, 66B được huấn luyện trên tập dữ liệu đa dạng, bao gồm văn bản tiếng nói và văn bản viết, từ nhiều nguồn và ngôn ngữ. Quá trình huấn luyện dùng phương pháp tối ưu hoá phân tán và đánh giá liên tục.
Mặc dù 66B mạnh về nhiều tác vụ, nó vẫn gặp giới hạn như hiểu ngữ cảnh dài, rủi ro sai lệch dữ liệu và cần quản trị lỗi, cũng như nhu cầu tính toán lớn.
Trong tương lai, các phiên bản 66B có thể tích hợp tốt hơn với hệ thống tương tác người dùng, cải thiện an toàn, tiết kiệm năng lượng và mở rộng khả năng đa ngôn ngữ.
