databricks/databricks-dolly-15k
task_categories:trả lời câu hỏi, task_categories:tóm tắt, ngôn ngữ:en, giấy phép:cc-by-sa-3.0
README
Tóm tắt
databricks-dolly-15k là một tập dữ liệu nguồn mở gồm các bản ghi tuân theo hướng dẫn được tạo bởi hàng nghìn nhân viên Databricks trong một số danh mục hành vi được nêu trong phần Hướng dẫnGPT bài viết, bao gồm động não, phân loại, QA đóng, tạo, trích xuất thông tin, QA mở và tóm tắt.
Bộ dữ liệu này có thể được sử dụng cho bất kỳ mục đích nào, dù là học thuật hay thương mại, theo các điều khoản của Creative Commons Ghi công-Chia sẻ tương tự 3.0 Giấy phép chưa chuyển đổi.
Nhiệm vụ được hỗ trợ:
- Đào tạo LLM
- Tạo dữ liệu tổng hợp
- Tăng cường dữ liệu
Ngôn ngữ: Phiên bản tiếng Anh: 1.0
Chủ sở hữu: Databricks, Inc.
Tổng quan về tập dữ liệu
databricks-dolly-15k là một tập hợp gồm hơn 15.000 bản ghi được tạo bởi hàng nghìn nhân viên của Databricks để cho phép các mô hình ngôn ngữ lớn thể hiện khả năng tương tác kỳ diệu của ChatGPT. Nhân viên của Databricks đã được mời tạo các cặp lời nhắc/phản hồi trong mỗi nhóm trong số tám danh mục hướng dẫn khác nhau, bao gồm bảy danh mục được nêu trong bài báo InstructGPT, cũng như một danh mục dạng tự do có kết thúc mở. Những người đóng góp được hướng dẫn tránh sử dụng thông tin từ bất kỳ nguồn nào trên web ngoại trừ Wikipedia (đối với các tập hợp con cụ thể của danh mục hướng dẫn) và được hướng dẫn rõ ràng để tránh sử dụng AI tổng hợp trong việc xây dựng hướng dẫn hoặc phản hồi. Ví dụ về từng hành vi được cung cấp để thúc đẩy các loại câu hỏi và hướng dẫn phù hợp với từng danh mục.
Nửa chừng trong quá trình tạo dữ liệu, những người đóng góp được cung cấp tùy chọn trả lời các câu hỏi do những người đóng góp khác đặt ra. Họ được yêu cầu diễn đạt lại câu hỏi ban đầu và chỉ chọn những câu hỏi mà họ được cho là sẽ trả lời đúng.
Đối với một số danh mục nhất định, người đóng góp được yêu cầu cung cấp văn bản tham khảo được sao chép từ Wikipedia. Văn bản tham khảo (được chỉ định bởi context
trong tập dữ liệu thực tế) có thể chứa các số trích dẫn Wikipedia trong ngoặc (ví dụ: [42]) mà chúng tôi khuyên người dùng nên xóa đối với các ứng dụng tiếp theo.
Mục đích sử dụng
Mặc dù có giá trị ngay lập tức đối với việc tinh chỉnh hướng dẫn các mô hình ngôn ngữ lớn, như một tập hợp các lời nhắc hướng dẫn do con người tạo ra, tập dữ liệu này cũng mang đến cơ hội quý giá cho việc tạo dữ liệu tổng hợp theo các phương pháp được nêu trong bài Tự hướng dẫn. Ví dụ: lời nhắc do cộng tác viên tạo có thể được gửi dưới dạng ví dụ vài lần quay cho một mô hình ngôn ngữ mở lớn để tạo ra một kho hàng triệu ví dụ về hướng dẫn trong mỗi danh mục InstructGPT tương ứng.
Tương tự như vậy, cả hướng dẫn và phản hồi đều là mảnh đất màu mỡ cho việc tăng cường dữ liệu. Một mô hình diễn giải có thể được sử dụng để trình bày lại từng lời nhắc hoặc câu trả lời ngắn, với văn bản thu được được liên kết với mẫu sự thật cơ bản tương ứng. Cách tiếp cận như vậy có thể cung cấp một hình thức chính quy hóa trên tập dữ liệu có thể cho phép thực hiện hành vi tuân theo hướng dẫn mạnh mẽ hơn trong các mô hình bắt nguồn từ các bộ dữ liệu tổng hợp này.
Tập dữ liệu
Mục đích thu thập
Là một phần trong cam kết liên tục của chúng tôi đối với nguồn mở, Databricks đã phát triển, theo hiểu biết tốt nhất của chúng tôi, kho tài liệu hướng dẫn nguồn mở đầu tiên do con người tạo ra được thiết kế đặc biệt để cho phép các mô hình ngôn ngữ lớn thể hiện khả năng tương tác kỳ diệu của ChatGPT. Không giống như các bộ dữ liệu khác bị giới hạn cho mục đích sử dụng phi thương mại, bộ dữ liệu này có thể được sử dụng, sửa đổi và mở rộng cho bất kỳ mục đích nào, bao gồm cả các ứng dụng học thuật hoặc thương mại.
Nguồn
- Dữ liệu do con người tạo ra: Nhân viên của Databricks được mời tạo các cặp nhắc nhở/phản hồi theo từng loại trong số tám danh mục hướng dẫn khác nhau.
- Wikipedia: Đối với các danh mục hướng dẫn yêu cầu người chú thích tham khảo văn bản tham khảo (trích xuất thông tin, QA đóng, tóm tắt), những người đóng góp đã chọn các đoạn văn từ Wikipedia cho các tập hợp con cụ thể của các danh mục hướng dẫn. Không có hướng dẫn nào được đưa ra cho người chú thích về cách chọn đoạn văn mục tiêu.
Nguyên tắc chú thích
Để tạo bản ghi, nhân viên được cung cấp mô tả ngắn gọn về nhiệm vụ chú thích cũng như các ví dụ về các loại lời nhắc điển hình của từng nhiệm vụ chú thích. Các hướng dẫn được thiết kế ngắn gọn nhằm khuyến khích tỷ lệ hoàn thành nhiệm vụ cao, có thể phải trả giá bằng việc tuân thủ nghiêm ngặt đối với phiếu tự đánh giá chú thích giúp vận hành nhiệm vụ cụ thể một cách cụ thể và đáng tin cậy. Hãy cẩn thận.
Nguyên tắc chú thích cho từng danh mục như sau:
- Viết sáng tạo: Viết câu hỏi hoặc hướng dẫn yêu cầu câu trả lời bằng văn bản mở, sáng tạo. Hướng dẫn phải hợp lý khi hỏi một người có kiến thức chung về thế giới và không cần phải tìm kiếm. Trong nhiệm vụ này, lời nhắc của bạn phải đưa ra hướng dẫn rất cụ thể để làm theo. Những ràng buộc, hướng dẫn, hướng dẫn hoặc yêu cầu đều có tác dụng và càng nhiều ràng buộc thì càng tốt.
- QA đã đóng: Viết một câu hỏi hoặc hướng dẫn yêu cầu câu trả lời chính xác dựa trên một đoạn văn bản từ Wikipedia. Câu hỏi có thể phức tạp và có thể liên quan đến khả năng suy luận ở cấp độ con người, nhưng không đòi hỏi kiến thức đặc biệt. Để tạo một câu hỏi cho nhiệm vụ này, hãy bao gồm cả văn bản của câu hỏi cũng như văn bản tham chiếu trong biểu mẫu.
- Mở QA: Viết một câu hỏi có thể được trả lời bằng cách sử dụng kiến thức chung về thế giới hoặc nhiều nhất là một tìm kiếm duy nhất. Nhiệm vụ này yêu cầu các ý kiến và sự thật về thế giới nói chung và không cung cấp bất kỳ văn bản tham khảo nào để tham khảo ý kiến.
- Tóm tắt: Đưa ra một bản tóm tắt của một đoạn văn từ Wikipedia. Vui lòng không đặt những câu hỏi cần hơn 3-5 phút để trả lời. Để tạo một câu hỏi cho nhiệm vụ này, hãy bao gồm cả văn bản của câu hỏi cũng như văn bản tham chiếu trong biểu mẫu.
- Khai thác thông tin: Những câu hỏi này liên quan đến việc đọc một đoạn văn từ Wikipedia và trích xuất thông tin từ đoạn văn đó. Mọi thứ cần thiết để tạo ra câu trả lời (ví dụ: danh sách, từ khóa, v.v.) nên được đưa vào đoạn văn. Để tạo một câu hỏi cho nhiệm vụ này, hãy bao gồm cả văn bản của câu hỏi cũng như văn bản tham chiếu trong biểu mẫu.
- Phân loại: Những lời nhắc này chứa danh sách hoặc ví dụ về các thực thể cần được phân loại, ví dụ: đánh giá phim, sản phẩm, v.v. Trong nhiệm vụ này, văn bản hoặc danh sách các thực thể đang được xem xét được chứa trong lời nhắc (ví dụ: không có văn bản tham chiếu.). Bạn có thể chọn bất kỳ danh mục nào để phân loại mà mình thích, càng đa dạng càng tốt.
- Động não: Nghĩ ra thật nhiều ví dụ để trả lời câu hỏi động não tìm ý tưởng.
Dữ liệu cá nhân hoặc nhạy cảm
Tập dữ liệu này chứa thông tin công khai (ví dụ: một số thông tin từ Wikipedia). Theo hiểu biết của chúng tôi, không có thông tin nhận dạng cá nhân hoặc thông tin nhạy cảm của cá nhân nào.
Ngôn ngữ
Tiếng Anh Mỹ
Những hạn chế đã biết
- Wikipedia là một kho tài liệu có nguồn lực từ cộng đồng và nội dung của tập dữ liệu này có thể phản ánh sự thiên vị, sai sót thực tế và trọng tâm chủ đề được tìm thấy trong Wikipedia
- Một số người chú thích có thể không phải là người nói tiếng Anh bản xứ
- Nhân khẩu học và chủ đề của người chú thích có thể phản ánh thành phần nhân viên của Databricks
Trích dẫn
@online{DatabricksBlog2023DollyV2,
author = {Mike Conover and Matt Hayes and Ankit Mathur and Jianwei Xie and Jun Wan and Sam Shah and Ali Ghodsi and Patrick Wendell and Matei Zaharia and Reynold Xin},
title = {Free Dolly: Introducing the World's First Truly Open Instruction-Tuned LLM},
year = {2023},
url = {https://www.databricks.com/blog/2023/04/12/dolly-first-open-commercially-viable-instruction-tuned-llm},
urldate = {2023-06-30}
}
Giấy phép/ Ghi công
Bản quyền (2023) Databricks, Inc. Bộ dữ liệu này được phát triển tại Databricks (https://www.databricks.com) và việc sử dụng nó phải tuân theo giấy phép CC BY-SA 3.0.
Một số loại tài liệu nhất định trong tập dữ liệu bao gồm các tài liệu từ các nguồn sau, được cấp phép theo giấy phép CC BY-SA 3.0:
Wikipedia (nhiều trang khác nhau) - https://www.wikipedia.org/ Bản quyền © các biên tập viên và cộng tác viên Wikipedia.
Dự án cùng danh mục
Danh sách tổng hợp các API miễn phí
TorchGeo: bộ dữ liệu, bộ lấy mẫu, biến đổi và mô hình được đào tạo trước cho dữ liệu không gian địa lý
Tạo dữ liệu tổng hợp cho dữ liệu dạng bảng
Ghi nhãn dữ liệu được AI hỗ trợ dễ dàng với sự hỗ trợ của AI từ YOLO, Segment Anything (SAM+SAM2/2.1+SAM3), MobileSAM!!
giấy phép:mit, size_categories:100K<n<1M, định dạng:JSON, phương thức:văn bản
size_categories:1M<n<10M, định dạng:sàn gỗ, phương thức:văn bản, thư viện:bộ dữ liệu