Anthropic/hh-rlhf
giấy phép:mit, size_categories:100K<n<1M, định dạng:JSON, phương thức:văn bản
README
Thẻ bộ dữ liệu cho HH-RLHF
Tóm tắt tập dữ liệu
Kho lưu trữ này cung cấp quyền truy cập vào hai loại dữ liệu khác nhau:
- Dữ liệu ưa thích của con người về sự hữu ích và vô hại từ Đào tạo một trợ lý hữu ích và vô hại bằng cách học tăng cường từ phản hồi của con người. Những dữ liệu này nhằm mục đích đào tạo các mô hình ưu tiên (hoặc khen thưởng) cho quá trình đào tạo RLHF tiếp theo. Những dữ liệu này là không có nghĩa là để đào tạo có giám sát các tác nhân đối thoại. Việc đào tạo các tác nhân đối thoại về những dữ liệu này có thể dẫn đến các mô hình có hại và cần tránh điều này.
- Các cuộc đối thoại về nhóm đỏ do con người tạo ra và có chú thích từ Các mô hình ngôn ngữ hợp tác màu đỏ để giảm thiểu tác hại: Phương pháp, hành vi mở rộng quy mô và bài học kinh nghiệm. Những dữ liệu này nhằm mục đích hiểu cách mô hình đội đỏ của cộng đồng và loại tấn công của đội đỏ có thành công hay không. Dữ liệu là không dành cho việc tinh chỉnh hoặc lập mô hình ưu tiên (sử dụng dữ liệu ở trên để lập mô hình ưu tiên). Những dữ liệu này là toàn bộ bản ghi của các cuộc hội thoại bắt nguồn từ dữ liệu mô hình ưu tiên vô hại được mô tả ở trên, trong đó chỉ phản hồi đã chọn mới được đưa vào bản ghi tổng thể. Hơn nữa, các bản ghi được chú thích bằng các phép đo tự động và do con người thực hiện để đánh giá mức độ gây hại của các cuộc đối thoại tổng thể.
Tuyên bố miễn trừ trách nhiệm: Dữ liệu (đặc biệt là dữ liệu ưu tiên vô hại và dữ liệu đội đỏ) chứa nội dung có thể gây khó chịu hoặc gây khó chịu. Các chủ đề bao gồm nhưng không giới hạn ở ngôn ngữ phân biệt đối xử và các cuộc thảo luận về lạm dụng, bạo lực, tự làm hại bản thân, bóc lột và các chủ đề có khả năng gây khó chịu khác. Vui lòng chỉ tham gia vào dữ liệu phù hợp với mức độ chấp nhận rủi ro cá nhân của bạn. Dữ liệu được dùng cho mục đích nghiên cứu, đặc biệt là nghiên cứu có thể tạo ra các mô hình ít hơn có hại. Quan điểm thể hiện trong dữ liệu không phản ánh quan điểm của Anthropic hoặc bất kỳ nhân viên nào của công ty. Như đã đề cập ở trên, những dữ liệu này là không dành cho việc đào tạo các tác nhân đối thoại vì điều này có thể sẽ dẫn đến hành vi mô hình có hại.
Mỗi bộ dữ liệu này được mô tả thêm dưới đây.
Dữ liệu ưa thích của con người về tính hữu ích và vô hại (Dữ liệu PM)
Các dữ liệu được mô tả trong bài báo: Đào tạo một trợ lý hữu ích và vô hại bằng cách học tăng cường từ phản hồi của con người. Nếu bạn thấy dữ liệu hữu ích, vui lòng trích dẫn bài báo. Định dạng dữ liệu rất đơn giản -- mỗi dòng của tệp jsonl chứa một cặp văn bản, một văn bản "được chọn" và một văn bản "bị từ chối".
cho sự hữu ích, dữ liệu được nhóm thành các phần tách đào tạo/kiểm tra thành ba đợt: từ các mô hình cơ sở của chúng tôi (mô hình ngôn ngữ 52B được chắt lọc theo ngữ cảnh), thông qua lấy mẫu từ chối (chủ yếu là lấy mẫu tốt nhất trong số 16) so với mô hình ưu tiên sớm và tập dữ liệu được lấy mẫu trong quá trình "trực tuyến" lặp đi lặp lại của chúng tôi.
cho sự vô hại, dữ liệu chỉ được thu thập cho các mô hình cơ sở của chúng tôi nhưng được định dạng theo cách tương tự.
Thông tin chi tiết về quá trình thu thập dữ liệu và số lượng cộng đồng có thể được tìm thấy trong bài viết, cụ thể là ở phần 2 và phụ lục D.
Dữ liệu nhóm đỏ (không phải Dữ liệu PM)
Các dữ liệu được mô tả trong bài báo: Các mô hình ngôn ngữ hợp tác màu đỏ để giảm thiểu tác hại: Phương pháp, hành vi mở rộng quy mô và bài học kinh nghiệm. Nếu bạn thấy dữ liệu hữu ích, vui lòng trích dẫn bài báo. Ở cấp độ cao, những dữ liệu này có thể được kiểm tra để hiểu những nỗ lực thành công của đội đỏ trông như thế nào.
Chi tiết về dữ liệu và quy trình thu thập dữ liệu có thể được tìm thấy trong Bảng dữ liệu ở phần phụ lục của bài báo.
Mỗi dòng của tệp jsonl chứa một từ điển có các trường sau:
transcriptbản ghi lại cuộc trò chuyện giữa kẻ thù của con người (thành viên đội đỏ) và trợ lý AImin_harmlessness_score_transcriptđiểm giá trị thực về mức độ vô hại của trợ lý AI (thấp hơn là có hại hơn) thu được từ mô hình ưu tiênnum_paramssố lượng tham số trong mô hình ngôn ngữ hỗ trợ trợ lý AImodel_typeloại mô hình hỗ trợ trợ lý AIratingđánh giá của thành viên đội đỏ về mức độ thành công của họ trong việc phá vỡ trợ lý AI (thang Likert, cao hơn là thành công hơn)task_descriptionmột đoạn văn bản mô tả ngắn do thành viên đội đỏ viết về cách họ cố gắng thuyết phục trợ lý AI của đội đỏtask_description_harmlessness_scoređiểm giá trị thực về mức độ vô hại của mô tả nhiệm vụ (thấp hơn là có hại hơn) thu được từ mô hình ưu tiênred_team_member_idmột mã định danh tùy ý của thành viên đội đỏ. một thành viên đội đỏ có thể tạo ra nhiều cuộc tấn công của đội đỏis_upworkermột chỉ báo nhị phân đúng nếu thành viên đội đỏ đến từ nền tảng đám đông Upwork hoặc sai nếu họ đến từ MTurktagsdanh sách tối đa 6 thẻ cho mỗi bản ghi. thẻ là những mô tả ngắn về nỗ lực của đội đỏ được tạo bởi những người làm việc trong cộng đồng, những người đã xem xét dữ liệu của đội đỏ sau khi thực hiện. thẻ chỉ được cung cấp cho một mẫu ngẫu nhiên gồm 1000 lần thử của đội đỏ cho hai trong bốn loại mô hình.
Cách sử dụng
Mỗi bộ dữ liệu trên được đặt trong một thư mục con riêng biệt. Để tải một tập hợp con riêng lẻ, hãy sử dụng data_dir lập luận của load_dataset() chức năng như sau:
from datasets import load_dataset
# Load all helpfulness/harmless subsets (share the same schema)
dataset = load_dataset("Anthropic/hh-rlhf")
# Load one of the harmless subsets
dataset = load_dataset("Anthropic/hh-rlhf", data_dir="harmless-base")
# Load the red teaming subset
dataset = load_dataset("Anthropic/hh-rlhf", data_dir="red-team-attempts")
Liên hệ
Các tác giả ban đầu lưu trữ tập dữ liệu này trên GitHub tại đây: https://GitHub.com/anthropics/hh-rlhf Bạn có thể gửi yêu cầu đến: [email protected]
Dự án cùng danh mục
Danh sách tổng hợp các API miễn phí
TorchGeo: bộ dữ liệu, bộ lấy mẫu, biến đổi và mô hình được đào tạo trước cho dữ liệu không gian địa lý
Tạo dữ liệu tổng hợp cho dữ liệu dạng bảng
Ghi nhãn dữ liệu được AI hỗ trợ dễ dàng với sự hỗ trợ của AI từ YOLO, Segment Anything (SAM+SAM2/2.1+SAM3), MobileSAM!!
task_categories:trả lời câu hỏi, task_categories:tóm tắt, ngôn ngữ:en, giấy phép:cc-by-sa-3.0
size_categories:1M<n<10M, định dạng:sàn gỗ, phương thức:văn bản, thư viện:bộ dữ liệu