RepoTrending
Về bảng xếp hạng
GitHubAgentic / Đa tác tửTypeScript

walkinglabs/learn-harness-engineering

Hướng dẫn dành cho người mới bắt đầu về kỹ thuật khai thác, từ 0 đến 1

14k sao1.4k fork

README

English 简体中文 繁體中文 日本語 한국어 Español Français Русский Deutsch العربية Tiếng Việt Oʻzbekcha Türkçe Português-BR Українська

Tìm hiểu kỹ thuật khai thác

Khóa học dựa trên dự án về xây dựng môi trường, cơ chế quản lý trạng thái, xác minh và kiểm soát giúp các tác nhân mã hóa AI hoạt động đáng tin cậy.

14 Lectures 8 Projects 15 Languages MIT License Join the Discord community

🌍 Khóa học này hiện có tại 15 ngôn ngữ: Tiếng Anh, 简体中文, 繁體中文, 日本語, 한국어, Español, Français, Русский, Deutsch, العربية, Tiếng Việt, Oʻzbekcha, Türkçe, Tiếng Bồ Đào Nha (BR), Українська. Chọn ngôn ngữ của bạn từ các huy hiệu ở trên.

🆕 Có gì mới — Tháng 8 năm 2026

Phân tích thiết kế khai thác biên giới - phần mới (4 phân tích)

cái gì Chi tiết
Phần mới Sự cố về thiết kế khai thác biên giới — Áp dụng khuôn khổ năm hệ thống con của khóa học (hướng dẫn, công cụ, môi trường, trạng thái, phản hồi) để thiết kế ngược cách bốn sản phẩm biên giới xây dựng các khai thác thực sự.
Pi Cách Pi xây dựng dây nịt của mình — hạt nhân tối thiểu, khả năng mở rộng có thể lập trình và kỹ thuật ngữ cảnh đằng sau việc “yêu cầu Pi xây dựng những gì bạn muốn”.
Claude Code Cách Claude Code chế tạo dây đai của nó — bộ nhớ bốn lớp, nén năm cấp, móc và cách ly tác nhân phụ.
Codex Codex xây dựng hệ thống khai thác của mình như thế nào — kho lưu trữ là nguồn thông tin chính xác, AGENTS.md là trang thư mục và cách ly cây làm việc.
DeepSeek Cách DeepSeek xây dựng dây đai của nó — "mọi thứ đều là plugin", các đường nối khả năng và đường dẫn sự kiện.
Tất cả 15 ngôn ngữ Phạm vi dịch thuật đầy đủ trên tất cả các ngôn ngữ được hỗ trợ.

Ý tưởng chính: Khóa học cung cấp cho bạn một khuôn khổ; những phân tích này cho bạn thấy các nguyên tắc tương tự thực sự diễn ra như thế nào trong dây chuyền sản xuất.


Cập nhật kỹ thuật đồ thị - 1 bài giảng mới, 1 dự án mới

cái gì Chi tiết
Bài giảng 14 Từ vòng lặp đơn đến kỹ thuật đồ thị — Tại sao một vòng lặp phát triển thành một biểu đồ: bốn lớp xếp chồng lên nhau (dấu nhắc → ngữ cảnh → vòng lặp → biểu đồ) và vị trí khai thác nằm trong ngăn xếp đó, bốn phần của biểu đồ (nút, cạnh, trạng thái chia sẻ, định tuyến), tại sao các điểm kiểm tra trong vòng lặp không thể khắc phục ba lỗi cấu trúc trên quy mô lớn (Goodhart, mù hướng lên, xung đột), hướng dẫn sáu bước không xác định khung để xây dựng biểu đồ, biểu đồ so với quy trình làm việc, các điểm neo đầu tiên của bạn, mà các dự án "kỹ thuật đồ thị" mã nguồn mở tồn tại trước tên so với sau nó, thuế điều phối và khi nào một biểu đồ thực sự đáng vẽ.
Dự án 08 Vẽ quy trình làm việc của bạn dưới dạng biểu đồ — Ba thử nghiệm lũy tiến: vẽ vòng lặp trình tạo-kiểm tra của bạn dưới dạng biểu đồ rõ ràng, thêm nút phân ra/quạt vào song song, sau đó thêm cạnh khôi phục có điều kiện và nút phê duyệt của con người.

Ý tưởng chính: Một vòng lặp là một biểu đồ có một nút. Khi nhiệm vụ của bạn cần chuyên môn hóa, song song, trạng thái chia sẻ, xác minh và khôi phục — nó đã không còn là vòng lặp nữa. Đó là một biểu đồ.


🆕 Có gì mới — Tháng 7 năm 2026

Cập nhật kỹ thuật vòng lặp - 1 bài giảng mới, 1 dự án mới

cái gì Chi tiết
Bài giảng 13 Tại sao bạn cần ngừng nhắc nhở đại lý của mình - Từ /goal đến sáu nguyên tắc cơ bản của kỹ thuật vòng lặp (tự động hóa, sơ đồ công việc, kỹ năng, trình kết nối, tác nhân phụ, trạng thái bên ngoài), phân chia trình tạo/bộ đánh giá, bốn chi phí thầm lặng và hướng dẫn từng bước để xây dựng vòng lặp đầu tiên của bạn.
Dự án 07 Xây dựng vòng lặp tự động đầu tiên của bạn - Ba thử nghiệm lũy tiến: vòng lặp mục tiêu, vòng lặp bộ đếm thời gian và vòng lặp bộ kiểm tra nhà sản xuất. So sánh thủ công và tự động, đo lường mức giảm can thiệp và học cách bước ra ngoài vòng lặp.
Mẫu mã goal-template.md, loop-state-template.md, maker-prompt.md, checker-prompt.md — các mẫu thả xuống để xây dựng các vòng lặp ngay lập tức.
Tất cả 15 ngôn ngữ Phạm vi dịch thuật đầy đủ trên tất cả các ngôn ngữ được hỗ trợ.

Ý tưởng chính: Kỹ thuật khai thác chế tạo chiếc xe. Kỹ thuật vòng lặp thiết kế con đường nó chạy — và bạn thiết kế con đường từ bên ngoài ô tô.


Tìm hiểu Kỹ thuật khai thác là khóa học dành riêng cho kỹ thuật của các tác nhân mã hóa AI. Chúng tôi đã nghiên cứu sâu và tổng hợp các lý thuyết và thực tiễn Kỹ thuật Khai thác tiên tiến nhất trong ngành. Tài liệu tham khảo cốt lõi của chúng tôi bao gồm:

Bắt đầu nhanh? các skills/harness-creator/ kỹ năng có thể giúp bạn tạo ra một hệ thống khai thác cấp sản xuất (AGENTS.md, danh sách tính năng, init.sh, quy trình xác minh) cho dự án của riêng bạn trong vài phút.


Mục lục


✨ Xem trước trực quan

🏠 Trang chủ khóa học

Đề cương khóa học toàn diện và giới thiệu về các triết lý cốt lõi, cung cấp lộ trình rõ ràng để bắt đầu.

Course homepage preview

📖 Bài giảng sâu sắc

Đi sâu vào những điểm khó khăn trong thế giới thực và các dự án thực hành (như Dự án 01) để có trải nghiệm học tập phong phú.

Course lecture preview

🗂️ Thư viện tài nguyên sẵn sàng sử dụng

Các mẫu và cấu hình tham chiếu được thiết kế để giải quyết các cạm bẫy thường gặp trong quá trình phát triển tác nhân AI nhiều lượt, chẳng hạn như mất ngữ cảnh và hoàn thành nhiệm vụ sớm.

Resource library preview

Sách giáo khoa PDF

Kho lưu trữ hiện bao gồm quy trình xây dựng PDF cho nội dung khóa học.

  • Chạy npm run pdf:build để tạo các giáo trình PDF hiện được cấu hình cục bộ.
  • Các tập tin đầu ra được ghi vào artifacts/pdfs/.
  • Chạy npm run screenshots:readme nếu bạn muốn làm mới hình ảnh xem trước README.
  • GitHub Quy trình làm việc của hành động release-course-pdfs.yml có thể xây dựng các tệp PDF và xuất bản chúng lên Bản phát hành GitHub.

Mô hình thông minh, dây nịt làm cho nó đáng tin cậy

Có một sự thật phũ phàng là hầu hết mọi người đều học một cách khó khăn: mô hình mạnh nhất trên thế giới vẫn sẽ thất bại trong các nhiệm vụ kỹ thuật thực tế nếu bạn không xây dựng một môi trường thích hợp xung quanh nó.

Có lẽ bạn đã nhìn thấy điều này chính mình. Bạn giao cho Claude hoặc GPT một nhiệm vụ trong kho lưu trữ của mình. Nó khởi đầu tốt - đọc tập tin, viết mã, trông có vẻ hiệu quả. Sau đó có điều gì đó không ổn. Nó bỏ qua một bước. Nó phá vỡ một bài kiểm tra. Nó nói "xong" nhưng thực sự không có gì hiệu quả. Bạn dành nhiều thời gian dọn dẹp hơn là tự mình làm việc đó.

Đây không phải là vấn đề về mô hình. Đó là một vấn đề khai thác.

Bằng chứng là rõ ràng. Anthropic đã chạy thử nghiệm có kiểm soát: cùng một mô hình (Opus 4.5), cùng một lời nhắc ("xây dựng trình chỉnh sửa trò chơi cổ điển 2D"). Nếu không có dây nịt, nó tốn 9 đô la trong 20 phút và tạo ra thứ gì đó không hoạt động. Với toàn bộ nguồn lực (người lập kế hoạch + người tạo + người đánh giá), nó đã chi 200 đô la trong 6 giờ và xây dựng một trò chơi mà bạn thực sự có thể chơi. Mô hình không thay đổi. Dây nịt đã làm được.

OpenAI đã báo cáo điều tương tự với Codex: trong một kho lưu trữ được khai thác tốt, mô hình tương tự sẽ chuyển từ "không đáng tin cậy" sang "đáng tin cậy". Không phải là một cải tiến nhỏ - một sự thay đổi về chất.

Khóa học này dạy bạn cách xây dựng môi trường đó.

                    THE HARNESS PATTERN
                    ====================

    You --> give task --> Agent reads harness files --> Agent executes
                                                        |
                                              harness governs every step:
                                              |
                                              +--> Instructions: what to do, in what order
                                              +--> Scope:        one feature at a time, no overreach
                                              +--> State:        progress log, feature list, git history
                                              +--> Verification: tests, lint, type-check, smoke runs
                                              +--> Lifecycle:    init at start, clean state at end
                                              |
                                              v
                                         Agent stops only when
                                         verification passes

Kỹ thuật khai thác thực sự có nghĩa là gì

Kỹ thuật khai thác là xây dựng một môi trường làm việc hoàn chỉnh xung quanh mô hình để nó tạo ra kết quả đáng tin cậy. Vấn đề không phải là viết lời nhắc tốt hơn. Đó là về việc thiết kế hệ thống mà mô hình vận hành bên trong.

Một dây nịt có năm hệ thống con:

    ┌────────────────────────────────────────────────────────────────┐
    │                          THE HARNESS                           │
    │                                                                │
    │   ┌──────────────┐  ┌──────────────┐  ┌────────────────────┐   │
    │   │ Instructions │  │    State     │  │   Verification     │   │
    │   │              │  │              │  │                    │   │
    │   │ AGENTS.md    │  │ progress.md  │  │ tests + lint       │   │
    │   │ CLAUDE.md    │  │ feature_list │  │ type-check         │   │
    │   │ feature_list │  │ git log      │  │ smoke runs         │   │
    │   │ docs/        │  │ session hand │  │ e2e pipeline       │   │
    │   └──────────────┘  └──────────────┘  └────────────────────┘   │
    │                                                                │
    │   ┌──────────────┐  ┌──────────────────────────────────────┐   │
    │   │    Scope     │  │         Session Lifecycle            │   │
    │   │              │  │                                      │   │
    │   │ one feature  │  │ init.sh at start                     │   │
    │   │ at a time    │  │ clean-state checklist at end         │   │
    │   │ definition   │  │ handoff note for next session        │   │
    │   │ of done      │  │ commit only when safe to resume      │   │
    │   └──────────────┘  └──────────────────────────────────────┘   │
    │                                                                │
    └────────────────────────────────────────────────────────────────┘

    The MODEL decides what code to write.
    The HARNESS governs when, where, and how it writes it.
    The harness doesn't make the model smarter.
    It makes the model's output reliable.

Mỗi hệ thống con có một công việc:

  • Hướng dẫn — Nói cho nhân viên biết phải làm gì, theo thứ tự nào và đọc những gì trước khi bắt đầu. Không phải một tập tin khổng lồ; một cấu trúc tiết lộ lũy tiến mà đại lý điều hướng theo yêu cầu.
  • tiểu bang — Theo dõi những gì đã được thực hiện, những gì đang diễn ra và những gì tiếp theo. Được lưu vào đĩa để phiên tiếp theo sẽ tiếp tục chính xác nơi phiên cuối cùng đã dừng lại.
  • Xác minh — Chỉ một bộ bài kiểm tra đạt được mới được coi là bằng chứng. Đặc vụ không thể tuyên bố chiến thắng nếu không có bằng chứng xác thực.
  • phạm vi — Ràng buộc tác nhân vào một tính năng tại một thời điểm. Không vượt quá. Không hoàn thành được một nửa ba việc. Không viết lại danh sách tính năng để che giấu công việc còn dang dở.
  • Vòng đời phiên - Khởi tạo ngay từ đầu. Dọn dẹp vào cuối. Để lại một đường dẫn khởi động lại sạch sẽ cho phiên tiếp theo.

Tại sao khóa học này tồn tại

Câu hỏi không phải là "người mẫu có thể viết mã được không?" Họ có thể. Câu hỏi là: liệu họ có thể hoàn thành các nhiệm vụ kỹ thuật thực tế một cách đáng tin cậy bên trong các kho lưu trữ thực, qua nhiều phiên mà không cần sự giám sát liên tục của con người không?

Ngay bây giờ, câu trả lời là: không thể không có dây nịt.

    WITHOUT HARNESS                            WITH HARNESS
    ==============                             ============

    Session 1: agent writes code               Session 1: agent reads instructions
               agent breaks tests                         agent runs init.sh
               agent says "done"                          agent works on one feature
               you fix it manually                        agent verifies before claiming done
                                                          agent updates progress log
    Session 2: agent starts fresh                         agent commits clean state
               agent has no memory
               of what happened before         Session 2: agent reads progress log
               agent re-does work                         agent picks up exactly where it left off
               or does something else entirely            agent continues the unfinished feature
               you fix it again                           you review, not rescue

    Result: you spend more time                Result: agent does the work,
            cleaning up than if you                    you verify the result
            did it yourself

Các câu hỏi mà khóa học này thực sự quan tâm:

  • Thiết kế khai thác nào cải thiện tỷ lệ hoàn thành nhiệm vụ?
  • Những thiết kế nào làm giảm việc làm lại và hoàn thành sai?
  • Cơ chế nào giúp các nhiệm vụ dài hạn tiến triển đều đặn?
  • Cấu trúc nào giúp hệ thống có thể duy trì được sau khi chạy nhiều tác nhân?

Giáo trình & Tài liệu khóa học

Để có đầy đủ tài liệu khóa học, vui lòng truy cập Trang web tài liệu.

Giáo trình được chia thành ba phần:

  1. Bài giảng: 13 đơn vị khái niệm giải thích lý thuyết đằng sau kỹ thuật khai thác.
  2. Dự án: 7 dự án thực hành trong đó bạn xây dựng một không gian làm việc tự động từ đầu.
  3. Thư viện tài nguyên: Các mẫu sẵn sàng sao chép (AGENTS.md, feature_list.json, init.sh, v.v.) để sử dụng trong kho của riêng bạn ngay hôm nay.

Bắt đầu nhanh: Cải thiện đại lý của bạn ngay hôm nay

Bạn không cần phải đọc hết 14 bài giảng trước khi bắt đầu nhận được giá trị. Nếu bạn đang sử dụng tác nhân mã hóa cho một dự án thực tế thì đây là cách cải thiện nó ngay bây giờ.

Ý tưởng rất đơn giản: thay vì chỉ viết lời nhắc, hãy cung cấp cho nhân viên hỗ trợ của bạn một tập hợp các tệp có cấu trúc để xác định những việc cần làm, những việc đã làm và cách xác minh công việc. Các tệp này nằm trong kho lưu trữ của bạn, vì vậy mọi phiên đều bắt đầu từ cùng một trạng thái.

    YOUR PROJECT ROOT
    ├── AGENTS.md              <-- the agent's operating manual
    ├── CLAUDE.md              <-- (alternative, if using Claude Code)
    ├── init.sh                <-- runs install + verify + start
    ├── feature_list.json      <-- what features exist, which are done
    ├── claude-progress.md     <-- session progress (historical filename; agent-agnostic)
    └── src/                   <-- your actual code

Lấy các mẫu khởi đầu từ Thư viện tài nguyên và thả chúng vào dự án của bạn. Thế thôi. Bốn tệp và phiên tác nhân của bạn sẽ ổn định hơn đáng kể so với việc chỉ chạy trên lời nhắc.

claude-progress.md là nhật ký tiến trình phiên cục bộ, chung của kho lưu trữ; tên được giữ lại để tương thích với các ví dụ khóa học. Nó không bị ràng buộc với Claude Code và không được bất kỳ tác nhân nào cập nhật tự động. Codex, OpenHands, AntiGravity và các tác nhân mã hóa khác có thể sử dụng cùng một tệp khi hướng dẫn gốc của chúng yêu cầu chúng đọc tệp đó khi khởi động và cập nhật tệp trước khi chuyển giao.


Dự án Capstone: Một ứng dụng thực sự

Tất cả sáu dự án khóa học đều xoay quanh cùng một sản phẩm: ứng dụng máy tính để bàn cơ sở kiến thức cá nhân dựa trên Electron.

    ┌──────────────────────────────────────────────────────┐
    │             Knowledge Base Desktop App               │
    │                                                      │
    │  ┌──────────────┐  ┌──────────────────────────────┐  │
    │  │ Document List│  │       Q&A Panel              │  │
    │  │              │  │                              │  │
    │  │ doc-001.md   │  │  Q: What is harness eng?     │  │
    │  │ doc-002.md   │  │  A: The environment built    │  │
    │  │ doc-003.md   │  │     around an agent model... │  │
    │  │ ...          │  │     [citation: doc-002.md]   │  │
    │  └──────────────┘  └──────────────────────────────┘  │
    │                                                      │
    │  ┌─────────────────────────────────────────────────┐ │
    │  │ Status Bar: 42 docs | 38 indexed | last sync 3m │ │
    │  └─────────────────────────────────────────────────┘ │
    └──────────────────────────────────────────────────────┘

    Core features:
    ├── Import local documents
    ├── Manage a document library
    ├── Process and index documents
    ├── Run AI-powered Q&A over imported content
    └── Return grounded answers with citations

Dự án này được chọn vì nó kết hợp giá trị thực tế mạnh mẽ, độ phức tạp của sản phẩm trong thế giới thực và một bối cảnh tốt để quan sát các cải tiến trước/sau khi khai thác.

Giải pháp/sự khởi đầu của mỗi dự án khóa học là bản sao hoàn chỉnh của ứng dụng Electron này ở giai đoạn phát triển đó. Công cụ khởi đầu của P(N+1) bắt nguồn từ giải pháp của P(N) — ứng dụng sẽ phát triển khi kỹ năng khai thác của bạn phát triển.


Lộ trình học tập

Khóa học được thiết kế để được thực hiện theo thứ tự. Mỗi giai đoạn được xây dựng trên giai đoạn cuối cùng.

    Phase 1: SEE THE PROBLEM              Phase 2: STRUCTURE THE REPO
    ========================              ==========================

    L01  Strong models ≠ reliable         L03  Repository as single
         execution                              source of truth
    L02  What harness actually means
                                          L04  Split instructions across
         |                                     files, not one giant file
         v
    P01  Prompt-only vs.                       |
         rules-first comparison                v
                                               P02  Agent-readable workspace


    Phase 3: CONNECT SESSIONS             Phase 4: FEEDBACK & SCOPE
    ==========================            =========================

    L05  Keep context alive               L07  Draw clear task boundaries
         across sessions
                                          L08  Feature lists as harness
    L06  Initialize before every               primitives
         agent session
                                               |
         |                                     v
         v                                     P04  Runtime feedback to
    P03  Multi-session continuity                   correct agent behavior


    Phase 5: VERIFICATION                 Phase 6: PUT IT ALL TOGETHER
    =====================                 ============================

    L09  Stop agents from                 L11  Make agent's runtime
         declaring victory early               observable

    L10  Full-pipeline run =              L12  Clean handoff at end of
         real verification                      every session

         |                                     |
         v                                     v
    P05  Agent verifies its own work      P06  Build a complete harness
                                               (capstone project)

    Phase 7: AUTOMATE THE LOOP
    ==========================

    L13  Stop prompting your agent —
         design loops instead

         |
         v
    P07  Build your first automated loop
         (goal loop, timer loop, maker-checker)

    Phase 8: STRUCTURE THE SYSTEM
    =============================

    L14  Draw the system as a graph —
         nodes, edges, shared state, routing

         |
         v
    P08  Draw your workflow as a graph
         (explicit graph, parallel fan-out/fan-in,
          rollback edges, human-in-the-loop)

Mỗi giai đoạn mất khoảng một tuần nếu bạn làm việc bán thời gian. Nếu bạn muốn đi nhanh hơn, giai đoạn 1–3 có thể được thực hiện trong một ngày cuối tuần dài.


Giáo trình

Bài giảng - 14 đơn vị khái niệm, mỗi đơn vị trả lời một câu hỏi cốt lõi

Đọc toàn bộ nội dung của mỗi bài giảng trên Trang web tài liệu.

Phiên Câu hỏi Ý tưởng cốt lõi
L01 Tại sao những người mẫu mạnh vẫn thất bại trong nhiệm vụ thực tế? Khoảng cách về năng lực giữa điểm chuẩn và kỹ thuật thực tế
L02 "Khai thác" thực sự có nghĩa là gì? Năm hệ thống con: hướng dẫn, trạng thái, xác minh, phạm vi, vòng đời
L03 Tại sao repo phải là nguồn sự thật duy nhất? Nếu đại lý không nhìn thấy nó, nó không tồn tại
L04 Tại sao một tập tin hướng dẫn khổng lồ bị lỗi? Tiết lộ tiến bộ: đưa ra một bản đồ, không phải một bộ bách khoa toàn thư
L05 Tại sao các tác vụ chạy dài lại mất đi tính liên tục? Kiên trì tiến tới đĩa; bắt đầu từ nơi bạn đã dừng lại
L06 Tại sao việc khởi tạo lại cần giai đoạn riêng của nó? Xác minh môi trường lành mạnh trước khi đại lý bắt đầu làm việc
L07 Tại sao các đại lý làm quá mức và chưa hoàn thành? Mỗi lần một tính năng; định nghĩa rõ ràng về việc thực hiện
L08 Tại sao danh sách tính năng khai thác nguyên thủy? Ranh giới phạm vi có thể đọc được bằng máy mà tác nhân không thể bỏ qua
L09 Vì sao đặc vụ tuyên bố chiến thắng quá sớm? Khoảng trống xác minh: độ tin cậy ≠ tính chính xác
L10 Tại sao thử nghiệm toàn diện lại thay đổi kết quả? Chỉ chạy toàn bộ quy trình mới được tính là xác minh thực sự
L11 Tại sao khả năng quan sát lại thuộc về dây nịt? Nếu bạn không thể thấy người đại diện đã làm gì thì bạn không thể sửa chữa những gì nó đã hỏng
L12 Tại sao mỗi phiên đều phải để trạng thái sạch? Sự thành công của phiên tiếp theo phụ thuộc vào việc dọn dẹp phiên này
L13 Tại sao bạn cần ngừng nhắc nhở đại lý của mình? Từ lái xe thủ công đến vòng lặp tự động - vòng lặp mục tiêu, vòng lặp hẹn giờ và phân tách bộ kiểm tra nhà sản xuất
L14 Tại sao một vòng lặp lại phát triển thành một biểu đồ? Từ các vòng lặp đơn đến kỹ thuật đồ thị - nút, cạnh, trạng thái chia sẻ, định tuyến và khi nào đồ thị thực sự đáng vẽ

Dự án — 8 dự án thực hành áp dụng phương pháp bài giảng cho cùng một ứng dụng Electron

dự án Bạn làm gì Cơ chế khai thác
P01 Chạy cùng một tác vụ hai lần: chỉ nhắc nhở so với quy tắc trước Khai thác tối thiểu: AGENTS.md + init.sh + feature_list.JSON
P02 Cơ cấu lại repo để đại lý có thể đọc nó Không gian làm việc có thể đọc được của tác nhân + các tệp trạng thái liên tục
P03 Yêu cầu nhân viên tiếp tục từ nơi nó đã dừng lại Nhật ký tiến trình + chuyển giao phiên + liên tục nhiều phiên
P04 Ngăn chặn đại lý làm quá nhiều hoặc quá ít Phản hồi về thời gian chạy + kiểm soát phạm vi + lập chỉ mục gia tăng
P05 Làm cho đại lý xác minh công việc của chính mình Tự xác minh + Hỏi đáp có căn cứ + hoàn thành dựa trên bằng chứng
P06 Xây dựng một dây nịt hoàn chỉnh từ đầu (capstone) Khai thác đầy đủ: tất cả các cơ chế + khả năng quan sát + nghiên cứu cắt bỏ
P07 Xây dựng vòng lặp tự động đầu tiên của bạn Vòng lặp mục tiêu, vòng lặp hẹn giờ, phân tách bộ kiểm tra, quản lý trạng thái vòng lặp
P08 Vẽ quy trình làm việc của bạn dưới dạng biểu đồ Các nút/cạnh/trạng thái/định tuyến rõ ràng, phân ra/quạt vào song song, các cạnh khôi phục, phê duyệt của con người trong vòng lặp
    PROJECT EVOLUTION
    =================

    P01  Prompt-only vs. rules-first       You see the problem
     |
     v
    P02  Agent-readable workspace          You restructure the repo
     |
     v
    P03  Multi-session continuity          You connect sessions
     |
     v
    P04  Runtime feedback & scope          You add feedback loops
     |
     v
    P05  Self-verification                 You make the agent check itself
     |
     v
    P06  Complete harness (capstone)       You build the full system
     |
     v
    P07  Your first automated loop        You step outside the loop
     |
     v
    P08  Draw your workflow as a graph    You draw the system as a graph

    Each project's solution becomes the next project's starter.
    The app evolves. Your harness skills grow with it.

Thư viện tài nguyên

  • Tiếng Anh - mẫu, danh sách kiểm tra và tài liệu tham khảo phương pháp
  • 简体中文 — 中文模板、清单和方法参考
  • 繁體中文 — 繁體中文範本、清單和方法參考
  • 日本語 — テンプレート、チェックリスト、方法リファレンス
  • 한국어 — 템플릿, 체크리스트, 방법 참고 자료
  • tiếng Tây Ban Nha — cây trồng, danh sách xác minh và tài liệu tham khảo
  • người Pháp — modèles, liệt kê các điều khiển và tham chiếu
  • Русский — шаблоны, чек-листы и справочники
  • tiếng Đức — Vorlagen, Danh sách kiểm tra và Tham khảo
  • العربية — قوالب، قوائم تحقق ومراجع
  • Tiếng Việt — mẫu, danh sách kiểm tra và tài liệu tham khảo
  • Oʻzbekcha — andozalar, tekshiruv roʻyxatlari và maʼlumotnomalar
  • Türkçe — şablonlar, kiểm soát danh sách và người giới thiệu
  • Bồ Đào Nha (BR) — các mô hình, danh sách xác minh và tham khảo các phương pháp

Vòng đời phiên tác nhân

Một trong những ý tưởng cốt lõi trong khóa học này: phiên của tổng đài viên phải tuân theo vòng đời có cấu trúc chứ không phải miễn phí cho tất cả. Đây là những gì trông giống như:

    AGENT SESSION LIFECYCLE
    ======================

    ┌──────────────────────────────────────────────────────────────────┐
    │  START                                                           │
    │                                                                  │
    │  1. Agent reads AGENTS.md / CLAUDE.md                            │
    │  2. Agent runs init.sh (install, verify, health check)           │
    │  3. Agent reads claude-progress.md (what happened last time)     │
    │  4. Agent reads feature_list.json (what's done, what's next)     │
    │  5. Agent checks git log (recent changes)                        │
    │                                                                  │
    │  SELECT                                                          │
    │                                                                  │
    │  6. Agent picks exactly ONE unfinished feature                   │
    │  7. Agent works only on that feature                             │
    │                                                                  │
    │  EXECUTE                                                         │
    │                                                                  │
    │  8. Agent implements the feature                                 │
    │  9. Agent runs verification (tests, lint, type-check)            │
    │  10. If verification fails: fix and re-run                       │
    │  11. If verification passes: record evidence                     │
    │                                                                  │
    │  WRAP UP                                                         │
    │                                                                  │
    │  12. Agent updates claude-progress.md                            │
    │  13. Agent updates feature_list.json                             │
    │  14. Agent records what's still broken or unverified             │
    │  15. Agent commits (only when safe to resume)                    │
    │  16. Agent leaves clean restart path for next session            │
    │                                                                  │
    └──────────────────────────────────────────────────────────────────┘

    The harness governs every transition in this lifecycle.
    The model decides what code to write at each step.
    Without the harness, step 9 becomes "agent says it looks fine."
    With the harness, step 9 is "tests pass, lint is clean, types check."

Đây là dành cho ai

Khóa học này dành cho:

  • Các kỹ sư đã sử dụng tác nhân mã hóa muốn có chất lượng và độ ổn định tốt hơn
  • Các nhà nghiên cứu hoặc nhà xây dựng muốn có sự hiểu biết có hệ thống về thiết kế dây nịt
  • Lãnh đạo công nghệ cần hiểu cách thiết kế môi trường ảnh hưởng đến hiệu suất của tổng đài viên

Khóa học này không dành cho:

  • Những người đang tìm kiếm phần giới thiệu về AI không mã
  • Những người chỉ quan tâm đến lời nhắc và không có kế hoạch triển khai thực tế
  • Người học chưa sẵn sàng để các tác nhân làm việc bên trong kho thực

Yêu cầu

Đây là khóa học nơi bạn thực sự chạy các tác nhân mã hóa.

Bạn cần ít nhất một trong những công cụ sau:

  • Claude Code
  • Codex
  • Một tác nhân mã hóa IDE hoặc CLI khác hỗ trợ chỉnh sửa tệp, thực thi lệnh và các tác vụ nhiều bước

Khóa học giả định bạn có thể:

  • Mở một kho lưu trữ cục bộ
  • Cho phép đại lý chỉnh sửa tập tin
  • Cho phép tác nhân chạy lệnh
  • Kiểm tra đầu ra và chạy lại các tác vụ

Nếu không có công cụ như vậy, bạn vẫn có thể đọc nội dung khóa học nhưng sẽ không thể hoàn thành các dự án như dự định.


Xem trước cục bộ

Kho lưu trữ này sử dụng VitePress làm trình xem tài liệu.

npm install
npm run docs:dev        # Dev server with hot reload
npm run docs:build      # Production build
npm run docs:preview    # Preview built site

Sau đó mở URL cục bộ mà VitePress xuất ra trong trình duyệt của bạn.


Điều kiện tiên quyết

bắt buộc:

  • Làm quen với terminal, git và môi trường phát triển cục bộ
  • Khả năng đọc và viết mã trong ít nhất một ngăn xếp ứng dụng chung
  • Kinh nghiệm gỡ lỗi phần mềm cơ bản (đọc nhật ký, kiểm tra và hành vi thời gian chạy)
  • Đủ thời gian để cam kết thực hiện các khóa học tập trung vào việc thực hiện

Hữu ích nhưng không bắt buộc:

  • Trải nghiệm với Electron, ứng dụng dành cho máy tính để bàn hoặc các công cụ ưu tiên cục bộ
  • Nền tảng về thử nghiệm, ghi nhật ký hoặc kiến trúc phần mềm
  • Đã từng tiếp xúc với Codex, Claude Code hoặc các tác nhân mã hóa tương tự

Tài liệu tham khảo cốt lõi

Tiểu học:

Xem danh sách tham khảo nhiều lớp đầy đủ trong docs/en/resources/reference/.


Cấu trúc kho lưu trữ

learn-harness-engineering/
├── docs/                          # VitePress documentation site
│   ├── lectures/                  # 14 lectures (index.md + code/ examples)
│   │   ├── lecture-01-*/
│   │   └── ... (14 total)
│   ├── projects/                  # 8 project descriptions
│   │   ├── project-01-*/
│   │   └── ... (8 total)
│   └── resources/                 # Multilingual templates & references (14 languages)
│       ├── en/
│       └── ... (14 total)
├── projects/
│   ├── shared/                    # Shared Electron + TypeScript + React foundation
│   └── project-NN/                # Per-project starter/ and solution/ directories
├── skills/                        # Reusable AI agent skills
│   └── harness-creator/           # Harness engineering skill
├── tools/                         # Zero-dependency shell utilities
│   └── audit-harness.sh           # Shell-based harness audit (L03–L12, no Node.js needed)
├── package.json                   # VitePress + dev tooling
└── CLAUDE.md                      # Claude Code instructions for this repo

Khóa học được tổ chức như thế nào

  • Mỗi bài giảng tập trung vào một câu hỏi
  • Khóa học bao gồm 8 dự án
  • Mọi dự án đều yêu cầu đại lý phải làm việc thực tế
  • Mọi dự án đều so sánh kết quả khai thác yếu và khai thác mạnh
  • Điều quan trọng là sự khác biệt được đo lường chứ không phải có bao nhiêu tài liệu được viết

Kỹ năng

Kho lưu trữ này cũng bao gồm các kỹ năng tác nhân AI có thể tái sử dụng mà bạn có thể cài đặt trực tiếp vào không gian làm việc của tác nhân hoặc IDE của mình.

  • người sáng tạo khai thác: Một kỹ năng giúp bạn tạo dựng dây nịt cấp sản xuất cho dự án của riêng bạn trong vài phút.

Công cụ

Bạn có thể chạy các tiện ích không phụ thuộc mà không cần cài đặt Node.js.

  • kiểm toán-khai thác.sh: Tập lệnh kiểm tra dựa trên shell kiểm tra kho lưu trữ hiện có dựa trên tất cả năm hệ thống con khai thác (L03–L12). Thoát 0 khi tất cả các mục QUAN TRỌNG đều vượt qua. Không cần Node.js — bổ sung harness-creatorcủa validate-harness.mjs.
# Run directly on any repo
curl -fsSL https://raw.githubusercontent.com/walkinglabs/learn-harness-engineering/main/tools/audit-harness.sh | bash -s -- /path/to/your/repo

# Or after cloning
bash tools/audit-harness.sh /path/to/your/repo

Các khóa học khác

Nhóm của chúng tôi cũng đã tạo ra các khóa học khác! Kiểm tra chúng:

Hands-on Modern RL

RL hiện đại thực hành: Một chương trình giảng dạy thực hành, mã nguồn mở thu hẹp khoảng cách từ các khái niệm RL cơ bản đến căn chỉnh LLM, RLVR và các hệ thống Agentic nâng cao.

Modern LLM Notebook

Máy tính xách tay LLM hiện đại: Khóa học thực hành để xây dựng LLM hiện đại từ đầu trong PyTorch, với 23 Notebook Jupyter có thể chạy được bao gồm các mã thông báo, sự chú ý, MoE, RLHF, suy luận, đánh giá và chắt lọc.


Lời cảm ơn

Khóa học này được lấy cảm hứng và rút ra ý tưởng từ học-Claude-code — hướng dẫn tiến bộ để xây dựng một tác nhân từ đầu, từ một vòng lặp duy nhất đến thực thi tự động biệt lập.

Dự án cùng danh mục

obra/superpowers

Khung kỹ năng tác nhân và phương pháp phát triển phần mềm hoạt động.

277k25k5 ngày trước
GitHubAgentic / Đa tác tửShell

Significant-Gravitas/AutoGPT

AutoGPT là tầm nhìn về AI có thể truy cập được cho mọi người, sử dụng và xây dựng. Sứ mệnh của chúng tôi là cung cấp các công cụ để bạn có thể tập trung vào những vấn đề quan trọng.

187k46k4 giờ trước
GitHubAgentic / Đa tác tửPython

microsoft/markitdown

Công cụ Python để chuyển đổi tập tin và tài liệu văn phòng sang Markdown.

176k13k5 ngày trước
GitHubAgentic / Đa tác tửPython

langgenius/dify

Xây dựng quy trình làm việc Agentic, quy trình RAG, với mô hình AI phong phú và hỗ trợ công cụ trên một không gian làm việc cộng tác. Triển khai trên đám mây, VPC hoặc tự lưu trữ để các nhóm chuyển từ nguyên mẫu sang sản xuất mà không cần xây dựng lại ngăn xếp.

153k24k8 giờ trước
GitHubAgentic / Đa tác tửTypeScript

langchain-ai/langchain

Nền tảng kỹ thuật đại lý.

145k24k30 phút trước
GitHubAgentic / Đa tác tửPython

anthropics/claude-code

Claude Code là một công cụ mã hóa tác nhân nằm trong thiết bị đầu cuối của bạn, hiểu cơ sở mã của bạn và giúp bạn viết mã nhanh hơn bằng cách thực thi các tác vụ thông thường, giải thích mã phức tạp và xử lý quy trình công việc git - tất cả đều thông qua các lệnh ngôn ngữ tự nhiên.

143k23k1 ngày trước
GitHubAgentic / Đa tác tửPython