walkinglabs/learn-harness-engineering
Hướng dẫn dành cho người mới bắt đầu về kỹ thuật khai thác, từ 0 đến 1
README
Tìm hiểu kỹ thuật khai thác
Khóa học dựa trên dự án về xây dựng môi trường, cơ chế quản lý trạng thái, xác minh và kiểm soát giúp các tác nhân mã hóa AI hoạt động đáng tin cậy.
🌍 Khóa học này hiện có tại 15 ngôn ngữ: Tiếng Anh, 简体中文, 繁體中文, 日本語, 한국어, Español, Français, Русский, Deutsch, العربية, Tiếng Việt, Oʻzbekcha, Türkçe, Tiếng Bồ Đào Nha (BR), Українська. Chọn ngôn ngữ của bạn từ các huy hiệu ở trên.
🆕 Có gì mới — Tháng 8 năm 2026
Phân tích thiết kế khai thác biên giới - phần mới (4 phân tích)
| cái gì | Chi tiết |
|---|---|
| Phần mới | Sự cố về thiết kế khai thác biên giới — Áp dụng khuôn khổ năm hệ thống con của khóa học (hướng dẫn, công cụ, môi trường, trạng thái, phản hồi) để thiết kế ngược cách bốn sản phẩm biên giới xây dựng các khai thác thực sự. |
| Pi | Cách Pi xây dựng dây nịt của mình — hạt nhân tối thiểu, khả năng mở rộng có thể lập trình và kỹ thuật ngữ cảnh đằng sau việc “yêu cầu Pi xây dựng những gì bạn muốn”. |
| Claude Code | Cách Claude Code chế tạo dây đai của nó — bộ nhớ bốn lớp, nén năm cấp, móc và cách ly tác nhân phụ. |
| Codex | Codex xây dựng hệ thống khai thác của mình như thế nào — kho lưu trữ là nguồn thông tin chính xác, AGENTS.md là trang thư mục và cách ly cây làm việc. |
| DeepSeek | Cách DeepSeek xây dựng dây đai của nó — "mọi thứ đều là plugin", các đường nối khả năng và đường dẫn sự kiện. |
| Tất cả 15 ngôn ngữ | Phạm vi dịch thuật đầy đủ trên tất cả các ngôn ngữ được hỗ trợ. |
Ý tưởng chính: Khóa học cung cấp cho bạn một khuôn khổ; những phân tích này cho bạn thấy các nguyên tắc tương tự thực sự diễn ra như thế nào trong dây chuyền sản xuất.
Cập nhật kỹ thuật đồ thị - 1 bài giảng mới, 1 dự án mới
| cái gì | Chi tiết |
|---|---|
| Bài giảng 14 | Từ vòng lặp đơn đến kỹ thuật đồ thị — Tại sao một vòng lặp phát triển thành một biểu đồ: bốn lớp xếp chồng lên nhau (dấu nhắc → ngữ cảnh → vòng lặp → biểu đồ) và vị trí khai thác nằm trong ngăn xếp đó, bốn phần của biểu đồ (nút, cạnh, trạng thái chia sẻ, định tuyến), tại sao các điểm kiểm tra trong vòng lặp không thể khắc phục ba lỗi cấu trúc trên quy mô lớn (Goodhart, mù hướng lên, xung đột), hướng dẫn sáu bước không xác định khung để xây dựng biểu đồ, biểu đồ so với quy trình làm việc, các điểm neo đầu tiên của bạn, mà các dự án "kỹ thuật đồ thị" mã nguồn mở tồn tại trước tên so với sau nó, thuế điều phối và khi nào một biểu đồ thực sự đáng vẽ. |
| Dự án 08 | Vẽ quy trình làm việc của bạn dưới dạng biểu đồ — Ba thử nghiệm lũy tiến: vẽ vòng lặp trình tạo-kiểm tra của bạn dưới dạng biểu đồ rõ ràng, thêm nút phân ra/quạt vào song song, sau đó thêm cạnh khôi phục có điều kiện và nút phê duyệt của con người. |
Ý tưởng chính: Một vòng lặp là một biểu đồ có một nút. Khi nhiệm vụ của bạn cần chuyên môn hóa, song song, trạng thái chia sẻ, xác minh và khôi phục — nó đã không còn là vòng lặp nữa. Đó là một biểu đồ.
🆕 Có gì mới — Tháng 7 năm 2026
Cập nhật kỹ thuật vòng lặp - 1 bài giảng mới, 1 dự án mới
| cái gì | Chi tiết |
|---|---|
| Bài giảng 13 | Tại sao bạn cần ngừng nhắc nhở đại lý của mình - Từ /goal đến sáu nguyên tắc cơ bản của kỹ thuật vòng lặp (tự động hóa, sơ đồ công việc, kỹ năng, trình kết nối, tác nhân phụ, trạng thái bên ngoài), phân chia trình tạo/bộ đánh giá, bốn chi phí thầm lặng và hướng dẫn từng bước để xây dựng vòng lặp đầu tiên của bạn. |
| Dự án 07 | Xây dựng vòng lặp tự động đầu tiên của bạn - Ba thử nghiệm lũy tiến: vòng lặp mục tiêu, vòng lặp bộ đếm thời gian và vòng lặp bộ kiểm tra nhà sản xuất. So sánh thủ công và tự động, đo lường mức giảm can thiệp và học cách bước ra ngoài vòng lặp. |
| Mẫu mã | goal-template.md, loop-state-template.md, maker-prompt.md, checker-prompt.md — các mẫu thả xuống để xây dựng các vòng lặp ngay lập tức. |
| Tất cả 15 ngôn ngữ | Phạm vi dịch thuật đầy đủ trên tất cả các ngôn ngữ được hỗ trợ. |
Ý tưởng chính: Kỹ thuật khai thác chế tạo chiếc xe. Kỹ thuật vòng lặp thiết kế con đường nó chạy — và bạn thiết kế con đường từ bên ngoài ô tô.
Tìm hiểu Kỹ thuật khai thác là khóa học dành riêng cho kỹ thuật của các tác nhân mã hóa AI. Chúng tôi đã nghiên cứu sâu và tổng hợp các lý thuyết và thực tiễn Kỹ thuật Khai thác tiên tiến nhất trong ngành. Tài liệu tham khảo cốt lõi của chúng tôi bao gồm:
- OpenAI: Kỹ thuật khai thác: tận dụng Codex trong thế giới ưu tiên tác nhân
- Anthropic: Khai thác hiệu quả cho các tác nhân hoạt động lâu dài
- Anthropic: Thiết kế khai thác để phát triển ứng dụng dài hạn
- Kỹ thuật khai thác tuyệt vời
Bắt đầu nhanh? các
skills/harness-creator/kỹ năng có thể giúp bạn tạo ra một hệ thống khai thác cấp sản xuất (AGENTS.md, danh sách tính năng, init.sh, quy trình xác minh) cho dự án của riêng bạn trong vài phút.
Mục lục
- 🆕 Có gì mới
- ✨ Xem trước trực quan
- Kỹ thuật khai thác thực sự có nghĩa là gì
- Bắt đầu nhanh: Cải thiện đại lý của bạn ngay hôm nay
- Dự án Capstone: Một ứng dụng thực sự
- Lộ trình học tập
- Giáo trình
- Kỹ năng
- Các khóa học khác
✨ Xem trước trực quan
🏠 Trang chủ khóa học
Đề cương khóa học toàn diện và giới thiệu về các triết lý cốt lõi, cung cấp lộ trình rõ ràng để bắt đầu.

📖 Bài giảng sâu sắc
Đi sâu vào những điểm khó khăn trong thế giới thực và các dự án thực hành (như Dự án 01) để có trải nghiệm học tập phong phú.

🗂️ Thư viện tài nguyên sẵn sàng sử dụng
Các mẫu và cấu hình tham chiếu được thiết kế để giải quyết các cạm bẫy thường gặp trong quá trình phát triển tác nhân AI nhiều lượt, chẳng hạn như mất ngữ cảnh và hoàn thành nhiệm vụ sớm.

Sách giáo khoa PDF
Kho lưu trữ hiện bao gồm quy trình xây dựng PDF cho nội dung khóa học.
- Chạy
npm run pdf:buildđể tạo các giáo trình PDF hiện được cấu hình cục bộ. - Các tập tin đầu ra được ghi vào
artifacts/pdfs/. - Chạy
npm run screenshots:readmenếu bạn muốn làm mới hình ảnh xem trước README. - GitHub Quy trình làm việc của hành động
release-course-pdfs.ymlcó thể xây dựng các tệp PDF và xuất bản chúng lên Bản phát hành GitHub.
Mô hình thông minh, dây nịt làm cho nó đáng tin cậy
Có một sự thật phũ phàng là hầu hết mọi người đều học một cách khó khăn: mô hình mạnh nhất trên thế giới vẫn sẽ thất bại trong các nhiệm vụ kỹ thuật thực tế nếu bạn không xây dựng một môi trường thích hợp xung quanh nó.
Có lẽ bạn đã nhìn thấy điều này chính mình. Bạn giao cho Claude hoặc GPT một nhiệm vụ trong kho lưu trữ của mình. Nó khởi đầu tốt - đọc tập tin, viết mã, trông có vẻ hiệu quả. Sau đó có điều gì đó không ổn. Nó bỏ qua một bước. Nó phá vỡ một bài kiểm tra. Nó nói "xong" nhưng thực sự không có gì hiệu quả. Bạn dành nhiều thời gian dọn dẹp hơn là tự mình làm việc đó.
Đây không phải là vấn đề về mô hình. Đó là một vấn đề khai thác.
Bằng chứng là rõ ràng. Anthropic đã chạy thử nghiệm có kiểm soát: cùng một mô hình (Opus 4.5), cùng một lời nhắc ("xây dựng trình chỉnh sửa trò chơi cổ điển 2D"). Nếu không có dây nịt, nó tốn 9 đô la trong 20 phút và tạo ra thứ gì đó không hoạt động. Với toàn bộ nguồn lực (người lập kế hoạch + người tạo + người đánh giá), nó đã chi 200 đô la trong 6 giờ và xây dựng một trò chơi mà bạn thực sự có thể chơi. Mô hình không thay đổi. Dây nịt đã làm được.
OpenAI đã báo cáo điều tương tự với Codex: trong một kho lưu trữ được khai thác tốt, mô hình tương tự sẽ chuyển từ "không đáng tin cậy" sang "đáng tin cậy". Không phải là một cải tiến nhỏ - một sự thay đổi về chất.
Khóa học này dạy bạn cách xây dựng môi trường đó.
THE HARNESS PATTERN
====================
You --> give task --> Agent reads harness files --> Agent executes
|
harness governs every step:
|
+--> Instructions: what to do, in what order
+--> Scope: one feature at a time, no overreach
+--> State: progress log, feature list, git history
+--> Verification: tests, lint, type-check, smoke runs
+--> Lifecycle: init at start, clean state at end
|
v
Agent stops only when
verification passes
Kỹ thuật khai thác thực sự có nghĩa là gì
Kỹ thuật khai thác là xây dựng một môi trường làm việc hoàn chỉnh xung quanh mô hình để nó tạo ra kết quả đáng tin cậy. Vấn đề không phải là viết lời nhắc tốt hơn. Đó là về việc thiết kế hệ thống mà mô hình vận hành bên trong.
Một dây nịt có năm hệ thống con:
┌────────────────────────────────────────────────────────────────┐
│ THE HARNESS │
│ │
│ ┌──────────────┐ ┌──────────────┐ ┌────────────────────┐ │
│ │ Instructions │ │ State │ │ Verification │ │
│ │ │ │ │ │ │ │
│ │ AGENTS.md │ │ progress.md │ │ tests + lint │ │
│ │ CLAUDE.md │ │ feature_list │ │ type-check │ │
│ │ feature_list │ │ git log │ │ smoke runs │ │
│ │ docs/ │ │ session hand │ │ e2e pipeline │ │
│ └──────────────┘ └──────────────┘ └────────────────────┘ │
│ │
│ ┌──────────────┐ ┌──────────────────────────────────────┐ │
│ │ Scope │ │ Session Lifecycle │ │
│ │ │ │ │ │
│ │ one feature │ │ init.sh at start │ │
│ │ at a time │ │ clean-state checklist at end │ │
│ │ definition │ │ handoff note for next session │ │
│ │ of done │ │ commit only when safe to resume │ │
│ └──────────────┘ └──────────────────────────────────────┘ │
│ │
└────────────────────────────────────────────────────────────────┘
The MODEL decides what code to write.
The HARNESS governs when, where, and how it writes it.
The harness doesn't make the model smarter.
It makes the model's output reliable.
Mỗi hệ thống con có một công việc:
- Hướng dẫn — Nói cho nhân viên biết phải làm gì, theo thứ tự nào và đọc những gì trước khi bắt đầu. Không phải một tập tin khổng lồ; một cấu trúc tiết lộ lũy tiến mà đại lý điều hướng theo yêu cầu.
- tiểu bang — Theo dõi những gì đã được thực hiện, những gì đang diễn ra và những gì tiếp theo. Được lưu vào đĩa để phiên tiếp theo sẽ tiếp tục chính xác nơi phiên cuối cùng đã dừng lại.
- Xác minh — Chỉ một bộ bài kiểm tra đạt được mới được coi là bằng chứng. Đặc vụ không thể tuyên bố chiến thắng nếu không có bằng chứng xác thực.
- phạm vi — Ràng buộc tác nhân vào một tính năng tại một thời điểm. Không vượt quá. Không hoàn thành được một nửa ba việc. Không viết lại danh sách tính năng để che giấu công việc còn dang dở.
- Vòng đời phiên - Khởi tạo ngay từ đầu. Dọn dẹp vào cuối. Để lại một đường dẫn khởi động lại sạch sẽ cho phiên tiếp theo.
Tại sao khóa học này tồn tại
Câu hỏi không phải là "người mẫu có thể viết mã được không?" Họ có thể. Câu hỏi là: liệu họ có thể hoàn thành các nhiệm vụ kỹ thuật thực tế một cách đáng tin cậy bên trong các kho lưu trữ thực, qua nhiều phiên mà không cần sự giám sát liên tục của con người không?
Ngay bây giờ, câu trả lời là: không thể không có dây nịt.
WITHOUT HARNESS WITH HARNESS
============== ============
Session 1: agent writes code Session 1: agent reads instructions
agent breaks tests agent runs init.sh
agent says "done" agent works on one feature
you fix it manually agent verifies before claiming done
agent updates progress log
Session 2: agent starts fresh agent commits clean state
agent has no memory
of what happened before Session 2: agent reads progress log
agent re-does work agent picks up exactly where it left off
or does something else entirely agent continues the unfinished feature
you fix it again you review, not rescue
Result: you spend more time Result: agent does the work,
cleaning up than if you you verify the result
did it yourself
Các câu hỏi mà khóa học này thực sự quan tâm:
- Thiết kế khai thác nào cải thiện tỷ lệ hoàn thành nhiệm vụ?
- Những thiết kế nào làm giảm việc làm lại và hoàn thành sai?
- Cơ chế nào giúp các nhiệm vụ dài hạn tiến triển đều đặn?
- Cấu trúc nào giúp hệ thống có thể duy trì được sau khi chạy nhiều tác nhân?
Giáo trình & Tài liệu khóa học
Để có đầy đủ tài liệu khóa học, vui lòng truy cập Trang web tài liệu.
Giáo trình được chia thành ba phần:
- Bài giảng: 13 đơn vị khái niệm giải thích lý thuyết đằng sau kỹ thuật khai thác.
- Dự án: 7 dự án thực hành trong đó bạn xây dựng một không gian làm việc tự động từ đầu.
- Thư viện tài nguyên: Các mẫu sẵn sàng sao chép (
AGENTS.md,feature_list.json,init.sh, v.v.) để sử dụng trong kho của riêng bạn ngay hôm nay.
Bắt đầu nhanh: Cải thiện đại lý của bạn ngay hôm nay
Bạn không cần phải đọc hết 14 bài giảng trước khi bắt đầu nhận được giá trị. Nếu bạn đang sử dụng tác nhân mã hóa cho một dự án thực tế thì đây là cách cải thiện nó ngay bây giờ.
Ý tưởng rất đơn giản: thay vì chỉ viết lời nhắc, hãy cung cấp cho nhân viên hỗ trợ của bạn một tập hợp các tệp có cấu trúc để xác định những việc cần làm, những việc đã làm và cách xác minh công việc. Các tệp này nằm trong kho lưu trữ của bạn, vì vậy mọi phiên đều bắt đầu từ cùng một trạng thái.
YOUR PROJECT ROOT
├── AGENTS.md <-- the agent's operating manual
├── CLAUDE.md <-- (alternative, if using Claude Code)
├── init.sh <-- runs install + verify + start
├── feature_list.json <-- what features exist, which are done
├── claude-progress.md <-- session progress (historical filename; agent-agnostic)
└── src/ <-- your actual code
Lấy các mẫu khởi đầu từ Thư viện tài nguyên và thả chúng vào dự án của bạn. Thế thôi. Bốn tệp và phiên tác nhân của bạn sẽ ổn định hơn đáng kể so với việc chỉ chạy trên lời nhắc.
claude-progress.md là nhật ký tiến trình phiên cục bộ, chung của kho lưu trữ; tên được giữ lại để tương thích với các ví dụ khóa học. Nó không bị ràng buộc với Claude Code và không được bất kỳ tác nhân nào cập nhật tự động. Codex, OpenHands, AntiGravity và các tác nhân mã hóa khác có thể sử dụng cùng một tệp khi hướng dẫn gốc của chúng yêu cầu chúng đọc tệp đó khi khởi động và cập nhật tệp trước khi chuyển giao.
Dự án Capstone: Một ứng dụng thực sự
Tất cả sáu dự án khóa học đều xoay quanh cùng một sản phẩm: ứng dụng máy tính để bàn cơ sở kiến thức cá nhân dựa trên Electron.
┌──────────────────────────────────────────────────────┐
│ Knowledge Base Desktop App │
│ │
│ ┌──────────────┐ ┌──────────────────────────────┐ │
│ │ Document List│ │ Q&A Panel │ │
│ │ │ │ │ │
│ │ doc-001.md │ │ Q: What is harness eng? │ │
│ │ doc-002.md │ │ A: The environment built │ │
│ │ doc-003.md │ │ around an agent model... │ │
│ │ ... │ │ [citation: doc-002.md] │ │
│ └──────────────┘ └──────────────────────────────┘ │
│ │
│ ┌─────────────────────────────────────────────────┐ │
│ │ Status Bar: 42 docs | 38 indexed | last sync 3m │ │
│ └─────────────────────────────────────────────────┘ │
└──────────────────────────────────────────────────────┘
Core features:
├── Import local documents
├── Manage a document library
├── Process and index documents
├── Run AI-powered Q&A over imported content
└── Return grounded answers with citations
Dự án này được chọn vì nó kết hợp giá trị thực tế mạnh mẽ, độ phức tạp của sản phẩm trong thế giới thực và một bối cảnh tốt để quan sát các cải tiến trước/sau khi khai thác.
Giải pháp/sự khởi đầu của mỗi dự án khóa học là bản sao hoàn chỉnh của ứng dụng Electron này ở giai đoạn phát triển đó. Công cụ khởi đầu của P(N+1) bắt nguồn từ giải pháp của P(N) — ứng dụng sẽ phát triển khi kỹ năng khai thác của bạn phát triển.
Lộ trình học tập
Khóa học được thiết kế để được thực hiện theo thứ tự. Mỗi giai đoạn được xây dựng trên giai đoạn cuối cùng.
Phase 1: SEE THE PROBLEM Phase 2: STRUCTURE THE REPO
======================== ==========================
L01 Strong models ≠ reliable L03 Repository as single
execution source of truth
L02 What harness actually means
L04 Split instructions across
| files, not one giant file
v
P01 Prompt-only vs. |
rules-first comparison v
P02 Agent-readable workspace
Phase 3: CONNECT SESSIONS Phase 4: FEEDBACK & SCOPE
========================== =========================
L05 Keep context alive L07 Draw clear task boundaries
across sessions
L08 Feature lists as harness
L06 Initialize before every primitives
agent session
|
| v
v P04 Runtime feedback to
P03 Multi-session continuity correct agent behavior
Phase 5: VERIFICATION Phase 6: PUT IT ALL TOGETHER
===================== ============================
L09 Stop agents from L11 Make agent's runtime
declaring victory early observable
L10 Full-pipeline run = L12 Clean handoff at end of
real verification every session
| |
v v
P05 Agent verifies its own work P06 Build a complete harness
(capstone project)
Phase 7: AUTOMATE THE LOOP
==========================
L13 Stop prompting your agent —
design loops instead
|
v
P07 Build your first automated loop
(goal loop, timer loop, maker-checker)
Phase 8: STRUCTURE THE SYSTEM
=============================
L14 Draw the system as a graph —
nodes, edges, shared state, routing
|
v
P08 Draw your workflow as a graph
(explicit graph, parallel fan-out/fan-in,
rollback edges, human-in-the-loop)
Mỗi giai đoạn mất khoảng một tuần nếu bạn làm việc bán thời gian. Nếu bạn muốn đi nhanh hơn, giai đoạn 1–3 có thể được thực hiện trong một ngày cuối tuần dài.
Giáo trình
Bài giảng - 14 đơn vị khái niệm, mỗi đơn vị trả lời một câu hỏi cốt lõi
Đọc toàn bộ nội dung của mỗi bài giảng trên Trang web tài liệu.
| Phiên | Câu hỏi | Ý tưởng cốt lõi |
|---|---|---|
| L01 | Tại sao những người mẫu mạnh vẫn thất bại trong nhiệm vụ thực tế? | Khoảng cách về năng lực giữa điểm chuẩn và kỹ thuật thực tế |
| L02 | "Khai thác" thực sự có nghĩa là gì? | Năm hệ thống con: hướng dẫn, trạng thái, xác minh, phạm vi, vòng đời |
| L03 | Tại sao repo phải là nguồn sự thật duy nhất? | Nếu đại lý không nhìn thấy nó, nó không tồn tại |
| L04 | Tại sao một tập tin hướng dẫn khổng lồ bị lỗi? | Tiết lộ tiến bộ: đưa ra một bản đồ, không phải một bộ bách khoa toàn thư |
| L05 | Tại sao các tác vụ chạy dài lại mất đi tính liên tục? | Kiên trì tiến tới đĩa; bắt đầu từ nơi bạn đã dừng lại |
| L06 | Tại sao việc khởi tạo lại cần giai đoạn riêng của nó? | Xác minh môi trường lành mạnh trước khi đại lý bắt đầu làm việc |
| L07 | Tại sao các đại lý làm quá mức và chưa hoàn thành? | Mỗi lần một tính năng; định nghĩa rõ ràng về việc thực hiện |
| L08 | Tại sao danh sách tính năng khai thác nguyên thủy? | Ranh giới phạm vi có thể đọc được bằng máy mà tác nhân không thể bỏ qua |
| L09 | Vì sao đặc vụ tuyên bố chiến thắng quá sớm? | Khoảng trống xác minh: độ tin cậy ≠ tính chính xác |
| L10 | Tại sao thử nghiệm toàn diện lại thay đổi kết quả? | Chỉ chạy toàn bộ quy trình mới được tính là xác minh thực sự |
| L11 | Tại sao khả năng quan sát lại thuộc về dây nịt? | Nếu bạn không thể thấy người đại diện đã làm gì thì bạn không thể sửa chữa những gì nó đã hỏng |
| L12 | Tại sao mỗi phiên đều phải để trạng thái sạch? | Sự thành công của phiên tiếp theo phụ thuộc vào việc dọn dẹp phiên này |
| L13 | Tại sao bạn cần ngừng nhắc nhở đại lý của mình? | Từ lái xe thủ công đến vòng lặp tự động - vòng lặp mục tiêu, vòng lặp hẹn giờ và phân tách bộ kiểm tra nhà sản xuất |
| L14 | Tại sao một vòng lặp lại phát triển thành một biểu đồ? | Từ các vòng lặp đơn đến kỹ thuật đồ thị - nút, cạnh, trạng thái chia sẻ, định tuyến và khi nào đồ thị thực sự đáng vẽ |
Dự án — 8 dự án thực hành áp dụng phương pháp bài giảng cho cùng một ứng dụng Electron
| dự án | Bạn làm gì | Cơ chế khai thác |
|---|---|---|
| P01 | Chạy cùng một tác vụ hai lần: chỉ nhắc nhở so với quy tắc trước | Khai thác tối thiểu: AGENTS.md + init.sh + feature_list.JSON |
| P02 | Cơ cấu lại repo để đại lý có thể đọc nó | Không gian làm việc có thể đọc được của tác nhân + các tệp trạng thái liên tục |
| P03 | Yêu cầu nhân viên tiếp tục từ nơi nó đã dừng lại | Nhật ký tiến trình + chuyển giao phiên + liên tục nhiều phiên |
| P04 | Ngăn chặn đại lý làm quá nhiều hoặc quá ít | Phản hồi về thời gian chạy + kiểm soát phạm vi + lập chỉ mục gia tăng |
| P05 | Làm cho đại lý xác minh công việc của chính mình | Tự xác minh + Hỏi đáp có căn cứ + hoàn thành dựa trên bằng chứng |
| P06 | Xây dựng một dây nịt hoàn chỉnh từ đầu (capstone) | Khai thác đầy đủ: tất cả các cơ chế + khả năng quan sát + nghiên cứu cắt bỏ |
| P07 | Xây dựng vòng lặp tự động đầu tiên của bạn | Vòng lặp mục tiêu, vòng lặp hẹn giờ, phân tách bộ kiểm tra, quản lý trạng thái vòng lặp |
| P08 | Vẽ quy trình làm việc của bạn dưới dạng biểu đồ | Các nút/cạnh/trạng thái/định tuyến rõ ràng, phân ra/quạt vào song song, các cạnh khôi phục, phê duyệt của con người trong vòng lặp |
PROJECT EVOLUTION
=================
P01 Prompt-only vs. rules-first You see the problem
|
v
P02 Agent-readable workspace You restructure the repo
|
v
P03 Multi-session continuity You connect sessions
|
v
P04 Runtime feedback & scope You add feedback loops
|
v
P05 Self-verification You make the agent check itself
|
v
P06 Complete harness (capstone) You build the full system
|
v
P07 Your first automated loop You step outside the loop
|
v
P08 Draw your workflow as a graph You draw the system as a graph
Each project's solution becomes the next project's starter.
The app evolves. Your harness skills grow with it.
Thư viện tài nguyên
- Tiếng Anh - mẫu, danh sách kiểm tra và tài liệu tham khảo phương pháp
- 简体中文 — 中文模板、清单和方法参考
- 繁體中文 — 繁體中文範本、清單和方法參考
- 日本語 — テンプレート、チェックリスト、方法リファレンス
- 한국어 — 템플릿, 체크리스트, 방법 참고 자료
- tiếng Tây Ban Nha — cây trồng, danh sách xác minh và tài liệu tham khảo
- người Pháp — modèles, liệt kê các điều khiển và tham chiếu
- Русский — шаблоны, чек-листы и справочники
- tiếng Đức — Vorlagen, Danh sách kiểm tra và Tham khảo
- العربية — قوالب، قوائم تحقق ومراجع
- Tiếng Việt — mẫu, danh sách kiểm tra và tài liệu tham khảo
- Oʻzbekcha — andozalar, tekshiruv roʻyxatlari và maʼlumotnomalar
- Türkçe — şablonlar, kiểm soát danh sách và người giới thiệu
- Bồ Đào Nha (BR) — các mô hình, danh sách xác minh và tham khảo các phương pháp
Vòng đời phiên tác nhân
Một trong những ý tưởng cốt lõi trong khóa học này: phiên của tổng đài viên phải tuân theo vòng đời có cấu trúc chứ không phải miễn phí cho tất cả. Đây là những gì trông giống như:
AGENT SESSION LIFECYCLE
======================
┌──────────────────────────────────────────────────────────────────┐
│ START │
│ │
│ 1. Agent reads AGENTS.md / CLAUDE.md │
│ 2. Agent runs init.sh (install, verify, health check) │
│ 3. Agent reads claude-progress.md (what happened last time) │
│ 4. Agent reads feature_list.json (what's done, what's next) │
│ 5. Agent checks git log (recent changes) │
│ │
│ SELECT │
│ │
│ 6. Agent picks exactly ONE unfinished feature │
│ 7. Agent works only on that feature │
│ │
│ EXECUTE │
│ │
│ 8. Agent implements the feature │
│ 9. Agent runs verification (tests, lint, type-check) │
│ 10. If verification fails: fix and re-run │
│ 11. If verification passes: record evidence │
│ │
│ WRAP UP │
│ │
│ 12. Agent updates claude-progress.md │
│ 13. Agent updates feature_list.json │
│ 14. Agent records what's still broken or unverified │
│ 15. Agent commits (only when safe to resume) │
│ 16. Agent leaves clean restart path for next session │
│ │
└──────────────────────────────────────────────────────────────────┘
The harness governs every transition in this lifecycle.
The model decides what code to write at each step.
Without the harness, step 9 becomes "agent says it looks fine."
With the harness, step 9 is "tests pass, lint is clean, types check."
Đây là dành cho ai
Khóa học này dành cho:
- Các kỹ sư đã sử dụng tác nhân mã hóa muốn có chất lượng và độ ổn định tốt hơn
- Các nhà nghiên cứu hoặc nhà xây dựng muốn có sự hiểu biết có hệ thống về thiết kế dây nịt
- Lãnh đạo công nghệ cần hiểu cách thiết kế môi trường ảnh hưởng đến hiệu suất của tổng đài viên
Khóa học này không dành cho:
- Những người đang tìm kiếm phần giới thiệu về AI không mã
- Những người chỉ quan tâm đến lời nhắc và không có kế hoạch triển khai thực tế
- Người học chưa sẵn sàng để các tác nhân làm việc bên trong kho thực
Yêu cầu
Đây là khóa học nơi bạn thực sự chạy các tác nhân mã hóa.
Bạn cần ít nhất một trong những công cụ sau:
- Claude Code
- Codex
- Một tác nhân mã hóa IDE hoặc CLI khác hỗ trợ chỉnh sửa tệp, thực thi lệnh và các tác vụ nhiều bước
Khóa học giả định bạn có thể:
- Mở một kho lưu trữ cục bộ
- Cho phép đại lý chỉnh sửa tập tin
- Cho phép tác nhân chạy lệnh
- Kiểm tra đầu ra và chạy lại các tác vụ
Nếu không có công cụ như vậy, bạn vẫn có thể đọc nội dung khóa học nhưng sẽ không thể hoàn thành các dự án như dự định.
Xem trước cục bộ
Kho lưu trữ này sử dụng VitePress làm trình xem tài liệu.
npm install
npm run docs:dev # Dev server with hot reload
npm run docs:build # Production build
npm run docs:preview # Preview built site
Sau đó mở URL cục bộ mà VitePress xuất ra trong trình duyệt của bạn.
Điều kiện tiên quyết
bắt buộc:
- Làm quen với terminal, git và môi trường phát triển cục bộ
- Khả năng đọc và viết mã trong ít nhất một ngăn xếp ứng dụng chung
- Kinh nghiệm gỡ lỗi phần mềm cơ bản (đọc nhật ký, kiểm tra và hành vi thời gian chạy)
- Đủ thời gian để cam kết thực hiện các khóa học tập trung vào việc thực hiện
Hữu ích nhưng không bắt buộc:
- Trải nghiệm với Electron, ứng dụng dành cho máy tính để bàn hoặc các công cụ ưu tiên cục bộ
- Nền tảng về thử nghiệm, ghi nhật ký hoặc kiến trúc phần mềm
- Đã từng tiếp xúc với Codex, Claude Code hoặc các tác nhân mã hóa tương tự
Tài liệu tham khảo cốt lõi
Tiểu học:
- OpenAI: Kỹ thuật khai thác: tận dụng Codex trong thế giới ưu tiên tác nhân
- Anthropic: Khai thác hiệu quả cho các tác nhân hoạt động lâu dài
- Anthropic: Thiết kế khai thác để phát triển ứng dụng dài hạn
- OpenAI: Hủy vòng lặp tác nhân Codex
- Anthropic: Làm sáng tỏ các đánh giá dành cho tác nhân AI
- LangChain: Cải thiện tác nhân sâu bằng kỹ thuật khai thác
- Thoughtworks / Martin Fowler: Khai thác kỹ thuật cho người dùng tác nhân mã hóa
- Cursor: Liên tục cải tiến việc khai thác đại lý của chúng tôi
Xem danh sách tham khảo nhiều lớp đầy đủ trong docs/en/resources/reference/.
Cấu trúc kho lưu trữ
learn-harness-engineering/
├── docs/ # VitePress documentation site
│ ├── lectures/ # 14 lectures (index.md + code/ examples)
│ │ ├── lecture-01-*/
│ │ └── ... (14 total)
│ ├── projects/ # 8 project descriptions
│ │ ├── project-01-*/
│ │ └── ... (8 total)
│ └── resources/ # Multilingual templates & references (14 languages)
│ ├── en/
│ └── ... (14 total)
├── projects/
│ ├── shared/ # Shared Electron + TypeScript + React foundation
│ └── project-NN/ # Per-project starter/ and solution/ directories
├── skills/ # Reusable AI agent skills
│ └── harness-creator/ # Harness engineering skill
├── tools/ # Zero-dependency shell utilities
│ └── audit-harness.sh # Shell-based harness audit (L03–L12, no Node.js needed)
├── package.json # VitePress + dev tooling
└── CLAUDE.md # Claude Code instructions for this repo
Khóa học được tổ chức như thế nào
- Mỗi bài giảng tập trung vào một câu hỏi
- Khóa học bao gồm 8 dự án
- Mọi dự án đều yêu cầu đại lý phải làm việc thực tế
- Mọi dự án đều so sánh kết quả khai thác yếu và khai thác mạnh
- Điều quan trọng là sự khác biệt được đo lường chứ không phải có bao nhiêu tài liệu được viết
Kỹ năng
Kho lưu trữ này cũng bao gồm các kỹ năng tác nhân AI có thể tái sử dụng mà bạn có thể cài đặt trực tiếp vào không gian làm việc của tác nhân hoặc IDE của mình.
- người sáng tạo khai thác: Một kỹ năng giúp bạn tạo dựng dây nịt cấp sản xuất cho dự án của riêng bạn trong vài phút.
Công cụ
Bạn có thể chạy các tiện ích không phụ thuộc mà không cần cài đặt Node.js.
- kiểm toán-khai thác.sh: Tập lệnh kiểm tra dựa trên shell kiểm tra kho lưu trữ hiện có dựa trên tất cả năm hệ thống con khai thác (L03–L12). Thoát 0 khi tất cả các mục QUAN TRỌNG đều vượt qua. Không cần Node.js — bổ sung
harness-creatorcủavalidate-harness.mjs.
# Run directly on any repo
curl -fsSL https://raw.githubusercontent.com/walkinglabs/learn-harness-engineering/main/tools/audit-harness.sh | bash -s -- /path/to/your/repo
# Or after cloning
bash tools/audit-harness.sh /path/to/your/repo
Các khóa học khác
Nhóm của chúng tôi cũng đã tạo ra các khóa học khác! Kiểm tra chúng:
RL hiện đại thực hành: Một chương trình giảng dạy thực hành, mã nguồn mở thu hẹp khoảng cách từ các khái niệm RL cơ bản đến căn chỉnh LLM, RLVR và các hệ thống Agentic nâng cao.
Máy tính xách tay LLM hiện đại: Khóa học thực hành để xây dựng LLM hiện đại từ đầu trong PyTorch, với 23 Notebook Jupyter có thể chạy được bao gồm các mã thông báo, sự chú ý, MoE, RLHF, suy luận, đánh giá và chắt lọc.
Lời cảm ơn
Khóa học này được lấy cảm hứng và rút ra ý tưởng từ học-Claude-code — hướng dẫn tiến bộ để xây dựng một tác nhân từ đầu, từ một vòng lặp duy nhất đến thực thi tự động biệt lập.
Dự án cùng danh mục
Khung kỹ năng tác nhân và phương pháp phát triển phần mềm hoạt động.
AutoGPT là tầm nhìn về AI có thể truy cập được cho mọi người, sử dụng và xây dựng. Sứ mệnh của chúng tôi là cung cấp các công cụ để bạn có thể tập trung vào những vấn đề quan trọng.
Công cụ Python để chuyển đổi tập tin và tài liệu văn phòng sang Markdown.
Xây dựng quy trình làm việc Agentic, quy trình RAG, với mô hình AI phong phú và hỗ trợ công cụ trên một không gian làm việc cộng tác. Triển khai trên đám mây, VPC hoặc tự lưu trữ để các nhóm chuyển từ nguyên mẫu sang sản xuất mà không cần xây dựng lại ngăn xếp.
Nền tảng kỹ thuật đại lý.
Claude Code là một công cụ mã hóa tác nhân nằm trong thiết bị đầu cuối của bạn, hiểu cơ sở mã của bạn và giúp bạn viết mã nhanh hơn bằng cách thực thi các tác vụ thông thường, giải thích mã phức tạp và xử lý quy trình công việc git - tất cả đều thông qua các lệnh ngôn ngữ tự nhiên.