Claude dành cho Nhà phát triển

Xây dựng Tác nhân AI Mạnh mẽ Chạy lâu dài với Claude: Các Kỹ thuật Harness Đã được Chứng minh

Khám phá các chiến lược khai thác thực tế để làm cho các agent được hỗ trợ bởi Claude đáng tin cậy cho các nhiệm vụ kéo dài. Tìm hiểu các nguyên tắc cốt lõi, các mẫu như planning và thiết lập multi-agent, cùng với các mẹo đánh giá kèm ví dụ code.

A

Andrew Snyder

AI & Automation Editor

December 1, 2025 min read
Share:

Tại Sao Các Agent Chạy Dài Hạn Thường Không Đạt Kỳ Vọng

Các agent AI được hỗ trợ bởi các mô hình ngôn ngữ lớn như Claude xuất sắc trong các nhiệm vụ ngắn, tập trung nhưng gặp khó khăn với các hoạt động kéo dài. Các sai lầm phổ biến bao gồm:

  • Hallucinations và drift: Các mô hình bịa ra sự kiện hoặc lạc đề qua nhiều bước.
  • Context overload: Lịch sử cuộc trò chuyện dài vượt quá giới hạn token, dẫn đến quên chi tiết.
  • Looping behaviors: Các agent bị kẹt lặp lại hành động mà không tiến bộ.
  • Tool misuse: Các cuộc gọi tool không đúng hoặc quá mức dẫn đến lỗi hoặc kém hiệu quả.

Để khắc phục những vấn đề này, các nhà phát triển bọc Claude trong harnesses—các khung cấu trúc thực thi độ tin cậy thông qua kỹ thuật prompting, quản lý trạng thái và cơ chế giám sát. Những thiết lập này biến các agent không ổn định thành các hệ thống đáng tin cậy cho các ứng dụng thực tế như phân tích dữ liệu, tạo mã hoặc tự động hóa quy trình.

Định Nghĩa Harness

Một harness hoạt động như lớp kiểm soát xung quanh các cuộc gọi API của Claude. Nó xử lý:

  • Chuẩn bị và xác thực đầu vào.
  • Phân tích đầu ra và khôi phục lỗi.
  • Duy trì trạng thái qua các tương tác.
  • Điều kiện chấm dứt để ngăn vòng lặp vô tận.

Harnesses tỏa sáng trong môi trường sản xuất bằng cách tăng tỷ lệ thành công từ 20-30% lên hơn 90% cho các nhiệm vụ phức tạp. Chúng nhẹ, thường chỉ vài chục dòng Python, và tích hợp mượt mà với Anthropic SDK.

Để có điểm khởi đầu cơ bản, hãy xem basic harness example.

Các Nguyên Tắc Thiết Yếu Cho Harnesses Hiệu Quả

Các harness tuyệt vời tuân theo những quy tắc đã được kiểm chứng qua thực tế này:

1. Các Bước Nhỏ

Phân chia nhiệm vụ thành các hành động nhỏ dễ quản lý. Thay vì 'Giải quyết toàn bộ vấn đề này,' hãy hướng dẫn: 'Kiểm tra hàng dữ liệu đầu tiên và ghi chú các bất thường.' Điều này giảm thiểu lỗi mỗi bước và đơn giản hóa gỡ lỗi.

Ví dụ: Trong một agent làm sạch dữ liệu, mỗi vòng lặp xử lý 10 hàng, báo cáo phát hiện và chờ phê duyệt.

2. Trạng Thái Rõ Ràng

Duy trì tóm tắt tiến độ rõ ràng, có thể nhìn thấy bởi mô hình. Sử dụng thẻ XML 'state' hoặc đối tượng JSON được cập nhật mỗi chu kỳ.

state = {
    "task": "Analyze sales data",
    "steps_completed": 3,
    "current_focus": "Q1 outliers",
    "artifacts": ["cleaned_q1.csv"]
}

3. Chấm Dứt Có Suy Nghĩ

Xác định tiêu chí thoát rõ ràng, như 'Xuất "DONE" khi hoàn thành' hoặc số vòng lặp tối đa (ví dụ: 20). Giám sát các tín hiệu thành công trong phản hồi.

4. Kỷ Luật Tool

Giới hạn số tool mỗi cuộc gọi (tối đa 3-5), xác thực đầu vào và cung cấp hướng dẫn sử dụng. Sử dụng XML có cấu trúc cho các yêu cầu tool để tránh vấn đề phân tích.

5. Lớp Giám Sát

Thêm cuộc gọi mô hình 'supervisor' để xem xét đầu ra, phát hiện lệch hướng hoặc định tuyến lại.

6. Khả Năng Quan Sát

Ghi log mọi tương tác với dấu thời gian, đầu vào/đầu ra và trạng thái. Các công cụ như LangSmith hoặc Weights & Biases hỗ trợ ở đây.

Harness Pattern 1: Planning Harness

Lý tưởng cho các nhiệm vụ cần chiến lược trước, như lập kế hoạch dự án hoặc dàn ý nghiên cứu.

Cách hoạt động:

  1. Claude tạo kế hoạch từng bước.
  2. Người dùng hoặc harness phê duyệt/sửa đổi.
  3. Thực thi kế hoạch theo thứ tự, tham chiếu dàn ý đầy đủ.

Lợi ích: Giảm các thay đổi giữa nhiệm vụ; tuyệt vời cho tính minh bạch.

Ứng dụng thực tế: Dàn ý chiến dịch tiếp thị—các giai đoạn kế hoạch như 'Audience research' rồi 'Content calendar.'

Khám phá planning harness repo để triển khai. Đoạn prompt chính:

<plan>
<step>1. Review requirements</step>
<step>2. Gather data sources</step>
...
</plan>

Harness Pattern 2: Scratchpad Harness

Hoàn hảo cho các nhiệm vụ nặng về lý luận như chứng minh toán học hoặc gỡ lỗi mã, nơi agent cần không gian để suy nghĩ thành tiếng.

Cơ chế cốt lõi: Dành không gian trò chuyện cho suy nghĩ 'scratchpad', tách biệt khỏi đầu ra cuối cùng.

Quy trình:

  • Bắt đầu với nhiệm vụ.
  • Agent viết suy nghĩ trong <scratchpad>.
  • Tạo hành động hoặc câu trả lời cuối cùng trong các thẻ có cấu trúc.
  • Harness trích xuất và lặp lại.

Mẹo pro: Xoay scratchpad nếu ngữ cảnh phát triển—tóm tắt các cái cũ.

Ví dụ tính diện tích tam giác:

<thinking>Base 3, height 4 → area = 0.5*3*4=6. Confirm units...</thinking>
<answer>6 square units</answer>

Lấy mã từ scratchpad harness.

Harness Pattern 3: Tool-Use Harness

Nâng cao khả năng gọi tool gốc của Claude cho tích hợp như API, cơ sở dữ liệu hoặc thao tác file.

Các bước thiết lập:

  1. Xác định tool với schema rõ ràng (tên, mô tả, đầu vào JSON).
  2. Prompt Claude quyết định sử dụng tool qua XML.
  3. Thực thi tool bên ngoài, đưa kết quả trở lại.
  4. Giới hạn cuộc gọi mỗi lượt để tránh quá tải.

Biến tấu nâng cao: Chọn tool động dựa trên trạng thái.

Ứng dụng: Agent cào web—các tool như 'fetch_url', 'extract_text', 'summarize.'

Ví dụ đầy đủ trong tool-use harness.

Harness Pattern 4: Agentic Planning Harness

Kết hợp lập kế hoạch với thực thi và tự phê bình cho quy trình thích ứng.

Các giai đoạn:

  • Plan: Dàn ý các bước.
  • Execute: Chạy một bước, phản ánh.
  • Critique: Tự đánh giá ("Bước này có thúc đẩy mục tiêu không?"), lập kế hoạch lại nếu cần.

Điều này tạo vòng lặp phản hồi, lý tưởng cho các nhiệm vụ mở như tạo báo cáo.

Thông tin mã:

def agentic_cycle(state, client):
    plan = get_plan(state)
    step_result = execute_step(plan[0], state)
    critique = critique_step(step_result)
    if critique.score < 0.8:
        return refine_plan(plan, critique)
    return state

Khám phá agentic planning harness.

Harness Pattern 5: Multi-Agent Harness

Phân công các nhiệm vụ con cho các agent chuyên biệt (ví dụ: nhà nghiên cứu, nhà văn, biên tập viên) được phối hợp bởi một manager.

Kiến trúc:

  • Manager agent: Phân công nhiệm vụ, tổng hợp đầu ra.
  • Worker agents: Chuyên gia lĩnh vực với prompt/tool tùy chỉnh.
  • Handover protocol: JSON truyền trạng thái giữa các agent.

Khi nào sử dụng: Các pipeline phức tạp như tạo nội dung hoặc đánh giá pháp lý.

Lợi ích: Chuyên môn hóa tăng độ chính xác; song song hóa tăng tốc độ.

Chi tiết triển khai trong multi-agent harness.

Đánh Giá và Tinh Chỉnh Harnesses

Đừng triển khai mù quáng—đo lường bằng evals.

Các Chỉ Số Theo Dõi

  • Tỷ lệ thành công (% nhiệm vụ hoàn thành đúng).
  • Số bước để hoàn thành (hiệu quả).
  • Chi phí mỗi nhiệm vụ.
  • Đánh giá con người cho chất lượng.

Thiết Lập Evals

Sử dụng tập dữ liệu nhiệm vụ (ví dụ: 50-100 ví dụ). Tự động hóa bằng unit test hoặc LLM-as-judge.

Evals khởi đầu:

Vòng lặp lặp lại:

  1. Chạy bộ eval.
  2. Phân tích thất bại (log tiết lộ pattern).
  3. Điều chỉnh prompt, thêm biện pháp bảo vệ.
  4. Đào tạo lại/kiểm tra.

Mẹo pro: A/B test các biến thể harness trên tập con.

Mở Rộng Harnesses Trong Sản Xuất

  • Thực thi async: Sử dụng queue cho agent song song.
  • Caching: Lưu trạng thái/kết quả trung gian.
  • Khôi phục lỗi: Logic thử lại với backoff theo cấp số nhân.
  • Rate limiting: Tôn trọng hạn ngạch API.

Tích hợp với các framework như LangChain hoặc LlamaIndex cho tính năng bổ sung, nhưng bắt đầu đơn giản.

Bằng cách áp dụng các harness này, các đội tại Anthropic đạt độ tin cậy hơn 95% cho các lần chạy agent kéo dài hàng giờ. Thử nghiệm với các repo được cung cấp, thích ứng với trường hợp sử dụng của bạn và lặp lại nghiêm ngặt.

<div style="text-align: center; margin-top: 2rem;"> <a href="https://www.anthropic.com/engineering/effective-harnesses-for-long-running-agents" target="_blank" rel="noopener noreferrer" class="view-full-resource-btn" style="display: inline-block; background-color: #f97316; color: white; padding: 12px 24px; border-radius: 8px; text-decoration: none; font-weight: 600; transition: background-color 0.2s;">Xem Tài Nguyên Đầy Đủ</a> </div>
The #1 Newsletter in AI

Stay ahead of the AI curve

The most important updates, news, and content — delivered in one weekly newsletter.

No spam. Unsubscribe anytime. Privacy policy

AI Agents
Claude
Harness Patterns
Tool Use
Agent Evaluation
ai-agents
A

About Andrew Snyder

AI & Automation Editor

Andrew covers practical AI automation, workflow design, and the tools teams use to streamline everyday operations.

Comments (0)