# Khoá Agentic AI của Andrew Ng: dạy bốn design pattern, nhưng bài học đáng giá nhất là eval

> Ai cũng nhắc tới reflection, tool use, planning và multi-agent, nhưng module về phân tích lỗi mới là phần sát nhất với việc một FDE làm hằng ngày ở chỗ khách hàng.

Bản gốc: https://fdetimes.net/vi/sach-khoa-hoc/khoa-hoc-agentic-ai-deeplearning/

Trên benchmark HumanEval, GPT-4 chạy zero-shot đạt 67,0%. Còn GPT-3.5, một model yếu hơn, được bọc trong một vòng lặp agent thì lên tới 95,1%. Andrew Ng đưa con số này ra trong bài viết trên The Batch ngày 20/3/2024 để chứng minh rằng cách tổ chức công việc quanh model có thể quan trọng ngang với bản thân model.

Bài viết đó là nguồn gốc của bốn design pattern mà nay đã thành một khoá học hoàn chỉnh: **Agentic AI** trên DeepLearning.AI. Tiêu đề dài của khoá kể đủ cả bốn: reflection, tool use, planning và multi-agent workflow. Phần lớn người học sẽ đến vì chúng.

Nhưng nếu bạn đang nhắm tới vai trò FDE, phần đáng học nhất của khoá lại không nằm trong tên khoá.

## Ai dạy, và dạy cho ai?

Andrew Ng là người sáng lập DeepLearning.AI và đồng sáng lập Coursera. Khoá này do chính ông giảng, xếp ở trình độ trung cấp. Trang chính thức không ghi ngày ra mắt, chỉ ghi lần cập nhật gần nhất là 31/8/2026. Coursera cũng đánh dấu khoá vừa được cập nhật vào tháng 9/2026.

Theo yêu cầu đầu vào, bạn cần viết Python ở mức trung cấp để theo kịp phần cài đặt, và hiểu cơ bản về LLM cũng như cách gọi API. Coursera chia khoá thành 5 module và ước tính học trong 2 tuần, mỗi tuần 10 giờ.

Một developer Việt Nam có 2-8 năm kinh nghiệm, đã từng gọi API của một LLM, sẽ không gặp khó ở phần nền tảng.

Khoá định nghĩa agentic AI là một cách xây phần mềm mới, trong đó LLM hoàn thành một phần hoặc toàn bộ các bước của một tác vụ phức tạp. Chữ "một phần" ở đây quan trọng. Không phải hệ thống nào cũng cần agent tự trị hoàn toàn, và các pattern tự trị cao được dồn về module cuối.

## Bốn pattern được sắp theo mức độ tự trị

Trong 5 module, bốn pattern và phần eval trải từ Module 2 đến Module 5. Module 2 dạy reflection. Trong định nghĩa của Ng, đây là lúc LLM xem lại chính sản phẩm của mình để tìm cách cải thiện nó. Module 3 chuyển sang tool use, có cả MCP và code execution.

Module 5 gộp hai pattern còn lại dưới tên "Patterns for Highly Autonomous Agents", gồm planning (LLM tự đề ra và thực thi một kế hoạch nhiều bước để đạt mục tiêu) và multi-agent.

Phần thực hành đi kèm các lab cụ thể. Lab Customer Service Agent dành cho planning, lab Market Research Team dành cho multi-agent, và có thêm một bài về các mẫu giao tiếp giữa các agent.

Nếu muốn làm FDE, lab customer service là chỗ nên bỏ công nhiều nhất, vì đó là một agent có đầu vào, đầu ra rõ ràng, dễ đem ra đo bằng các kỹ thuật của Module 4.

Cách dạy là điểm khác biệt lớn nhất của khoá. Mỗi pattern được dựng bằng Python từ nguyên lý đầu tiên, không dựa vào framework nào. Với FDE, đây là ưu điểm thực sự: ở chỗ khách hàng, bạn thường không được chọn stack, và người hiểu vòng lặp bên dưới mới gỡ lỗi được khi framework không chạy như mong đợi.

**Điểm mấu chốt:** Bốn pattern giúp bạn dựng được agent; Module 4 giúp bạn biết agent đó hỏng ở đâu, và khách hàng trả tiền cho vế sau.

## Vì sao Module 4 mới là kỹ năng đáng tiền?

Module 4 nằm giữa tool use và các pattern tự trị cao, và nội dung của nó khác hẳn phần còn lại. Module này dạy eval, error analysis, đánh giá theo từng thành phần, đo độ trễ và chi phí. Một bài trong đó bàn về phân tích lỗi rồi xếp ưu tiên cho bước tiếp theo.

Đây là phần gần với công việc FDE nhất. Thử hình dung bạn đã deploy một agent customer service cho một ngân hàng, và nó trả lời sai 15% số câu hỏi. Biết thêm một pattern không giúp gì nhiều ở thời điểm đó.

Bạn cần biết lỗi nằm ở bước truy xuất, bước gọi tool hay bước lập kế hoạch, sửa chỗ nào trước thì lợi nhất, và mỗi lần sửa làm độ trễ cùng chi phí thay đổi ra sao. Cách làm đơn giản nhất là lấy một mẫu các lần chạy lỗi và gán từng lần cho thành phần gây ra nó.

Bảng dưới đây là một ví dụ giả định với 20 lần chạy lỗi của agent ngân hàng nói trên.

| Thành phần | Ví dụ lỗi (giả định) | Số lần / 20 |
| --- | --- | --- |
| Truy xuất | Lấy nhầm biểu phí của năm trước | 9 |
| Gọi tool | Truyền sai định dạng số tài khoản vào API tra cứu | 7 |
| Lập kế hoạch | Bỏ qua bước xác minh danh tính trước khi trả lời | 4 |

Đọc bảng này, việc nên sửa trước là bước truy xuất, vì nó chiếm gần một nửa số lỗi. Thêm một vòng reflection lên toàn bộ agent có thể trông hấp dẫn hơn, nhưng sẽ tốn thêm độ trễ và chi phí cho cả những bước vốn đang chạy đúng.

Con số 95,1% của Ng cũng nên được đọc theo hướng này. Một vòng lặp agent có thể kéo model yếu vượt model mạnh, nhưng chỉ khi bạn đo được để biết vòng lặp đó thực sự đang giúp. Không có eval, bạn khó biết reflection hay planning có giúp gì cho hệ thống của mình hay không.

## Nên học theo thứ tự nào?

Trước khi đăng ký, nên đọc bài The Batch năm 2024 để thấy bốn pattern được đặt ra để giải quyết vấn đề gì. Sau đó cứ đi theo thứ tự khoá đã sắp, từ reflection và tool use rồi mới tới các pattern tự trị cao, vì càng về sau agent càng nhiều bước và càng khó gỡ lỗi.

Riêng Module 4 nên dành nhiều thời gian hơn mức Coursera ước tính, và nên áp các kỹ thuật của nó ngược lại lên những agent bạn đã dựng ở Module 2 và 3.

Khi đưa khoá học vào CV, đừng chỉ ghi tên chứng chỉ. Hãy biến lab Customer Service Agent thành một project trên GitHub, kèm một bảng phân tích lỗi như ví dụ ở trên: bao nhiêu lần chạy, lỗi rơi vào thành phần nào, bạn sửa gì trước và vì sao.

Viết code từ nguyên lý đầu tiên như khoá dạy cũng cho nhà tuyển dụng thấy bạn mang được pattern sang bất kỳ stack nào.

Khi đọc JD của một vị trí FDE, hãy tìm các chữ "evaluation", "error analysis" hoặc "latency and cost". Một project có bảng phân tích lỗi như vậy trả lời trực tiếp cho những yêu cầu đó.

Bốn pattern sẽ còn thay đổi theo từng thế hệ model. Thói quen đo trước rồi mới sửa thì vẫn dùng được, dù model nào thắng ở benchmark tiếp theo.

**Thử ngay tuần này:**

- Đọc bài The Batch ngày 20/3/2024 của Andrew Ng trước khi đăng ký, để biết bốn pattern bắt nguồn từ đâu
- Lấy một prompt bạn đang dùng ở công việc, viết vòng lặp reflection bằng Python thuần không framework, rồi so sánh output trước và sau
- Với một agent nhỏ đã xây, ghi lại 20 lần chạy lỗi vào bảng, phân loại theo thành phần gây lỗi và chọn ra một lỗi để sửa trước

## Nguồn

- [Build agentic design patterns: reflection, tool use, planning, and multi-agent workflows](https://www.deeplearning.ai/courses/agentic-ai/)

- [dlai agentic ai](https://www.coursera.org/learn/dlai-agentic-ai)

- [How Agents Can Improve LLM Performance](https://www.deeplearning.ai/the-batch/how-agents-can-improve-llm-performance/)
