Apabila Anthropic menerbitkan Building Effective Agents pada akhir 2024, ia melakukan sesuatu yang jarang berlaku dalam industri: ia memberikan jurutera satu kosa kata yang dikongsi bersama. Bukannya satu lagi manifesto tentang kecerdasan am buatan (AGI), panduan tersebut menawarkan enam corak jelas untuk menstrukturkan sistem LLM. Setahun setengah kemudian, pada tahun 2026, landskapnya kelihatan sangat berbeza. Model Context Protocol telah menjadi piawaian universal. Claude telah memperoleh keupayaan baharu. Kebanyakan organisasi kini mempunyai sekurang-kurangnya satu ejen yang berjalan dalam pengeluaran. Berdasarkan latar belakang tersebut, adalah wajar untuk bertanya sama ada keenam-enam corak itu masih penting, atau adakah ia sepatutnya disimpan dalam arkib bersama pemberat model (model weights) tahun lepas.
Saya menguji kesemua enam corak tersebut terhadap model tempatan dalam repositori sisi untuk mengetahuinya. Jawapannya ialah ya. Ia masih relevan. Tetapi bukan kerana ia merupakan undang-undang yang tidak boleh diubah. Ia kekal relevan kerana pengalaman pengeluaran selama lapan belas bulan yang lalu telah mengesahkan logik teras rangka kerja tersebut.
Apa yang Sebenarnya Diberikan oleh Rangka Kerja Ini Kepada Kita
Keenam-enam corak tersebut sangat berbaloi untuk diingati: Prompt Chaining, Routing, Parallelization, Evaluator-Optimizer, Orchestrator-Workers, dan Autonomous Agents. Yang terakhir itu pada dasarnya adalah satu gelung di mana model merancang, bertindak, memerhati, dan mengulang sehingga sesuatu syarat dipenuhi.
Ramai jurutera sudah pun melakukan rantaian prom (chaining prompts) atau menyerahkan tugas kepada bebenang pekerja (worker threads) sebelum panduan itu muncul. Apa yang disediakan oleh Anthropic adalah taksonomi. "Ejen" bagi seseorang adalah "aliran kerja" (workflow) bagi orang lain, dan "panggilan alat berbilang langkah" (multi-step tool call) bagi orang ketiga. Panduan tersebut menyusun kekacauan itu ke dalam kategori dengan sempadan yang jelas. Ini membolehkan perbincangan tentang pertukaran (trade-offs) dilakukan tanpa salah faham antara satu sama lain. Dalam bidang yang dibanjiri dengan gimik (hype), bahasa yang tepat adalah sejenis infrastruktur.
Industri Membinanya di Atas, Bukan di Sekelilingnya
Menjelang 2026, kategori-kategori ini telah sebati dalam cara pasukan mereka mereka bentuk sistem. Anthropic masih mengajarkannya dalam kursus Akademi mereka. Kertas penyelidikan dan blog kejuruteraan masih menggunakan enam kategori yang sama untuk menerangkan seni bina baharu. Ketahanan sedemikian adalah luar biasa bagi disiplin yang memperbaharui timbunan teknologinya (stack) setiap suku tahun.
Sebabnya mudah. Industri tidak menggantikan rangka kerja tersebut. Ia membina di atasnya. Alatan baharu seperti MCP dan piawaian Agent Skills yang lebih baharu berfungsi sebagai sistem perpaipan (plumbing). Ia memudahkan penyambungan model ke pangkalan data, mendedahkan alat, atau mengurus keadaan (state). Tetapi ia tidak mengubah logik tentang bila untuk menggunakan router berbanding orchestrator. Paip yang lebih baik tidak menulis semula pelan lantai.
Data pengeluaran pada tahun 2026 mengesahkan perkara ini. Corak penggunaan yang paling biasa ialah panggilan penggunaan alat tunggal yang dipadankan dengan semakan manusia. Yang kedua paling biasa ialah aliran kerja berbilang langkah dengan tepat satu penyerahan (handoff) kepada manusia. Kedua-duanya adalah keturunan langsung daripada Prompt Chaining dan Routing. Gelung autonomi penuh kekal sebagai pengecualian, bukannya peraturan, dalam sistem langsung.
Kesederhanaan Memenangi Pasaran
Nasihat terbaik daripada panduan asal juga merupakan nasihat yang paling kerap diabaikan pada tahun 2024: gunakan corak paling ringkas yang berfungsi. Jangan lancarkan ejen autonomi penuh jika laluan kod tetap (hardcoded path) sudah memadai untuk menyelesaikan tugas tersebut.
Pasaran akhirnya telah menghadam perkara ini. Kebanyakan projek rintis (pilot) ejen masih gagal, dan ia gagal atas sebab yang sama dan boleh diramal. Pasukan menimbunkan abstraksi demi abstraksi sehingga tiada sesiapa yang dapat mengesan sempadan keputusan. Apabila sistem mula menyimpang (drift), proses penyahpepijatan (debugging) menjadi seperti kerja arkeologi. Syarikat yang telah berjaya dalam pengeluaran adalah syarikat yang menunjukkan kesederhanaan. Mereka memilih penggunaan alat satu pusingan (single-turn) sebagai laluan utama. Mereka hanya menambah lapisan penghalaan (routing layer) selepas prom tunggal terbukti tidak konsisten. Mereka menganggap autonomi sebagai liabiliti yang perlu dijustifikasikan, bukannya ciri yang perlu diraikan.
Ini bukan hujah menentang cita-cita. Ia adalah hujah untuk komposisi. Corak-corak ini berfungsi paling baik apabila anda menggabungkannya secara sengaja dan bukannya secara refleks memilih pilihan yang paling kompleks dalam menu.
Di Mana Celah-celah Mula Bocor
Rangka kerja ini bukanlah penyelesaian untuk semua masalah. Terdapat had nyata yang muncul sebaik sahaja anda meninggalkan peringkat prototaip.
For high-frequency, low-cost tasks, deterministic code still wins. An LLM should not be normalizing a CSV column when pandas can do it in milliseconds without hallucinating. Avoid autonomous loops if you cannot define a crisp evaluation goal. Without a clear stopping condition, the model will iterate until it invents a reason to stop. For high-stakes decisions that require external grounding, do not rely solely on the model’s internal knowledge. And watch for bottlenecks in data retrieval. Any pattern that depends on vector search or external APIs can choke if your database is slow or your context window is clogged with irrelevant chunks.
These are not hypothetical edge cases. They are the constraints that separate a working demo from a system that survives the weekend.
A Rigid Check and a Wrong Failure
I learned the practical value of this framework while building my test repository. I was implementing the Evaluator-Optimizer pattern. My evaluator started as a hardcoded regex that scanned the model’s output for specific keywords. The model returned a correct, well-reasoned answer that happened to use synonyms instead of the exact words I was hunting. The evaluator flagged it as a failure.
The model was right. My check was too rigid.
Fixing it required more than expanding a word list. I switched the evaluator itself to an LLM-based judgment. That cost extra tokens and a few more milliseconds, but it restored the evaluation to the right level of abstraction. The pattern itself was sound. I had simply chosen the wrong implementation for the task. That is exactly the kind of mistake the framework is meant to prevent. Some evaluations need code. Others need a model. Knowing which is which is the whole point.
How to Use Them Now
Treat these six patterns as a starting point, not absolute law. Begin with a single prompt. If quality is inconsistent across input types, add a routing layer to send different requests to specialized prompts. If you need multiple independent perspectives before making a call, use Parallelization. If the task is large and divisible, try Orchestrator-Workers. Only reach for the full autonomous loop when the problem space is too wide to pre-map and when you have a reliable
