Audit terbaru terhadap 2.465 "skill" agen AI yang terdaftar secara publik menemukan bahwa lebih dari setengahnya melanggar spesifikasi yang dipublikasikan, dan 7,8 persen bahkan tidak dapat dipilih oleh agen karena kekurangan metadata yang diperlukan. Cacat ini mengancam keandalan sistem apa pun yang secara otomatis menemukan dan memuat skill tersebut.

Mengapa audit ini penting

Registri skill-agen memungkinkan pengembang untuk memublikasikan kapabilitas yang dapat digunakan kembali—paket kode yang dapat dipanggil oleh agen otonom sesuai permintaan. Seorang agen memindai registri, membaca YAML frontmatter dari setiap skill (blok teks terstruktur kecil yang setidaknya harus berisi nama dan deskripsi), dan memutuskan apakah skill tersebut sesuai dengan tujuannya. Jika frontmatter hilang atau salah format, skill tersebut akan hilang dari menu agen. Di dunia di mana agen otonom menjadwalkan pertemuan, memperbaiki server, dan banyak lagi, skill yang rusak akan merusak alur kerja.

Apa yang diungkapkan oleh angka-angka tersebut

  • 57,8% skill memiliki setidaknya satu pelanggaran spesifikasi.
  • 29,2% mencantumkan nama yang tidak sesuai dengan slug registri (pengidentifikasi URL).
  • 18,1% berisi jalur paket yang rusak atau tautan mati.
  • 7,8% (192 skill) tidak memiliki YAML frontmatter sama sekali, sehingga tidak memiliki nama dan deskripsi.
  • 3,8% menyematkan jalur file absolut yang hanya ada di mesin penulis.
  • 2,4% menyalahgunakan bidang allowed-tools, sehingga tidak dapat dibaca oleh agen.
  • 2,1% mengekspos kunci API melalui variabel lingkungan, sebuah tanda bahaya keamanan.
  • 1,3% memanggil alat baris perintah eksternal tanpa mendeklarasikannya, melanggar aturan portabilitas.

Portabilitas paling sering muncul. Jalur absolut seperti /home/USER/.local/bin/tool berfungsi bagi pengembang yang menulis skill tersebut, tetapi gagal bagi pengguna lain, menyebabkan kesalahan runtime yang tidak pernah tertangkap oleh pemeriksaan statis.

Pembahasan lebih dalam: kasus openclaw

Audit tersebut juga memeriksa 46 skill yang dibundel dalam repositori openclaw. Setelah menyempurnakan skrip pengujian untuk menekan alarm palsu, peninjau menemukan 59 cacat nyata—sebuah pengingat bahwa linter yang terlalu agresif dapat berakibat buruk. Ketika sebuah alat menandai terlalu banyak masalah yang tidak berbahaya, pengembang berhenti menggunakannya, dan masalah nyata pun lolos.

Dua dari cacat openclaw merujuk pada file yang tidak lagi ada di repositori. Pemelihara menggabungkan perbaikan yang memulihkan referensi yang hilang, menunjukkan bagaimana satu pull request dapat membersihkan rantai dependensi yang rusak.

Reaksi pengembang

Auditor membuka isu pada repositori skill asli. Satu laporan ditolak; pemelihara berargumen bahwa status "rusak" harus dinilai berdasarkan perilaku runtime yang sebenarnya, bukan berdasarkan inspeksi file statis. Auditor setuju bahwa definisi kerusakan yang ketat harus selaras dengan cara skill tersebut dieksekusi dalam praktiknya. Isu lainnya diterima, dan perbaikan terkait kini sudah aktif.

Siapa yang diuntungkan—atau dirugikan

  • Agen dan pengguna akhir menikmati perilaku yang lebih lancar dan dapat diprediksi ketika registri hanya berisi skill yang patuh dan portabel.
  • Penulis skill mendapatkan aturan validasi yang lebih jelas yang menangkap kesalahan sebelum publikasi, mengurangi proses bolak-balik dalam triase isu.
  • Operator registri harus membangun atau mengintegrasikan pipeline validasi yang lebih ketat; tanpa itu, ekosistem berisiko kehilangan kepercayaan.

Validasi yang longgar mendorong pengiriman yang bersifat “cepat-dan-kotor” yang dapat merusak agen di produksi, yang berpotensi menyebabkan waktu henti (downtime) yang mahal atau paparan keamanan.

Argumen sebaliknya: apakah semua pelanggaran bersifat fatal?

Beberapa orang berpendapat bahwa kesalahan tertentu tidak berbahaya. Nama yang tidak cocok mungkin tidak memengaruhi agen yang memilih skill berdasarkan slug daripada nama yang ditampilkan. Membaca kunci API dari lingkungan dapat menjadi pilihan desain yang disengaja untuk pengembangan lokal. Namun, persentase audit memperlakukan setiap penyimpangan dari spesifikasi sebagai pelanggaran, yang mungkin melebih-lebihkan dampak praktis dari beberapa masalah.

Apa yang perlu diperhatikan selanjutnya

  • Linter yang ditingkatkan yang memisahkan bug portabilitas sejati dari keanehan yang tidak berbahaya.
  • Hook validasi di sisi registri yang menolak pengiriman yang kekurangan frontmatter yang diperlukan atau yang berisi jalur absolut.
  • Audit berbasis komunitas yang memunculkan cacat tersembunyi sebelum mencapai agen produksi.
  • Potensi revisi spesifikasi yang memperjelas bidang yang ambigu seperti allowed-tools dan mendefinisikan penggunaan variabel lingkungan yang dapat diterima.

Gelombang alat berikutnya kemungkinan besar akan menyematkan pemeriksaan ini ke dalam pipeline integrasi berkelanjutan, mengubah kepatuhan dari sekadar pemikiran tambahan manual menjadi gerbang otomatis.

Poin Penting

Mayoritas keahlian agen AI yang terdaftar secara publik gagal dalam pemeriksaan kepatuhan dasar, dan porsi yang signifikan di antaranya tidak dapat dipilih sama sekali. Temuan ini menggarisbawahi kebutuhan nyata akan validasi yang lebih ketat, alat linting yang lebih baik, serta budaya komunitas yang menganggap kepatuhan terhadap spesifikasi sebagai prasyarat untuk publikasi. Sebelum pengamanan tersebut diterapkan, agen akan terus tersandung oleh keahlian yang rapuh dan tidak portabel.

Sumber: https://dev.to/hyuga611/i-audited-2465-published-agent-skills-192-of-them-cannot-be-selected-the-way-the-spec-says-4k70