Selepas Ejen AI Dilancarkan, Siapa yang Memerhatikannya? Papan Pemuka Tiga Lapis Kebolehcerapan, Penilaian dan Satah Kawalan

Syarikat di Malaysia mula menolak ejen AI ke persekitaran produksi tahun ini, kemudian terlanggar masalah yang sama: apabila berlaku masalah tidak tahu cara menjejaknya kembali. Artikel ini menghurai tiga lapis alat yang terbentuk pada 2026 — penjejakan, penilaian, tadbir urus semasa pelaksanaan, dan menjelaskan skala mana patut memasang lapisan mana.

Pukul sembilan pagi, ketua teknikal sebuah e-dagang di Kuala Lumpur membuka Slack, melihat mesej yang dihantar jabatan khidmat pelanggan malam tadi: ada pelanggan berkata AI khidmat pelanggan berjanji memberinya bayaran balik penuh kos penghantaran, tetapi dasar syarikat jelas-jelas potong separuh sahaja. Dia mahu menyemak rekod, kemudian mendapati satu perkara yang sangat memalukan — mereka hanya menyimpan balasan terakhir perbualan, manakala alat mana yang dipanggil ejen di tengah, data apa yang dilihatnya, mengapa ia membuat pertimbangan itu, semuanya tidak disimpan.

Ini bukan masalah satu syarikat. Pada separuh pertama 2026, sekumpulan syarikat di Malaysia menolak ejen AI daripada POC ke persekitaran produksi, kemudian secara beramai-ramai terlanggar dinding yang sama: ejen sudah boleh membuat keputusan, tetapi tiada siapa dapat melihat cara ia membuat keputusan itu.

Latar Belakang

Dua tahun lepas, bentuk aplikasi AI berubah. Pada 2024 yang dibuat semua orang ialah chatbot, masuk satu ayat, keluar satu ayat, salah tanya semula, kosnya pengguna menaip beberapa perkataan tambahan. Pada 2026 yang dibuat semua orang ialah ejen: ia akan memanggil API, menulis ke pangkalan data, menghantar e-mel kepada pelanggan, membelanjakan wang untuk membeli perkhidmatan.

Kos kesilapan oleh itu benar-benar berbeza. Chatbot salah jawab ialah memalukan, ejen salah buat ialah kerugian.

Pasaran alat turut berpecah. Product Hunt dalam masa seminggu pada Ogos 2026 sudah muncul tiga produk berkaitan — Traccia membuat satah kawalan ejen, Lenz membuat API semakan fakta bebas, bitdrift membuat kebolehcerapan masa nyata di bahagian mudah alih. Ini bukan kebetulan, tetapi keperluan yang sama muncul di sudut yang berbeza.

Perkara Utama Kali Ini: Papan Pemuka Tiga Lapis

Memerhatikan kumpulan alat ini, boleh disusun tiga lapisan. Masalah yang diselesaikannya berbeza, dan masa patut memasangnya juga berbeza.

Lapisan pertama: Penjejakan (Tracing)

Merekodkan setiap langkah pelaksanaan ejen — input apa yang diterima, penaakulan apa yang dibuat, alat mana yang dipanggil, hasil apa yang diperoleh, berapa kali dicuba semula, dan output akhir apa.

Kata kunci lapisan ini ialah 'lengkap'. Merekod hasil akhir sahaja tiada gunanya, kerana lapan puluh peratus masalah ejen berlaku di tengah. SDK Traccia dibina di atas OpenTelemetry, tepat supaya data ini boleh disambung ke sistem kebolehcerapan sedia ada pasukan, dan bukan menambah satu lagi pulau terpencil.

Lapisan kedua: Penilaian (Evaluation)

Ada satu set data ujian tetap dan pemberi markah, dan setiap kali selepas perubahan dijalankan sekali untuk mendapat markah yang boleh dibandingkan.

Lapisan ini menyelesaikan 'saya ubah prompt, sebenarnya jadi lebih baik atau lebih teruk'. Pasukan yang tiada penilaian, mengubah prompt sepenuhnya mengikut rasa, dan menjelang versi kelima sudah tiada siapa ingat versi kedua sebenarnya lebih baik.

Lapisan ketiga: Tadbir Urus Semasa Pelaksanaan (Runtime Governance)

Memintas pada saat ejen bertindak: melarang memanggil perkhidmatan luar tertentu, menghentikan apabila melebihi had kos, output mesti lulus pemeriksaan baru dibenarkan, tindakan berisiko tinggi memerlukan kelulusan manusia.

Perbezaan lapisan ini dengan dua lapisan sebelumnya ialah 'sebelum' dan 'selepas'. Penjejakan dan penilaian kedua-duanya melihat ke belakang, manakala tadbir urus menyekat pada saat itu. Ejen yang menyentuh wang dan menyentuh data pelanggan, lapisan ini tidak boleh diabaikan.

Analisis Kesan Pasaran

Untuk Pengguna di Malaysia

Pengguna biasa tidak akan menyentuh alat ini secara langsung, tetapi akan merasai perbezaannya. AI khidmat pelanggan yang ada lapisan tadbir urus tidak akan berjanji sesuka hati sesuatu yang syarikat tidak mampu buat; yang tiada, anda akan melihat pertikaian di berita seperti 'AI khidmat pelanggan berjanji bayaran balik tetapi syarikat tidak mengakuinya'.

Pengguna Malaysia boleh perhatikan satu isyarat: apabila perkhidmatan AI syarikat tersilap, secepat mana ia dapat memberi anda penjelasan yang konkrit. Yang boleh menjawab 'kami dapati sistem tersilap pertimbangan pada satu langkah tertentu' bermakna ada rekod disimpan di back-end; yang hanya boleh berkata 'ini masalah sistem' kebanyakannya tidak menyimpan apa-apa.

Untuk Aplikasi Perniagaan

Urutan syarikat di Malaysia melaksanakan tiga lapisan ini, pada pandangan saya sepatutnya begini:

Penjejakan dahulu, dan buat sekarang juga. Kos lapisan ini paling rendah — cara paling ringkas ialah menulis konteks lengkap setiap pelaksanaan ejen ke dalam satu jadual data, alat pun tidak perlu dibeli. Yang benar-benar mahal ialah tiada rekod pada hari berlaku masalah.

Penilaian dibina sebelum ejen ketiga dilancarkan. Satu dua ejen masih boleh ditanggung dengan semakan manual, tiga ke atas mustahil. Dan set data penilaian perlu tumbuh daripada kes kegagalan sebenar, yang memerlukan masa untuk terkumpul, jadi terlalu lewat bermula akan tidak sempat.

Tadbir urus dilaksanakan ketika menyentuh wang atau menyentuh data peribadi. Jika ejen anda hanya membantu menyusun dokumen dalaman, lapisan tadbir urus ialah pelaburan berlebihan; jika ia akan menghantar mesej kepada pelanggan, mengendalikan pesanan, mengakses data peribadi, maka itu kos yang perlu.

Dari segi kos perlu bersedia dari segi mental: penjejakan lengkap akan menghasilkan jumlah data yang besar, dan penyimpanan serta pertanyaan kedua-duanya memerlukan wang. Secara praktikal kebanyakan pasukan mengguna strategi berlapis — pelaksanaan biasa hanya menyimpan ringkasan, pelaksanaan luar biasa menyimpan konteks lengkap.

Ada satu lagi perkara yang syarikat Malaysia perlu perhatikan secara khusus: data penjejakan biasanya mengandungi data peribadi. Kandungan soalan pelanggan, maklumat pesanan, cara hubungan semuanya akan direkod lengkap. Tempoh simpanan, region penyimpanan, dan strategi menyahkenal pasti perlu dirancang ketika pelaksanaan, bukan ditampung kemudian.

Untuk Pembangun

Ada dua titik pertimbangan dalam pemilihan alat.

Pertama ialah 'terikat vendor atau tidak'. Jika hari ini anda guna OpenAI, tahun depan mungkin tukar Anthropic atau model sumber terbuka, memilih alat neutral vendor lebih selamat. Vendor-neutral yang diketengahkan Traccia ialah jualan ini, dengan kosnya ia baru dilancarkan pada 2026, kematangannya tidak setanding perintis seperti Langfuse dan LangSmith.

Kedua ialah 'sumber terbuka atau tidak'. SDK sumber terbuka bermakna sebelum melaksanakannya anda boleh melihat dahulu medan apa yang dikumpulnya, dihantar ke mana. Ini sering menjadi kunci lulus atau tidak bagi industri yang ketat dalam semakan keselamatan siber (kewangan, perubatan).

Satu lagi cabang yang patut diperhatikan ialah pengesahan output. Pemikiran API semakan fakta bebas seperti Lenz sangat menarik — ia bukan membiarkan model yang sama menyemak dirinya, tetapi menggunakan model vendor pesaing untuk berdebat silang. Ini menyelesaikan titik buta asas semakan sendiri: model tidak nampak kesilapannya sendiri, kerana kesilapan itu ialah kognisinya sendiri.

Aliran Perkembangan Masa Depan

Saya rasa tiga perkara akan berlaku dalam setahun akan datang.

Penjejakan akan menjadi standard, dan bukan item tambahan. Sama seperti selepas 2015 tiada siapa akan bertanya 'perlu tidak pasang APM', rangka kerja ejen itu sendiri akan membina penjejakan terbina dalam, dan persaingan vendor alat akan beralih ke lapisan analisis dan tadbir urus.

Penilaian akan beralih daripada 'jalankan markah' kepada 'jalankan kes sebenar'. Kini banyak alat penilaian mempunyai bank soalan lalai yang umum dan akademik, tetapi tiada makna secara praktikal. Yang benar-benar berguna ialah 50 kes aduan pelanggan anda sendiri. Alat akan bergerak ke arah 'membantu anda menukar kes kegagalan menjadi set ujian secara automatik'.

Tadbir urus akan didorong peraturan. Kuasa penguatkuasaan Akta AI EU diaktifkan secara rasmi pada Ogos 2026, dan peraturan wilayah lain juga sedang menyusul. Apabila 'anda mesti mampu menjelaskan mengapa AI berbuat begitu' menjadi keperluan undang-undang, satah kawalan berubah daripada mata bonus kepada infrastruktur pematuhan. Pengawal selia kewangan dan pihak berkuasa data peribadi Malaysia lambat-laun akan mempunyai keperluan setara, dan persediaan yang dibuat sekarang tidak akan sia-sia.

TheAI Academy — Rumusan dan Ulasan

Sikap saya terhadap topik ini sangat langsung: penjejakan ialah kewajipan, tadbir urus ialah pilihan.

Bagaimana ketua teknikal e-dagang itu mengendalikannya kemudian? Dia menghabiskan dua hari menulis satu segmen program, menulis konteks lengkap setiap pelaksanaan ejen ke dalam PostgreSQL, termasuk input pengguna, parameter dan nilai balik setiap panggilan alat, penaakulan pertengahan model, dan output akhir. Tanpa membeli sebarang alat, kosnya dua hari jam kerja.

Sebulan kemudian berlaku sekali lagi pertikaian serupa, kali ini dalam sepuluh minit dia menjejaki puncanya: dokumen dasar yang dibaca ejen ialah versi lama tiga bulan lepas. Masalah selesai, dan dia tahu yang perlu dibetulkan ialah penyegerakan dokumen, bukan model.

Inilah perkara penting yang saya mahu sampaikan — anda tidak perlu membeli penyelesaian paling lengkap sejak mula, tetapi anda mesti mula menyimpan data sejak hari pertama. Terlalu ramai pasukan tidak memasang apa-apa dalam tiga bulan menilai alat, kemudian mendapati tangan kosong ketika berlaku masalah pada bulan keempat.

Ulasan: Simpan log dahulu, baru bincang mahu beli set alat yang mana. Daripada tidak buat apa-apa dengan sempurna, lebih baik mula meninggalkan bukti secara kasar.

Cadangan khusus untuk pembaca di Malaysia: jika syarikat anda ada ejen yang akan dilancarkan tahun ini, minggu ini buat satu perkara — sahkan konteks lengkap setiap pelaksanaan disimpan, dan anda tahu ke mana hendak menyemaknya. Perkara ini tidak perlu bajet, tidak perlu mesyuarat, satu petang boleh disiapkan. Menunggu sehingga memerlukannya baru buat, sudah terlambat.

Untuk memahami proses pembinaan ejen dengan lebih lengkap, boleh lihat panduan pembinaan AI Agent; mengenai aspek keselamatan aplikasi LLM, senarai semak keselamatan aplikasi LLM ada item semakan yang lebih terperinci. Untuk mencari alat yang boleh digunakan, halaman alat sudah menyusun kategori rangka kerja pembangunan dan infrastruktur.

Sumber Rujukan

Disusun berdasarkan maklumat awam, dengan fungsi dan harga produk mengikut pengumuman rasmi sebagai rujukan muktamad.

Soalan Lazim

Pasukan kecil hanya ada satu ejen, perlu tidak memasang semua ini?

Lapisan penjejakan perlu, penilaian dan tadbir urus boleh tunggu. Minimum ialah menyimpan input, panggilan alat dan output setiap pelaksanaan ejen, guna pangkalan data atau log awan pun boleh. Jika perkara ini tidak dibuat, pada hari berlaku masalah anda tiada sebarang petunjuk. Penilaian dan satah kawalan biasanya baru berbaloi apabila bilangan ejen melebihi tiga, atau mula menyentuh data pelanggan.

Mengapa tidak boleh bergantung pada panel belakang pembekal LLM sahaja?

Panel belakang pembekal hanya nampak lapisan 'memanggil model', tidak nampak apa keputusan yang dibuat ejen anda sebelum memanggil model, dan alat apa yang dicetuskan selepasnya. Lapan puluh peratus masalah ejen berlaku pada logik orkestrasi dan bukan respons model, jadi melihat log model sahaja sama seperti hanya nampak puncak ais.

Data penjejakan perlu disimpan berapa lama?

Bergantung pada industri anda. Produk SaaS biasa 30 hingga 90 hari cukup untuk menangani kebanyakan keperluan penyahpepijatan; kewangan dan perubatan yang dikawal selia perlu mengikut keperluan pihak berkuasa, mungkin beberapa tahun. Perlu diperhatikan data penjejakan sering mengandungi data peribadi, jadi tempoh simpanan dan strategi menyahkenal pasti perlu dirancang sekali, tidak boleh disimpan tanpa had.

Bagaimana memulakan penilaian supaya tidak menjadi formaliti?

Mulakan daripada satu kes kegagalan sebenar. Simpan input sebenar ejen yang salah jawab minggu lepas, tambah jawapan yang betul, itulah data ujian pertama anda. Selepas terkumpul 20 hingga 50, setiap kali ubah prompt atau tukar model jalankan sekali. Set ujian yang tumbuh daripada kegagalan sebenar jauh lebih berguna daripada mereka bentuk 500 soalan sejak mula.

繁體中文版 →