Evaluasi agent adalah unit test yang baru
Anda tidak akan merge kode tanpa test. Berhenti mengirim perubahan agent tanpa eval.
Apa yang terjadi
Perilaku agent tidak deterministik, sehingga satu ubahan prompt yang memperbaiki satu kasus bisa diam-diam merusak tiga kasus lain. Tim tanpa eval suite mengetahuinya dari tiket support, berminggu-minggu kemudian.
Mengapa penting bagi tim deployment
Eval suite mengubah prompt engineering dari opini menjadi rekayasa. Dengan 30 sampai 50 skenario representatif yang diskor di setiap perubahan, Anda benar-benar bisa menyatakan apakah sebuah modifikasi merupakan peningkatan.
Yang bisa dilakukan sekarang
Mulailah dari kegagalan yang sudah Anda lihat. Tulis masing-masing sebagai skenario dengan kondisi lulus yang eksplisit, pasang ke CI, dan tolak merge perubahan agent yang menurunkan skor tanpa alasan tertulis.
Yang bisa Anda lakukan sekarang
- Kumpulkan 30-50 skenario nyata, bukan ideal sintetis
- Skor setiap perubahan prompt di CI
- Anggaplah penurunan skor sebagai build yang gagal
Sumber: Seed · Field Notes