AI NPC dan Naratif Interaktif: Pengenalan Reka Bentuk Perbualan yang Menghidupkan Watak Permainan
Membolehkan NPC membalas setiap kata-kata pemain secara langsung sememangnya boleh dilakukan dari segi teknikal, tetapi cabarannya terletak pada kos, sela masa (latency), dan memastikan watak itu "tahu bila masanya untuk berdiam diri". Daripada empat blok binaan LLM NPC, cara memilih antara Convai dan Inworld, templat prompt perwatakan, sehinggalah cara mengira kos harian bagi setiap pemain, semuanya dikupas secara mendalam dalam panduan pengenalan ini.
Pada Rabu petang, di bilik mesyuarat sebuah studio permainan video berkapasiti dua puluh orang di Neihu, Taipei, pereka naratif Lin Tzu-hsuan menyerahkan alat kawalan kepada penerbit. Dalam demo tersebut, pemain berkata kepada pemilik kedai minuman: "Hutang adik kau, aku dah bayar." Pemilik kedai terdiam selama dua saat, suaranya menjadi lembut, dan harga minuman diskaun separuh — perbualan ini tiada dalam mana-mana skrip, sebaliknya dijana serta-merta oleh model bahasa. Bilik mesyuarat sunyi selama tiga saat, dan ayat pertama yang keluar daripada mulut penerbit bukanlah "Hebatnya!", tetapi "Berapakah kos untuk satu ayat seperti ini?"
Kedua-dua reaksi ini tepat menggambarkan keseluruhan landskap NPC LLM menjelang tahun 2026: dari segi pengalaman, ia benar-benar satu magis, tetapi dari segi perbelanjaan, ia memerlukan pengiraan yang teliti. Artikel ini mengupas dengan jelas prinsip, alat, cara menulis prompt, serta kos dan latensi yang jarang diceritakan oleh sesiapa.
4 Blok Binaan NPC LLM: Persona, Memori, Pengetahuan, dan Halangan Keselamatan
Memasukkan ChatGPT ke dalam permainan video tidak bermakna anda sudah mempunyai NPC AI. NPC LLM yang boleh dilancarkan sekurang-kurangnya mempunyai empat lapisan. Kad persona (system prompt) menentukan siapa watak itu, nada suara mereka, apa yang mereka tahu, dan apa yang mereka tidak boleh lakukan. Memori membolehkan watak mengingati tindakan terakhir pemain — secara praktikalnya, ia menyimpan ringkasan perbualan ke dalam arkib dan memasukkannya semula ke dalam konteks setiap kali dipanggil, jika tidak, NPC akan bertindak seperti pesakit amnesia. Pangkalan pengetahuan menggunakan RAG untuk menghubungkan tetapan pandangan dunia. Apabila pemain bertanya "Siapa yang menang Perang Utara?", jawapannya diambil daripada dokumen tetapan dan bukannya rekaan model semata-mata. Prinsip ini sama seperti apa itu RAG.
Halangan keselamatan (guardrails) adalah yang paling penting dan paling kerap diabaikan: NPC tidak boleh membocorkan jalan cerita utama (spoilers), tidak boleh ditipu oleh pemain untuk mendedahkan cara menyelesaikan misi, dan tidak boleh dipujuk untuk menyebut kandungan terlarang. Steam juga memerlukan mekanisme pelaporan pemain untuk kandungan yang dijana serta-merta — halangan keselamatan bukanlah pilihan, tetapi syarat untuk disenaraikan.
Cara Memilih Alat: Paket Integrasi Menjimatkan Masa, Sambung Sendiri Menjimatkan Wang
Jika anda mahukan suara, penyelarasan bibir (lip-sync), dan integrasi enjin kesemuanya dalam satu pakej, anda boleh melihat kepada dua syarikat ini.Convai menyediakan SDK untuk Unity dan Unreal, merangkumi perbualan, tindakan, dan suara, serta mempunyai pelan percuma; pelan pembangun bebas berharga USD 29 sebulan, termasuk 3,000 interaksi (di mana 1,500 daripadanya boleh menggunakan model flagship) — memadai untuk peringkat prototaip, tetapi operasi rasmi memerlukan pengiraan semula.Inworld AI telah beralih dalam dua tahun kebelakangan ini kepada AI suara masa nyata dan kerangka kerja pelaksanaan agen, bertukar kepada model harga berasaskan penggunaan. Sintesis suara bermula dari USD 5 setiap juta aksara dengan latensi ditekan di bawah 200 milisaat. Microsoft dan Disney adalah antara pelaburnya, menjadikannya sesuai untuk pasukan dengan keupayaan kejuruteraan yang kukuh.
Bagi drama interaktif berorientasikan naratif, anda boleh melihat Charisma AI, yang menggunakan pendekatan hibrid antara pokok plot dan improvisasi AI. Manakala bagi Character.AI, ia bagus untuk menguji rasa persona dan mencari inspirasi perbualan, tetapi jangan mengharapkan ia disambungkan ke produk rasmi.
Bagi NPC berasaskan teks, menyambungkan API sendiri sebenarnya tidak begitu sukar: OpenRouter membolehkan pertukaran pelbagai model dengan hanya satu kunci, kelajuan inferens Groq sesuai untuk perbualan masa nyata, dan permainan pemain tunggal luar talian bahkan boleh menggunakan Ollama untuk menjalankan model kecil pada komputer pemain dengan kos API sifar. Untuk pengurusan pelbagai model, anda boleh menggunakan antara muka bersatu LiteLLM. Sebelum bermula, anda boleh membaca Panduan Praktikal Rangka Kerja Agen AI.
Reka Bentuk Prompt: Memastikan Watak Kekal pada Persona
Perbezaan terbesar antara prompt NPC dan prompt chatbot ialah: apa yang anda mahukan bukanlah jawapan untuk setiap soalan, tetapi "mengetahui apa yang tidak patut dijawab". Struktur praktikal adalah seperti berikut:
Anda adalah Maldah, pemilik "Anchor Tavern", berusia 52 tahun, seorang balu, bercakap terus-terang dengan dialeg pelabuhan, menjaga air muka tetapi berhati lembut.
【Apa yang anda tahu】 Gosip kedai minuman, khabar angin penyeludupan pelabuhan (hanya mendedahkan kepada pelanggan tetap), hutang arwah suami kepada kapten kapal.
【Apa yang anda tidak tahu】 Politik istana diraja, prinsip sihir, atau apa-apa nama tempat yang belum pernah anda dengar — jika ditanya, katakan tidak tahu dan dilarang mereka-reka cerita.
【Dilarang Sama Sekali】 Mendedahkan rahsia bilik bawah tanah (kecuali pemain menunjukkan cincin kapten), membincangkan dunia di luar permainan, atau mengaku sebagai AI dalam apa jua bentuk.
【Format Output】 Kembalikan JSON:
{"dialogue": "dialog, dalam 50 patah perkataan", "emotion": "pilih antara warm/neutral/hostile",
"action": "give_discount/refuse_service/none"}
Tahap kesukaan pemain:{{affinity}}/100. Apabila di bawah 30, nada menjadi dingin dan lebih berwaspada.
Tiga tip praktikal daripada ujian sebenar. Pertama, outputkan JSON berstruktur supaya log permainan boleh membaca medan emotion dan action untuk memacu ekspresi wajah dan tingkah laku, yang jauh lebih dipercayai daripada menghuraikan bahasa asli. Kedua, "perkara yang tidak diketahui mesti dikatakan tidak tahu" perlu ditulis dengan jelas; jika tidak ditulis, model pasti akan mereka-reka cerita. ketiga, setiap halangan keselamatan mesti disertakan dengan syarat pengecualian, jika tidak, pemain sudah mendapatkan cincin itu pun pemilik kedai masih akan pura-pura tidak tahu. Anda boleh melayari Perpustakaan Prompt untuk lebih banyak contoh persona watak.
Kos dan Latensi: Kira Dulu, Baru Berangan
Mari kita buat pengiraan. Sekali panggilan perbualan NPC, kad persona ditambah ringkasan memori dan sejarah perbualan, input mengambil kira-kira 1,500 token dan output kira-kira 150 token. Menggunakan model flagship, kos sekali panggil adalah sekitar 0.2 hingga 0.5 TWD, kedengaran murah; tetapi apabila didarabkan dengan "100,000 pemain, setiap seorang berbual 30 ayat dengan NPC setiap hari", ia menjadi bil ratusan ribu ringgit sehari. Realiti komersial permainan video ialah reka bentuk berlapis: sembilan puluh peratus perbualan santai menggunakan model kecil yang murah dan pantas (model sumber terbuka di Groq, atau API kos rendah seperti DeepSeek), manakala NPC penting dalam jalan cerita menggunakan model flagship; soalan lazim terus dicache supaya apabila pemain bertanya "Di mana saya berada?", token tidak perlu dibazirkan setiap kali.
Latensi adalah satu lagi tembok halangan. Untuk perbualan teks, pemain boleh bertolak ansur selama semaat; untuk perbualan suara, melebihi 500 milisaat mula terasa janggal. Rantaian lengkap merangkumi tiga bahagian: pengecaman suara, LLM, dan sintesis suara, di mana setiap bahagian mesti distrim: LLM meluah mengikut token, TTS membaca mengikut ayat, jangan tunggu seluruh teks siap baru bersuara. Untuk senario rangkaian yang lemah atau pelayan tergendala, sediakan perbualan pra-tulis sebagai fallback — jika LLM terputus sambungan, NPC sekurang-kurangnya kembali kepada dialog skrip pratetap dan tidak berdiri kaku seperti mengalami kerosakan.
Jawapan arus perdana pada tahun 2026 ialah reka bentuk hibrid: jalan cerita utama kekal ditulis oleh manusia untuk memastikan kualiti naratif; manakala LLM bertanggungjawab untuk perbualan santai sampingan, tindak balas persekitaran, dan soalan bebas daripada pemain. Biarkan AI menambah "rasa bernyawa", bukannya menggantikan penulis skrip.
Kesimpulan dan Ulasan Akademi TheAI
Teknologi untuk NPC LLM sudah tersedia, apa yang sukar ialah disiplin reka bentuk: kad persona mesti menulis "apa yang tidak diketahui", halangan keselamatan mesti mempunyai syarat pengecualian, kos mesti dibahagikan kepada lapisan, latensi mesti distrim, dan kerosakan mesti mempunyai fallback. Jurang antara kekaguman terhadap demo dan kestabilan pelancaran dipisahkan oleh lima tugasan kejuruteraan ini. Bagi mereka yang ingin bermula, mulakan dengan NPC berasaskan teks dan sambungkan API sendiri untuk menjalankan satu watak, barulah tentukan sama ada mahu menggunakan platform bersepadu. Untuk aset seni dan pembangunan keseluruhan, rujuk bersama Panduan Aliran Kerja Seni Permainan AI dan Peta Jalan Membangunkan Permainan Secara Solo.
Ulasan satu ayat: Perkara paling sukar tentang NPC AI bukanlah membolehkan watak berbual tentang apa sahaja, tetapi membolehkannya "tutup mulut pada masa yang betul" — reka bentuk halangan keselamatan adalah kemahiran yang sebenar.
Cadangan khusus untuk pembaca: Pembangun bebas boleh bermula dari NPC teks pemain tunggal, menggunakan Ollama untuk menjalankan model kecil tempatan bagi latihan kos sifar; pasukan sederhana harus menggunakan pelan percuma Convai terlebih dahulu untuk membuat satu hirisan menegak, mengesahkan bahawa pemain benar-benar akan berbual mendalam dengan NPC, barulah membincangkan skala; pengiraan kos mesti menggunakan "kos perbualan pemain sehari", jangan sedapkan hati dengan kos sekali panggil dalam demo.
Soalan Lazim
Adakah kos operasi AI NPC ini sangat mahal?
Kos untuk satu sesi perbualan adalah sekitar beberapa sen sahaja, tetapi jika didarabkan dengan jumlah pemain dan kekerapan perbualan, ia boleh menjadi sangat tinggi. Pendekatan arus perdana adalah dengan menggunakan sistem berlapis: guna model kecil untuk perbualan kosong, model utama hanya untuk jalan cerita penting, dan sediakan cache untuk soalan lazim.
Adakah wajib menggunakan Convai atau Inworld untuk menghasilkan AI NPC?
Tidak semestinya. NPC berasaskan teks boleh dibangunkan sendiri dengan menyambungkan API (OpenRouter, Groq); platform integrasi hanya akan menjimatkan banyak masa apabila anda memerlukan fungsi suara, sinkronisasi pergerakan bibir (lip-sync), dan integrasi yang mendalam dengan enjin permainan.
Bagaimana cara untuk mengelakkan pemain daripada "merosakkan" atau mengeksploitasi NPC?
Tulis larangan dan syarat pengecualian dengan jelas dalam prompt perwatakan, gunakan JSON berstruktur untuk output agar logik permainan dapat memantaunya, jalankan ujian pasukan Merah (red teaming) sebelum pelancaran; pihak Steam juga menetapkan syarat bahawa kandungan yang dijana secara langsung mesti menyediakan mekanisme laporan untuk pemain.
Bolehkah permainan pemain solo (single-player) mempunyai AI NPC?
Boleh. Anda boleh menggunakan Ollama untuk menjalankan model kecil terkuantiti pada komputer pemain secara luar talian (offline) tanpa sebarang kos API; harganya ialah tahap kepatuhan perwatakan agak lemah, pagar keselamatan (guardrails) perlu ditulis dengan lebih ketat, dan dialog pra-tulis harus disediakan sebagai langkah sokongan.