Chat dengan AI Makin Panjang, Hasilnya Makin Melenceng: Kapan Sebaiknya Kamu Mulai Sesi Baru
Riset Microsoft dan Salesforce terhadap lebih dari 200.000 simulasi percakapan menemukan performa AI turun rata-rata 39 persen saat instruksi diberikan sedikit demi sedikit dalam satu chat panjang. Kabar baiknya, solusinya sederhana: tahu kapan harus berhenti menambal dan mulai sesi baru.

Pernah mengalami ini? Di awal, AI langsung paham permintaan kamu. Lalu kamu minta revisi kecil, tambah satu fitur, ganti warna tombol, perbaiki satu error. Setelah puluhan pesan, AI mulai melupakan keputusan yang sudah disepakati, memperbaiki satu hal tapi merusak hal lain, atau terus mengulang solusi yang jelas tidak berhasil.
Ternyata ini bukan perasaan kamu saja. Menurut riset tim Microsoft Research dan Salesforce Research berjudul LLMs Get Lost in Multi-Turn Conversation, yang dipresentasikan di konferensi ICLR 2026, semua model AI papan atas yang mereka uji bekerja jauh lebih buruk ketika instruksi diberikan bertahap dalam satu percakapan panjang dibandingkan ketika semua instruksi diberikan sekaligus. Rata-rata penurunannya mencapai 39 persen.
Bukan AI-nya yang jadi bodoh, tapi makin tidak bisa ditebak
Para peneliti menguji model-model besar dalam lebih dari 200.000 simulasi percakapan, mencakup enam jenis tugas termasuk menulis kode. Temuan yang paling menarik ada di detailnya. Kemampuan dasar model hanya turun sekitar 16 persen. Yang melonjak justru ketidakkonsistenannya, naik 112 persen atau lebih dari dua kali lipat.
Artinya, AI masih sanggup menyelesaikan tugasnya. Masalahnya, hasil percakapan panjang menjadi seperti lempar koin. Kadang bagus, kadang melenceng jauh, dan kamu tidak bisa memprediksi mana yang akan muncul.
Riset tersebut juga mengidentifikasi beberapa pola penyebabnya:
Terlalu cepat menyimpulkan. Di awal percakapan, AI sering langsung membuat jawaban lengkap padahal informasinya belum utuh. Asumsi yang dibuat di tahap ini kemudian terbawa terus.
Terpaku pada jawaban lama. Begitu AI salah arah, ia cenderung menambal jawaban sebelumnya alih-alih memulai ulang. Hasilnya makin panjang dan makin berbelit. Para peneliti menyimpulkan bahwa ketika AI salah belok dalam percakapan, ia tersesat dan tidak bisa kembali.
Melupakan bagian tengah. AI cenderung memberi perhatian lebih pada pesan pertama dan pesan terakhir, sementara permintaan yang kamu sampaikan di tengah percakapan lebih mudah terabaikan.
Context window besar tidak otomatis menyelesaikan masalah
Mungkin kamu berpikir model terbaru dengan kapasitas konteks jutaan token sudah kebal terhadap masalah ini. Sayangnya tidak. Studi dari Chroma tentang fenomena yang mereka sebut context rot menguji 18 model, termasuk GPT-4.1, Claude 4, Gemini 2.5, dan Qwen3. Hasilnya, performa semua model menjadi makin tidak andal seiring bertambah panjangnya input, bahkan untuk tugas yang sederhana.
Chroma juga menemukan bahwa informasi yang mirip tapi tidak relevan, yang mereka sebut distractor, memperburuk keadaan. Satu distractor saja sudah menurunkan akurasi, dan empat distractor membuatnya turun lebih jauh lagi. Dalam konteks membangun aplikasi, distractor ini bisa berupa percobaan solusi yang gagal, potongan error lama, atau permintaan yang sudah kamu batalkan tapi masih tersimpan di riwayat chat.
Kesimpulan Chroma cukup tegas: yang menentukan bukan hanya apakah informasi penting ada di dalam konteks, tetapi bagaimana informasi itu disajikan.
Tanda-tanda sudah waktunya mulai sesi baru
Dari pola di atas, ada beberapa sinyal yang bisa kamu jadikan patokan:
AI mengulang solusi yang sama. Kamu sudah bilang cara itu tidak berhasil, tapi AI kembali menawarkan pendekatan yang hampir sama dengan kata-kata berbeda.
Keputusan lama mulai dilanggar. Misalnya kamu sudah sepakat memakai warna tertentu atau struktur menu tertentu, lalu tiba-tiba AI mengubahnya tanpa diminta.
Perbaikan satu hal merusak hal lain. Setiap revisi kecil memunculkan bug baru di bagian yang sebelumnya baik-baik saja.
Kamu sudah meralat lebih dari dua kali untuk masalah yang sama. Ini sinyal paling jelas bahwa percakapan sudah salah arah dan menambal terus hanya akan memperpanjang masalah.
Topiknya sudah berganti. Kalau kamu selesai mengerjakan halaman produk dan mau lanjut ke fitur laporan keuangan, riwayat diskusi soal halaman produk sudah tidak dibutuhkan dan justru menjadi distractor.
Cara memulai ulang tanpa kehilangan progres
Peneliti Microsoft dan Salesforce memberi dua saran praktis untuk pengguna. Pertama, kalau percakapan tidak membuahkan hasil yang diharapkan, memulai percakapan baru dengan informasi yang sama bisa memberi hasil yang jauh lebih baik. Kedua, menggabungkan semua kebutuhan ke dalam satu instruksi utuh terbukti efektif.
Dalam praktiknya, langkahnya bisa seperti ini:
1. Minta AI membuat ringkasan sebelum pindah sesi. Misalnya: "Tolong ringkas apa yang sudah kita kerjakan, keputusan desain yang sudah disepakati, dan masalah yang masih tersisa." Baca ringkasannya dan koreksi kalau ada yang keliru.
2. Buang percobaan yang gagal. Ringkasan untuk sesi baru cukup berisi kondisi terakhir dan tujuan berikutnya. Riwayat solusi yang tidak berhasil tidak perlu dibawa.
3. Tulis ulang permintaan secara utuh. Di sesi baru, sampaikan tujuan, konteks, dan kriteria hasil yang benar dalam satu pesan. Prinsip ini sudah kami bahas lebih detail di artikel Prompt yang Bagus Itu Bukan yang Paling Panjang.
4. Simpan keputusan permanen di tempat yang selalu dibaca AI. Hal seperti gaya bahasa aplikasi, warna brand, atau aturan bisnis sebaiknya tidak bergantung pada riwayat chat yang suatu saat akan kamu tinggalkan.
Penerapannya di TanpaNgoding AI
Di builder TanpaNgoding AI, kamu bisa memulai percakapan bersih kapan saja lewat tombol Sesi Baru. Sesi yang sedang berjalan akan diarsipkan, sementara kode dan isi project kamu tetap utuh, jadi yang di-reset hanya riwayat obrolannya.
Untuk keputusan yang harus terus diingat lintas sesi, gunakan menu Memory di Pengaturan Project. Catatan di sana selalu dibaca agent di awal setiap sesi chat baru, cocok untuk fakta seperti nama bisnis, target pengguna, atau aturan yang tidak boleh dilanggar. Dengan begitu kamu bisa rutin memulai sesi baru tanpa harus menjelaskan ulang semuanya dari nol.
Kebiasaan sederhana ini sering kali lebih berpengaruh daripada mengganti model AI. Satu topik per sesi, ringkas sebelum pindah, dan simpan keputusan penting di Memory. AI-nya tetap sama, tapi hasilnya jauh lebih bisa diandalkan.
Artikel Terkait

Prompt yang Bagus Itu Bukan yang Paling Panjang: Tiga Hal yang Terbukti Bikin AI Paham Maksud Kamu
Riset terhadap 265 percakapan developer dengan ChatGPT menemukan bahwa panjang prompt bukan penentu hasil. Yang menentukan adalah seberapa jelas tujuannya, seberapa lengkap konteksnya, dan apakah kamu memberi tahu AI cara mengecek hasilnya sudah benar.

84% Developer Pakai AI Coding Tools, Tapi Cuma 29% yang Percaya Hasilnya: Ini Kenapa
Survei terbaru Stack Overflow terhadap 49.000 lebih developer menemukan pola aneh: makin banyak yang pakai AI untuk menulis kode, makin sedikit yang percaya hasilnya akurat. Ini yang perlu kamu tahu kalau memakai AI untuk bikin aplikasi sendiri.

Riset ICSE 2026: Muncul Kelas Baru Pembuat Aplikasi yang Bisa Bikin tapi Tidak Bisa Memperbaiki
Sebuah riset yang dipresentasikan di konferensi rekayasa perangkat lunak ICSE 2026 memberi nama untuk fenomena yang selama ini cuma jadi bahan candaan: vulnerable developer class, orang yang sanggup menghasilkan software yang jalan tapi tidak bisa men-debug atau mengamankannya. Amazon sudah lebih dulu merasakan akibatnya, dan solusi yang mereka pilih bukan berhenti memakai AI.

TanpaNgoding AI v2 Resmi Rilis: Bikin Aplikasi Lebih Hemat Token dan Bebas Pilih Teknologi
TanpaNgoding AI v2 bikin proses membuat aplikasi jadi lebih pintar, lebih hemat saldo token, dan nggak lagi terpaku ke satu jenis teknologi. Aplikasi yang sudah online juga lebih aman dari gangguan saat kamu sedang mencoba perubahan baru.

Empat Model AI Besar Rilis dalam Satu Minggu, dan Kenapa Kamu Tidak Perlu Ikut Pusing
Anthropic, Meta, Google, dan OpenAI sama-sama merilis model baru dalam satu minggu awal September. CNBC menyebut pembeli di perusahaan sudah terlalu lelah untuk membandingkannya, dan tiga tabel benchmark yang terbit di minggu yang sama masing-masing menempatkan vendornya sendiri di posisi teratas.

Enam Jam dari Prompt ke Serangan: Laporan Google soal Peretas yang Menyerahkan Pekerjaan ke AI Agent
Google Threat Intelligence Group melaporkan satu kelompok peretas berhasil merancang, membangun, dan menjalankan kampanye pencurian kredensial berskala besar dalam waktu kurang dari enam jam, cukup bermodal chatbot AI dan satu set instruksi. Pertahanan lama yang mengandalkan lambatnya penyerang jadi tidak relevan.