1. Mengapa gpt-image-2 dan Bagaimana Arsitekturnya?
Model gpt-image-2 menawarkan pemahaman semantik yang superior terhadap detail pencahayaan, tekstur objek, dan gaya artistik dibandingkan generasi sebelumnya. Namun, dalam aplikasi chat berbasis Next.js 16, waktu pembuatan gambar dapat memakan waktu 10 hingga 25 detik.
Untuk mencegah timeout koneksi dan memberikan pengalaman responsif, kami merancang endpoint streaming asinkron di server (/api/images/generate) yang membagi proses menjadi tiga tahapan transparan: optimasi prompt, request generasi gambar, dan transformasi aset di storage.
Pengguna tidak perlu meninggalkan percakapan untuk beralih ke studio terpisah. Prompt teks percakapan biasa dapat langsung dieksekusi menjadi ilustrasi visual dalam alur diskusi yang sama.
2. Prompt Optimizer: Menjembatani Bahasa Indonesia & Nuansa Artistik
Sebagian besar model AI visual dilatih dengan dataset teks bahasa Inggris. Jika pengguna menulis: 'gambar kucing astronot minum kopi di bulan gaya anime', instruksi tersebut sering kali menghasilkan gaya yang terlalu kaku jika diterjemahkan mentah.
Kami membangun modul `prompt-optimizer` yang memanfaatkan model LLM pendamping untuk menganalisis maksud pengguna, menambahkan rincian pencahayaan volumetrik, sudut kamera, serta menyusun negative prompt otomatis untuk mengeliminasi cacat visual seperti distorsi anatomi atau artefak teks acak.
// Cuplikan konfigurasi payload gpt-image-2 di server Soplantila
const payload = {
model: "gpt-image-2",
prompt: optimizedResult.prompt_optimized,
negative_prompt: optimizedResult.negative_prompt,
n: 1,
size: optimizedResult.dimensions, // "1152x2048" (9:16), "1024x1024", atau "2048x1152"
quality: "medium",
response_format: "b64_json",
};3. Penanganan Aspek Rasio & Transformasi Sharp
Kebutuhan konten digital modern sangat beragam: kreator konten membutuhkan rasio vertikal 9:16 untuk story/reels, desainer web membutuhkan 16:9, dan presentasi grafis sering kali memerlukan rasio 1:1.
Setelah menerima payload base64 dari upstream, server Soplantila tidak langsung meneruskannya mentah ke browser. Kami melewatkan buffer gambar ke pipeline pustaka Sharp di runtime Node.js untuk melakukan kompresi WebP efisien. Hasilnya, ukuran file berkurang hingga 45-60% tanpa penurunan kualitas estetika visual.
4. Integrasi Otomatis dengan Pustaka Media
Setiap gambar yang berhasil diciptakan langsung disimpan ke Supabase Storage pada bucket terisolasi dan ditautkan ke ID sesi obrolan pengguna.
Ketika pengguna membuka menu Pustaka Media di sidebar, gambar-gambar ini tampil dalam galeri beresolusi penuh lengkap dengan prompt asli dan prompt teroptimasi, sehingga dapat diunduh atau dirujuk kembali kapan pun diperlukan.
Kesimpulan
Integrasi gpt-image-2 di dalam Soplantila adalah langkah penting dalam mewujudkan ruang eksplorasi cerdas yang terpadu. Kami percaya bahwa kecerdasan buatan terbaik adalah yang mampu menjembatani ide kompleks menjadi hasil nyata secara instan dan mudah diakses oleh siapa saja.
Tim Rekayasa Soplantila
AI Architecture & Engineering • Fokus pada pengembangan multimodal AI dan performa sistem Next.js.