Perbandingan Model AI 2026: Thinking vs Non-Thinking, Multimodal, dan Harga API
Sebagai developer dan peneliti AI, kita kini hidup di era di mana jumlah dan jenis model bahasa besar (LLM) yang tersedia bagi pengguna biasa semakin berlimpah. Setiap bulan, vendor seperti OpenAI, Anthropic, Google, dan lainnya merilis model baru yang menambah kebingungan pilihan. Tapi tidak semua model sama, ada yang fokus pada reasoning, ada yang multimodal, dan ada yang sekadar inginkan solusi yang cepat dan hemat — tanpa mengorbankan kualitas secara signifikan.
Pada Agustus 2026, kami telah mengumpulkan data terbaru dari dokumentasi resmi masing-masing vendor — termasuk repositori ai-pricing yang di-audit pada 5 Agustus 2026 — untuk memberi Anda gambaran jelas tentang:
Apa perbedaan thinking mode dan non-thinking mode?
Model-model dengan kemampuan vision, audio, dan tool use?
Tabel harga API paling akurat hingga kini — lengkap dengan sistem tarif peak/off-peak dari DeepSeek.
Ikuti selanjutnya!
Apa Itu “Thinking Mode”?
Thinking Mode (juga disebut reasoning atau extended thinking) adalah kemampuan model untuk menghasilkan rantai-poin pikir (chain-of-thought) internal sebelum memberikan jawaban akhir. Ini meniru cara manusia “memikirkan dua kali sebelum bertanya”.
Model dengan thinking mode biasanya:
Menghasilkan kualitas yang jauh lebih baik pada tugas matematis, kode, dan logika kompleks.
Memiliki latensi yang jauh lebih tinggi (sering 10-an detik atau lebih).
Menghitung token “pikiran” sebagai bagian dari output — artinya, Anda membayar untuk proses berpikir internal model.
Non-Thinking Mode adalah model yang menjawab langsung, lebih cepat, dan lebih murah. Cocok untuk tugas rutin, ringan, atau percakapan.
Aspek
Thinking Mode
Non-Thinking Mode
Latensi
Tinggi (detik ke-10-an)
Rendah (detik pertama)
Biaya
Lebih mahal
Lebih murang
Kualitas jawaban
Unggul pada matematika, coding, logika
Baik untuk tugas umum
Token yang dihitung
Input + Output (termasuk “pikiran”)
Hanya Input + Output
Model contoh
o1, o3-mini, DeepSeek R1, Qwen3-Thinking
GPT-4o, GPT-4.5, Claude Sonnet, Grok
Kemampuan Multimodal (Vision, Audio, Tool)
Beberapa model mendukung lebih dari sekadar teks — mereka dapat memproses gambar, audio, file, dan bahkan menggunakan alat eksternal (tool use).
Vision (Gambar → Teks)
Model
Kemampuan
GPT-4o / GPT-4o-mini
✅ Gambar input/output, edisi, analisis
GPT-Image-2
✅ Generasi & pengeditan gambar tingkat lanjut
Gemini 3.1 Pro
✅ Visi multimodal terintegrasi
Qwen3-VL-235B
✅ Visi kuat untuk dokumen & gambar kompleks
Pixtral Large (Mistral)
✅ Model vision open-weight dari Mistral
Audio (Suara → Teks / Teks → Suara)
Model
Kemampuan
GPT-Realtime-2.1 / 2
✅ Input & output audio real-time
GPT-Audio-1.5
✅ Speech-to-text + text-to-speech
GPT-4o-mini-TTS
✅ TTS ringan
Whisper (OpenAI)
✅ Transkripsi audio
ElevenLabs API
✅ TTS realistis
Tool Use / Agentis
Model
Kemampuan
Claude Fable 5
✅ Tool use canggih, retrieval, coding
GPT-5.6 Sol
✅ Tool use + reasoning lanjut
Grok 4.6
✅ Tool use, file input, coding
Qwen3-235B
✅ Mode beralih thinking/non-thinking + tool use
Command A (Cohere)
✅ Fokus enterprise & RAG
Tabel Harga API (per 1M Token USD)
Catatan penting: Harga dapat bervariasi tergantung provider (OpenRouter, Groq, DeepInfra, dll). Angka di bawah ini merupakan harga resmi dari vendor utama atau rata-rata pasar terendah pada Agustus 2026.
OpenAI
Model
Input ($/1M)
Output ($/1M)
Thinking Mode
Catatan
GPT-5.6 Sol
$5.00
$30.00
✅
Frontier model
GPT-5.6 Terra
$2.50
$15.00
✅
Versi menengah
GPT-5.6 Luna
$1.00
$6.00
✅
Versi hemat
GPT-5.5 Pro
$30.00
$180.00
✅
6x lipat dari non-Pro
GPT-4o
$2.50
$10.00
❌
Umum, cepat
GPT-4o-mini
$0.15
$0.60
❌
Ringan
GPT-Realtime-2.1
$4.00
$24.00
❌
Audio real-time
Anthropic
Model
Input ($/1M)
Output ($/1M)
Thinking Mode
Catatan
Claude Fable 5
$10.00
$50.00
✅
Termahal, performa tertinggi
Claude Opus 5
$5.00
$25.00
✅
Setengah harga Fable 5
Claude Sonnet 4.6
$2.00
$10.00
⚠️ Opsional
Extended thinking tersedia
Claude Haiku 4.5
$1.00
$5.00
❌
Cepat dan hemat
Google Gemini
Model
Input ($/1M)
Output ($/1M)
Thinking Mode
Catatan
Gemini 3.1 Pro
$2.00
$12.00
✅
Termasuk Deep Think (bisa lebih mahal)
Gemini 3.6 Flash
$1.50
$7.50
❌
Performa tinggi, biaya rendah
Gemini 3.5 Flash-Lite
$0.30
$2.50
❌
Hemat, cocok untuk skala besar
Gemini 2.5 Pro
$1.25
$10.00
✅
Legacy, masih tersedia
Gemini 2.0 Flash
$0.10
$0.40
❌
Murah, umum
DeepSeek (China)
Model
Input ($/1M)
Output ($/1M)
Thinking Mode
Catatan
DeepSeek V4 Flash
~$0.28
~$1.32
✅
Naik setelah 16 Agustus
DeepSeek V4 Pro
~$1.74
~$3.96
✅
34x lebih murah dari Claude di input
DeepSeek V3
$0.14
$0.28
❌
Legacy
DeepSeek R1
$0.55
$2.19
✅
Fokus pada reasoning
Qwen (Alibaba)
Model
Input ($/1M)
Output ($/1M)
Thinking Mode
Catatan
Qwen3-235B-A22B
~$0.20
~$0.60
✅
Mode beralih, MoE 235B
Qwen3-VL-235B-Thinking
$0.45
$3.49
✅
Visi + thinking
Qwen3-235B-Instruct
~$0.20
~$0.60
❌
Non-thinking
Qwen3-32B
~$0.15
~$0.30
⚠️ Opsional
Ringan
Grok (xAI / SpaceXAI)
Model
Input ($/1M)
Output ($/1M)
Thinking Mode
Catatan
Grok 4.6
$2.00
$6.00
✅
Frontier model, 500K konteks
Grok 4.3
$1.25
$2.50
✅
Versi lebih hemat
Grok 4.20
$1.25
$2.50
✅
Reasoning tinggi
Grok 4.1 Fast
$0.20
$0.50
❌
Ringan
Mistral AI (Prancis)
Model
Input ($/1M)
Output ($/1M)
Thinking Mode
Catatan
Mistral Large 3
$0.50
$1.50
❌
Open weights, EU residency
Mistral Medium 3.5
$1.50
$7.50
❌
Seimbang kualitas/harga
Codestral 2508
$0.30
$0.90
❌
Fokus kode
Pixtral Large
$2.00
$6.00
❌
Vision
Kimi / Moonshot & Phi (Microsoft)
Model
Input ($/1M)
Output ($/1M)
Thinking Mode
Catatan
Kimi K3
$3.00
$15.00
✅
Flagship, 1M konteks
Kimi K2.6
$0.95
$4.00
❌
Umum
Phi-4
$0.07
$0.14
❌
Ringan, on-device
Catatan Penting: Peak / Off-Peak Pricing dari DeepSeek
DeepSeek adalah produsen pertama yang memperkenalkan sistem tarif bergumuru — tempat biaya bergantung pada waktu permintaan dikirimkan.
Peak hours: 01:00–04:00 UTC & 06:00–10:00 UTC
Off-peak: Semua sisa waktu
Mulai 16 Agustus 2026, tarif naik secara signifikan: