Vision adalah salah satu fitur Claude AI yang paling underutilized — banyak pengguna tidak tahu seberapa powerful. Tutorial ini cover cara pakai Vision untuk 5 use case praktis: OCR, chart analysis, code from screenshot, design review, document analysis.
Apa itu Vision Claude?
Fitur yang memungkinkan Claude memahami konten visual dari gambar yang kamu upload. Support format: JPEG, PNG, GIF, WebP. Max 5MB per gambar, max 20 gambar per pesan. Available di Opus 4.8, Sonnet 4.6, Haiku 4.5.
Use Case 1: OCR (Optical Character Recognition)
Upload foto/screenshot teks (printed atau handwritten), Claude akan extract teks akurat.
Contoh prompt: "Extract semua teks dari gambar ini. Format dalam markdown dengan heading sesuai struktur visual."
Akurasi: ~98% untuk teks printed, 85-90% untuk handwritten neat.
Use Case 2: Chart & Data Analysis
Upload screenshot chart (bar, line, pie, scatter), Claude bisa:
• Extract numerical data points
• Identify trend dan outlier
• Calculate basic statistics
• Generate interpretation
Contoh prompt: "Analisis chart ini. Identifikasi trend utama, outlier, dan kesimpulan actionable. Format sebagai executive summary."
Use Case 3: Code from Screenshot
Upload screenshot kode (dari StackOverflow, GitHub issue, screenshot terminal error), Claude akan extract dan analyze.
Contoh prompt: "Convert screenshot code ini ke text. Identifikasi bahasa programming, jelaskan apa yang kode ini lakukan, dan kasih saran improvement."
Use Case 4: Design Review
Upload screenshot website / mobile app / Figma design, Claude akan:
• Identify UI components
• Evaluate UX heuristics (Nielsen, accessibility)
• Suggest improvements specific
• Compare dengan best practice industry
Contoh prompt: "Review design landing page ini. Identifikasi 5 area improvement berdasarkan Nielsen heuristics. Sertakan visual reference dari best-in-class kompetitor."
Use Case 5: Document Analysis
Upload screenshot dokumen kompleks (legal contract, financial statement, scientific paper), Claude bisa:
• Summarize key points
• Extract specific data
• Identify risk/red flags
• Compare dengan template standar
Contoh prompt: "Summarize key terms dari contract ini. Highlight 5 risk paling tinggi untuk pihak kedua. Format dalam markdown table."
Tips Prompt untuk Vision
1. Be specific tentang output format: markdown, JSON, plain text, table
2. Specify scope analisis: high-level summary vs detailed extraction
3. Provide context: "Ini adalah financial report quarterly Indonesia 2026" lebih bagus dari hanya upload gambar
4. Combine with text: paste konteks tambahan + upload gambar
5. Iterate: kalau output kurang akurat, kasih feedback specific
Limitations Vision
• Tidak bisa generate gambar (untuk image gen, pakai DALL-E ChatGPT atau Midjourney)
• Akurasi handwritten messy lebih rendah
• Tidak bisa identify face / person specific (privacy reason)
• Quality gambar matter — blurry/low-res = akurasi turun
• Tidak bisa process video langsung (extract frame dulu)
Pro Tip: Combine Vision + Extended Thinking
Untuk analisis kompleks (multi-step reasoning dari visual content), aktifkan Extended Thinking. Claude akan systematically analyze gambar layer-by-layer, validate finding, dan generate output yang lebih akurat.
Kesimpulan
Vision Claude transformasi workflow untuk profesional yang sering deal dengan visual content: programmer (debug from screenshot), designer (review feedback), researcher (chart analysis), business analyst (document processing). Worth invest waktu untuk learn. Mulai test sekarang di chat.akunpy.com.