Multimodal AI concept page. Native multimodal LLMs (GPT-4o, Gemini 2.5, Claude 4, Llama 3.2 Vision) vs specialized pipelines (CLIP, Whisper, YOLO, Tesseract, ElevenLabs, DALL-E, Midjourney, Flux, Sora). VQA, audio transcription, text-to-image generation, hybrid filter+verify production patterns. 4 scenarios with cost/latency tradeoffs and ADR for native vs specialized decision matrix.
В 2022 LLM работали только с текстом. К 2026 multimodal стал стандартом: GPT-4o, Claude Sonnet 4.7, Gemini 2.5 Pro и Llama 3.2 Vision принимают на вход image, audio и video нативно. Это разблокировало целые классы продуктов: visual Q&A, document parsing, voice-агенты, medical imaging, video moderation, real-time captioning, screenshot-driven browser automation. Игнорировать multimodal в 2026 — пропускать половину UX-возможностей и проигрывать конкурентам, которые уже принимают фото в support-чате и зачитывают ответ голосом за 600ms.
Но multimodal — это не только "включи Vision API и забудь". Цены кусаются (1 image = 1000-2000 input tokens, 100K image-запросов в день на GPT-4o = $30-90K/месяц), latency растёт (vision call = 2-10 секунд против 50ms у CLIP), а accuracy скачет: GPT-4V уверенно "видит 5 серверов на диаграмме" когда их 4, и галлюцинирует "Thanks for watching" в Whisper-транскрипте на тишине. Производственная multimodal-архитектура — это всегда выбор между native LLM, specialized pipeline (CLIP, YOLO, Whisper, Tesseract, ElevenLabs) и hybrid'ом, который комбинирует оба.
Этот концепт-урок учит думать про multimodal как про набор инструментов, а не одну "AI-кнопку": когда хватает CLIP за $0.0001, когда нужен GPT-4o за $0.025, и почему production-победитель почти всегда hybrid — cheap filter сначала, expensive verify в конце.
Думайте о multimodal как о двух параллельных мирах с мостом между ними:
Мир 1: Native multimodal LLM (GPT-4o, Claude 4, Gemini 2.5, Llama 3.2 Vision). Модель видит image как "текст": ViT-энкодер режет картинку на patches, превращает в 1000-2000 visual токенов, склеивает с текстовым контекстом, прогоняет через transformer. Один API-call, общее reasoning, способность отвечать на open-ended вопросы про visual content. Дорого, медленно, иногда галлюцинирует геометрию.
Мир 2: Specialized pipeline — стек атомарных моделей под конкретные задачи. CLIP для embedding (joint image-text vector space), YOLO для object detection, Tesseract/AWS Textract для OCR, SAM для segmentation, Whisper для ASR, ElevenLabs для TTS, Flux/Stable Diffusion для генерации. Каждый компонент дёшев (pennies), быстр (50-500ms), детерминистичен, fine-tune-able. Но связать их в "ответ на сложный вопрос про картинку" — самостоятельная инженерная задача.
Мост: Hybrid pattern. Production-победитель в 2026: дешёвый filter (CLIP embedding + vector DB lookup) сокращает 10M кандидатов до top-50, structured rerank (price, availability) — до top-5, и только финальную пятёрку отдаём в дорогую vision LLM на верификацию. Pinterest, Klarna, Stripe Radar — все живут на этом паттерне. 60x дешевле, чем "сразу GPT-4o на всё", и precision выше, чем "только CLIP".
Правило выбора: volume + latency бюджет диктуют, complexity reasoning'а диктует обратное. >10K запросов/день одной модальности → specialized. <500ms p99 → specialized (или GPT-4o Realtime для голоса). Сложное reasoning поверх visual content, низкий volume → native multimodal. Всё остальное → hybrid.
Пять групп показывают параллельную картину "одна задача — два-три способа":
Native multimodal LLM (top-left) — путь GPT-4o / Gemini 2.5. User отправляет image+question или голос, модель энкодирует через patch tokens (vision) или spectrogram tokens (audio), фьюзит с текстовым промптом, выдаёт unified output (text / structured JSON / audio / function call). Один call, общий reasoning.
Specialized vision pipeline (top-right) — image input расходится на четыре параллельных специализированных модели: CLIP (embedding), YOLO (object detection), Tesseract/Textract (OCR), SAM (segmentation). CLIP-embeddings ложатся в Qdrant vector DB для retrieval. Каждый компонент решает свой атомарный класс задач быстро и дёшево.
Audio pipeline (middle-left) — два конкурирующих маршрута. Классический: mic → Whisper (STT) → pyannote (diarization) → LLM (reasoning) → ElevenLabs (TTS) → speaker. Real-time: mic → GPT-4o Realtime API → speaker, без промежуточных шагов, под <600ms latency для голосовых агентов.
Generation (middle-right) — text prompt разветвляется на пять managed / self-hosted endpoint'ов: DALL-E 3 (managed, instruction-following), Midjourney v6 (artistic), Flux.1 (open weights, self-host для volume), Sora/Veo 2 (text-to-video), Suno/Udio (music). Все стекаются в S3+CDN с watermark и C2PA-метаданными.
Hybrid production pattern (bottom-left) — главный production-узор. Query image → CLIP embed (50ms, $0.0001) → vector DB top-50 → structured rerank (price, availability) → top-5 → GPT-4o vision verify ($0.05 total) → final 5 с объяснениями. 60x дешевле чисто-LLM подхода.
Cost / latency matrix (bottom-right) — карта цен 2026: GPT-4o vision $0.005-0.015/image, Claude Sonnet 4.7 vision $0.003-0.015, Gemini 2.5 Pro $0.0005-0.002 (самый дешёвый native), self-host CLIP $0.0001 (на два порядка дешевле всего native), Whisper API $0.006/min, ElevenLabs TTS $0.18/1000 chars, DALL-E 3 $0.04/image, Flux self-host $0.005/image. Edges от cost-нод тянутся к соответствующим pipeline-блокам, показывая, какая цена за какой компонент платится.
1. VQA (Visual Question Answering) — победа native multimodal. Product manager грузит screenshot системной архитектуры, спрашивает "где первый bottleneck при 10x нагрузке". GPT-4o энкодирует diagram в 1500 visual токенов, читает структуру (load balancer → 3 web servers → single Postgres → Redis), применяет systems-reasoning, отвечает "Postgres single instance — горлышко, рекомендую read replicas + write sharding". Specialized pipeline не собрал бы такое — нужно было бы writeать кастомный diagram parser + reasoning engine. Стоит $0.025 на запрос, окупается при low volume (100 PM-запросов/день = $75/месяц). Killer app: medical chart review, contract diagram analysis, screenshot debugging, document understanding.
2. Audio transcription — победа specialized pipeline. Customer support: 10K минут аудио в день. Whisper large-v3 (streaming STT) → pyannote (diarization, SPEAKER_0/SPEAKER_1) → LLM (sentiment + escalation flags + action items) → ElevenLabs (cloned voice reply для voice bot). 5-минутный звонок = $0.11 ($0.03 STT + $0.05 diariz + $0.01 анализ + $0.02 TTS). 10K звонков/день = $1100. GPT-4o аудио-вход стоил бы 16x больше. Параллельно — real-time path: mic → GPT-4o Realtime API → speaker, под <1s latency для live conversations, где STT→LLM→TTS chain дал бы 3-5s и сломал бы UX.
3. Text-to-image generation — выбор между managed и self-host. Marketing просит 500 hero-картинок для кампании. DALL-E 3 ($0.04/image, лучшее instruction-following, общий стиль), Midjourney v6 ($0.05-0.10, лучшая эстетика, distinctive style, awkward Discord workflow), Flux.1 ($0.005 на своей GPU, открытые веса, brand LoRA fine-tune для consistent character across тысяч картинок). На 500 картинках разница $20 vs $25-50 vs $2.5. На 10K в день — managed = bankruptcy, self-host выигрывает на порядки. Параллельные пути: Sora/Veo 2 для коротких видео ($0.5-2 за секунду), Suno/Udio для music ($0.01-0.03 за песню). Обязательная safety обвязка: C2PA provenance, watermark, NSFW filter, IP detection (нет celebrity faces, нет copyrighted characters).
4. Hybrid production pattern (Pinterest / Klarna) — главный production-сценарий. Visual product search: 10M каталог, 100K запросов/день, бюджет precision 95%. Pure GPT-4o на 50 кандидатов в каждом запросе = $50K/день — bankruptcy. Pure CLIP-only = 70% precision (промахивается на освещении, ракурсе, частичной окклюзии). Hybrid: CLIP embedding query (50ms, $0.0001) → Qdrant top-50 → structured rerank (in_stock, price < $150) → top-5 → GPT-4o vision verifies через reasoning ("это жёлтый ботинок, не красный — reject") → 4 verified matches + explanations. Стоит $0.025 на запрос, 100K в день = $2500/день, precision 95%. 20x дешевле pure-LLM, +25 пунктов precision над pure-CLIP. Generaliz'уется на document QA (BM25 filter → vision LLM на финальных 3-5 pages), video moderation (keyframe sampling → CLIP NSFW filter → vision LLM на flagged frames), customer support (CLIP матчит фото повреждённого товара → Claude vision верифицирует серьёзность → auto-refund или human escalation).
ADR-001: Native multimodal LLM vs specialized pipeline — когда выбирать что.
Контекст. В 2026 у инженера два пути решить multimodal-задачу: (a) Native LLM — GPT-4o, Gemini 2.5 Pro, Claude Sonnet 4.7, Llama 3.2 Vision — один API call, общий reasoning. (b) Specialized pipeline — CLIP для embedding, Whisper для ASR, YOLO для detection, Tesseract/Textract для OCR, ElevenLabs для TTS, Flux для генерации — каждый компонент дёшев, fine-tune-able, детерминистичен. Соблазн "GPT-4o всё умеет, давайте его" приводит к bankruptcy на scale: 1 image = 1000-2000 tokens, 100K images/день = $30-90K/месяц, latency 2-10s, и hallucinated geometry на критических числах (вспомните legal documents). Реальные production case studies показывают: Pinterest Visual Search живёт на CLIP (не GPT-4V), 500B+ image queries/year, latency budget 50ms. Spotify recommendations — собственная contrastive модель на audio embeddings. Stripe Radar — собственные модели на screenshots, не Claude. С другой стороны, Klarna для document extraction в support использует Claude Sonnet vision (small volume, high value per call), и для one-off VQA / screenshot debugging / browser automation native multimodal побеждает специализированный стек на порядки по dev velocity.
Решение. Decision matrix по семи измерениям:
Anti-patterns. GPT-4V для object detection (slow + inaccurate vs YOLO). Whisper для real-time conversation (200-500ms add up; GPT-4o Realtime native voice <600ms). Native multimodal для simple OCR на known formats (Textract 100x дешевле, детерминистичен).
Концепты (внутренние):
embeddings-basics — что такое vector embeddings, почему dimensional space работает для similarity.vector-similarity-ann — HNSW / IVF индексы, как Qdrant/Pinecone делают 30ms top-K на миллионах векторов.rag-architecture — как multimodal embeddings ложатся в RAG (image+text retrieval поверх knowledge base).ai-cost-optimization — paginated LLM costs, prompt caching, hybrid routing.model-serving — self-hosting Whisper/CLIP/Flux на собственной GPU-инфраструктуре.Кейсы (внутренние):
e-commerce-search — visual product search через CLIP + reranking.voice-assistant — STT + LLM + TTS pipeline vs GPT-4o Realtime для voice agents.content-moderation — multimodal classifier для видео/изображений at scale.document-processing — Claude vision поверх scanned legal/medical docs.Внешние источники: