Что такое embedding и векторные базы данных простыми словами
Автор: Silvana · Дата: 30.07.2026 · Verified: 30.07.2026 · Reading time: 5 минут · Prerequisite: 002
- Embedding — способ превратить текст (или картинку, звук, видео, код) в длинный список чисел так, чтобы близкие по смыслу объекты давали близкие векторы.
- Это позволяет искать не по совпадению слов, а по смыслу: запрос «как избавиться от боли в спине» найдёт статью «Упражнения для позвоночника», даже если ни одно слово не совпало.
- Векторная база данных — специальное хранилище для таких списков чисел. Умеет быстро находить самые похожие среди миллионов записей.
- Актуальные модели 2026: OpenAI text-embedding-3-small (1536 измерений) и text-embedding-3-large (3072), Voyage 4 через партнёрство с Anthropic (32K контекст, 1024 по умолчанию с опциями 256/512/2048), открытые Multilingual-E5 и BGE.
- Актуальные векторные БД: Qdrant, Pinecone, Weaviate, pgvector (расширение PostgreSQL), Chroma. Открытые лицензии у большинства.
- Без embedding нет ни AI-поиска по документам, ни RAG, ни семантических рекомендаций.
Что это и зачем
Заголовок раздела «Что это и зачем»Обычный поиск ищет буквальное совпадение слов. Если статья называется «Упражнения для позвоночника», а вы вводите «болит спина» — поиск ничего не найдёт. Слова разные, хотя смысл близкий.
Embedding решает эту задачу. Специальная модель читает текст и превращает его в вектор — список чисел фиксированной длины. У OpenAI text-embedding-3-small это 1536 чисел, у text-embedding-3-large — 3072. У Voyage 4 по умолчанию 1024 (можно уменьшить до 256/512 или увеличить до 2048). Тексты про боль в спине и упражнения для позвоночника оказываются рядом в этом числовом пространстве, даже если ни одно слово не совпало.
Аналогия: карта города. Каждый адрес — пара координат. Дома рядом на карте — рядом географически. Embedding то же самое, только координат не две, а тысяча, и «рядом» означает не географически, а по смыслу. Кофейни собираются в одном районе такой карты, автосервисы — в другом.
Векторная база данных — склад для таких координат. Обычная база (MySQL, PostgreSQL без расширений) плохо ищет ближайшие точки в тысячемерном пространстве. Специализированные системы (Qdrant, Pinecone, Weaviate) делают это за миллисекунды на миллионах записей.
Основной разбор
Заголовок раздела «Основной разбор»Embedding в двух словах
Заголовок раздела «Embedding в двух словах»Есть отдельный класс моделей — embedding-модели. Не путай с LLM: LLM генерирует текст, embedding-модель только превращает текст в числа. Даёшь модели текст — получаешь вектор фиксированной длины. Один и тот же текст всегда даёт один и тот же вектор. Похожие по смыслу тексты дают близкие векторы.
Похожесть измеряется формулой. OpenAI и Voyage AI рекомендуют cosine similarity (косинусное сходство). Их векторы нормализованы к длине 1, поэтому cosine similarity даёт те же результаты что скалярное произведение (dot product), только считается быстрее. Cosine similarity и Euclidean distance при нормализованных векторах дают одинаковый порядок ранжирования.
Классические сценарии применения embedding, по документации OpenAI: поиск (ранжирование по релевантности запросу), кластеризация (группировка похожих текстов), рекомендации, обнаружение аномалий, классификация.
Embedding работает не только со словами. Есть модели для картинок, звука, кода. У Voyage AI есть voyage-multimodal-3.5 — он векторизует переплетающиеся текст, изображения и видео в одном пространстве. У них же есть voyage-code-3 специально для поиска по коду.
Векторные БД: зачем отдельная база
Заголовок раздела «Векторные БД: зачем отдельная база»Формулировка Pinecone: «векторная база индексирует и хранит embedding для быстрого извлечения и поиска по сходству, с CRUD-операциями, фильтрацией по метаданным, горизонтальным масштабированием и serverless-режимом». Ключевое отличие от обычной БД — умение искать ближайших соседей в тысячемерном пространстве. Обычная реляционная база сравнит запрос с каждой записью по очереди. Векторная — за миллисекунды через приближённые алгоритмы (HNSW, IVFFlat).
Что ещё умеет векторная БД помимо самого поиска:
- Хранит embedding вместе с оригинальным текстом и метаданными (автор, дата, источник)
- Фильтрует по метаданным до или после поиска («найди похожее только среди статей 2026 года»)
- Обновляет данные без полной переиндексации
- Масштабируется горизонтально на миллиарды записей
По документации Qdrant, поддерживаются четыре формата векторов: dense (обычный список плавающих чисел), sparse (разреженные — хранят только ненулевые элементы), multivectors (несколько векторов одинаковой формы на объект, для моделей типа ColBERT), named vectors (несколько векторов разного размера на объект — для мультимодальности).
Какие бывают embedding-модели (2026)
Заголовок раздела «Какие бывают embedding-модели (2026)»Разбор по официальным источникам разработчиков.
OpenAI(verified на developers.openai.com/api/docs/guides/embeddings):
- text-embedding-3-small— 1536 измерений по умолчанию, максимум 8192 токенов на вход, 62,500 страниц текста на 1 доллар
- text-embedding-3-large— 3072 измерения по умолчанию, максимум 8192 токенов, 9,615 страниц на доллар
- Оба поддерживают параметр
dimensionsдля уменьшения размера вектора без большой потери качества (через Matryoshka representation learning) - Векторы нормализованы к длине 1
Voyage AI(рекомендованы Anthropic, verified на platform.claude.com/docs/en/build-with-claude/embeddings):
- voyage-4-large— лучшее качество универсального и мультиязычного поиска, 32,000 токенов контекста, 1024 измерения по умолчанию с опциями 256/512/2048
- voyage-4— баланс качества и скорости, те же параметры
- voyage-4-lite— оптимизирован под цену и латентность
- voyage-4-nano— открытые веса под Apache 2.0, доступен на Hugging Face
- voyage-code-3— специализация: поиск по коду
- voyage-finance-2иvoyage-law-2— для финансов и юриспруденции
- voyage-multimodal-3.5— работает с текстом, изображениями и видео в одном пространстве
- voyage-context-4— контекстуализированные chunk-эмбеддинги, контекст 120,000 токенов
Anthropic не делает свою embedding-модель. В официальной документации рекомендует Voyage AI как основной вариант.
Открытые модели(без API-подписки, запускаются локально или через Hugging Face):
- Multilingual-E5-large— многоязычная, хорошо работает с русским, часто используется в RU-стартапах
- BGE-M3— открытая мультиязычная модель, поддерживает dense, sparse и multi-vector представления
Как сравнивать модели — естьMTEB(Massive Text Embedding Benchmark) на Hugging Face. Это открытый бенчмарк для оценки embedding-моделей: 56 датасетов, 8 задач, 112 языков. Лидерборд сводит >2000 результатов моделей. Если выбираешь модель под задачу — начни с MTEB, отсортируй по нужным метрикам.
Какие векторные БД (2026)
Заголовок раздела «Какие векторные БД (2026)»Разбор по официальным источникам разработчиков.
Qdrant(qdrant.tech) — открытый исходный код, написан на Rust, 30k+ звёзд на GitHub. Поддерживает dense, sparse, multivector, named vectors. Есть managed cloud, можно ставить на свой сервер. Клиенты Qdrant Cloud — TripAdvisor, HubSpot среди прочих.
Pinecone(pinecone.io) — managed serverless вектор-база. Не self-hosted, только облако. Хорошо документированный SDK. Формулирует себя как «сочетание возможностей традиционной базы с специализацией на векторных embedding».
Weaviate(weaviate.io) — открытый исходный код и managed cloud. Умеет комбинировать векторный поиск с обычной фильтрацией. Индексация через HNSW, поддержка vector quantization для экономии памяти. Есть дополнительно Query Agent (agentic search) и Engram (memory для AI-агентов).
pgvector(github.com/pgvector/pgvector) — открытое расширение для PostgreSQL. Добавляет типvector(до 16,000 измерений),halfvec(half-precision),bit(бинарные, до 64,000),sparsevec(разреженные). Индексы HNSW и IVFFlat. Метрики: L2, inner product, cosine, L1, Hamming, Jaccard. Плюс — если у тебя уже есть PostgreSQL, не нужно ставить отдельную БД. Минус — на очень больших объёмах уступает специализированным.
Chroma(trychroma.com) — открытая (Apache 2.0), позиционируется как «open-source data infrastructure for AI». Есть Chroma Cloud (serverless) и self-hosted. Умеет dense, sparse и hybrid поиск. Часто используется в прототипах и RAG-стартапах.
Как выбирать: если проект уже на Postgres и объём до нескольких миллионов векторов — pgvector. Если нужен self-hosted с высокой скоростью и продвинутыми возможностями — Qdrant или Weaviate. Если хочешь serverless без администрирования — Pinecone или Chroma Cloud.
Практика
Заголовок раздела «Практика»Простой пример RAG-схемы (Retrieval-Augmented Generation) на связке embedding + векторная БД. Псевдокод:
# 1. Индексация документов (один раз)from openai import OpenAIfrom qdrant_client import QdrantClientfrom qdrant_client.models import Distance, VectorParams, PointStruct
openai = OpenAI()qdrant = QdrantClient("localhost:6333")
qdrant.create_collection( "docs", vectors_config=VectorParams(size=1536, distance=Distance.COSINE),)
documents = ["текст статьи 1", "текст статьи 2", ...]for idx, text in enumerate(documents): vector = openai.embeddings.create( model="text-embedding-3-small", input=text, ).data[0].embedding qdrant.upsert("docs", [PointStruct(id=idx, vector=vector, payload={"text": text})])
# 2. Поиск по вопросу (для каждого запроса)query = "как оформить командировку"query_vector = openai.embeddings.create( model="text-embedding-3-small", input=query,).data[0].embeddingresults = qdrant.search("docs", query_vector=query_vector, limit=5)
# 3. Передача найденных кусков LLM в контекст — это и есть RAGcontext = "\n\n".join([r.payload["text"] for r in results])# → передать context + query в Claude/GPT для генерации ответаВсё то же самое можно собрать на pgvector:CREATE EXTENSION vectorв Postgres, колонкаembedding vector(1536), запросORDER BY embedding <=> query_vector LIMIT 5(оператор<=>— cosine distance).
RU-специфика
Заголовок раздела «RU-специфика»- Работает из РФ напрямую.OpenAI и Voyage API — требуют зарубежной регистрации и оплаты. YandexGPT Embeddings и GigaChat Embeddings — работают из России без ограничений. Открытые модели (E5, BGE, voyage-4-nano) можно скачать и запустить локально — без внешних API вообще.
- Оплата в РФ.OpenAI Embeddings и Voyage AI — через зарубежную карту или API-посредников. Yandex и Сбер — обычной картой российского банка по договору.
- RU-локализация.Все крупные embedding-модели работают с русским. Специально для русского оптимизированы Yandex Embeddings и Multilingual-E5-large.
- Векторные БД в РФ.Qdrant, Weaviate, pgvector, Chroma — self-hosted, ставятся на любой сервер, вопрос страны не стоит. Pinecone — только облако, инфраструктура зарубежная.
Sources
Заголовок раздела «Sources»- https://developers.openai.com/api/docs/guides/embeddings· проверено 30.07.2026
- https://platform.claude.com/docs/en/build-with-claude/embeddings· проверено 30.07.2026
- https://huggingface.co/blog/mteb· проверено 30.07.2026
- https://qdrant.tech/documentation/concepts/vectors/· проверено 30.07.2026
- https://qdrant.tech/· проверено 30.07.2026
- https://www.pinecone.io/learn/vector-database/· проверено 30.07.2026
- https://docs.weaviate.io/weaviate/concepts· проверено 30.07.2026
- https://github.com/pgvector/pgvector· проверено 30.07.2026
- https://docs.trychroma.com/docs/overview/introduction· проверено 30.07.2026
Актуальность
Заголовок раздела «Актуальность»Актуально на 30.07.2026. Модели, цены и условия доступа меняются часто. Voyage AI регулярно обновляет линейку (voyage-4 вышла январь 2026, voyage-context-4 — июнь 2026). MTEB-лидерборд перестраивается еженедельно. Перед бизнес-решением всегда сверяйся с первоисточником по ссылкам выше.