Перейти к содержимому

Что такое embedding и векторные базы данных простыми словами

Автор: Silvana · Дата: 30.07.2026 · Verified: 30.07.2026 · Reading time: 5 минут · Prerequisite: 002

  • Embedding — способ превратить текст (или картинку, звук, видео, код) в длинный список чисел так, чтобы близкие по смыслу объекты давали близкие векторы.
  • Это позволяет искать не по совпадению слов, а по смыслу: запрос «как избавиться от боли в спине» найдёт статью «Упражнения для позвоночника», даже если ни одно слово не совпало.
  • Векторная база данных — специальное хранилище для таких списков чисел. Умеет быстро находить самые похожие среди миллионов записей.
  • Актуальные модели 2026: OpenAI text-embedding-3-small (1536 измерений) и text-embedding-3-large (3072), Voyage 4 через партнёрство с Anthropic (32K контекст, 1024 по умолчанию с опциями 256/512/2048), открытые Multilingual-E5 и BGE.
  • Актуальные векторные БД: Qdrant, Pinecone, Weaviate, pgvector (расширение PostgreSQL), Chroma. Открытые лицензии у большинства.
  • Без embedding нет ни AI-поиска по документам, ни RAG, ни семантических рекомендаций.

Обычный поиск ищет буквальное совпадение слов. Если статья называется «Упражнения для позвоночника», а вы вводите «болит спина» — поиск ничего не найдёт. Слова разные, хотя смысл близкий.

Embedding решает эту задачу. Специальная модель читает текст и превращает его в вектор — список чисел фиксированной длины. У OpenAI text-embedding-3-small это 1536 чисел, у text-embedding-3-large — 3072. У Voyage 4 по умолчанию 1024 (можно уменьшить до 256/512 или увеличить до 2048). Тексты про боль в спине и упражнения для позвоночника оказываются рядом в этом числовом пространстве, даже если ни одно слово не совпало.

Аналогия: карта города. Каждый адрес — пара координат. Дома рядом на карте — рядом географически. Embedding то же самое, только координат не две, а тысяча, и «рядом» означает не географически, а по смыслу. Кофейни собираются в одном районе такой карты, автосервисы — в другом.

Векторная база данных — склад для таких координат. Обычная база (MySQL, PostgreSQL без расширений) плохо ищет ближайшие точки в тысячемерном пространстве. Специализированные системы (Qdrant, Pinecone, Weaviate) делают это за миллисекунды на миллионах записей.

Есть отдельный класс моделей — embedding-модели. Не путай с LLM: LLM генерирует текст, embedding-модель только превращает текст в числа. Даёшь модели текст — получаешь вектор фиксированной длины. Один и тот же текст всегда даёт один и тот же вектор. Похожие по смыслу тексты дают близкие векторы.

Похожесть измеряется формулой. OpenAI и Voyage AI рекомендуют cosine similarity (косинусное сходство). Их векторы нормализованы к длине 1, поэтому cosine similarity даёт те же результаты что скалярное произведение (dot product), только считается быстрее. Cosine similarity и Euclidean distance при нормализованных векторах дают одинаковый порядок ранжирования.

Классические сценарии применения embedding, по документации OpenAI: поиск (ранжирование по релевантности запросу), кластеризация (группировка похожих текстов), рекомендации, обнаружение аномалий, классификация.

Embedding работает не только со словами. Есть модели для картинок, звука, кода. У Voyage AI есть voyage-multimodal-3.5 — он векторизует переплетающиеся текст, изображения и видео в одном пространстве. У них же есть voyage-code-3 специально для поиска по коду.

Формулировка Pinecone: «векторная база индексирует и хранит embedding для быстрого извлечения и поиска по сходству, с CRUD-операциями, фильтрацией по метаданным, горизонтальным масштабированием и serverless-режимом». Ключевое отличие от обычной БД — умение искать ближайших соседей в тысячемерном пространстве. Обычная реляционная база сравнит запрос с каждой записью по очереди. Векторная — за миллисекунды через приближённые алгоритмы (HNSW, IVFFlat).

Что ещё умеет векторная БД помимо самого поиска:

  • Хранит embedding вместе с оригинальным текстом и метаданными (автор, дата, источник)
  • Фильтрует по метаданным до или после поиска («найди похожее только среди статей 2026 года»)
  • Обновляет данные без полной переиндексации
  • Масштабируется горизонтально на миллиарды записей

По документации Qdrant, поддерживаются четыре формата векторов: dense (обычный список плавающих чисел), sparse (разреженные — хранят только ненулевые элементы), multivectors (несколько векторов одинаковой формы на объект, для моделей типа ColBERT), named vectors (несколько векторов разного размера на объект — для мультимодальности).

Разбор по официальным источникам разработчиков.

OpenAI(verified на developers.openai.com/api/docs/guides/embeddings):

  • text-embedding-3-small— 1536 измерений по умолчанию, максимум 8192 токенов на вход, 62,500 страниц текста на 1 доллар
  • text-embedding-3-large— 3072 измерения по умолчанию, максимум 8192 токенов, 9,615 страниц на доллар
  • Оба поддерживают параметрdimensionsдля уменьшения размера вектора без большой потери качества (через Matryoshka representation learning)
  • Векторы нормализованы к длине 1

Voyage AI(рекомендованы Anthropic, verified на platform.claude.com/docs/en/build-with-claude/embeddings):

  • voyage-4-large— лучшее качество универсального и мультиязычного поиска, 32,000 токенов контекста, 1024 измерения по умолчанию с опциями 256/512/2048
  • voyage-4— баланс качества и скорости, те же параметры
  • voyage-4-lite— оптимизирован под цену и латентность
  • voyage-4-nano— открытые веса под Apache 2.0, доступен на Hugging Face
  • voyage-code-3— специализация: поиск по коду
  • voyage-finance-2иvoyage-law-2— для финансов и юриспруденции
  • voyage-multimodal-3.5— работает с текстом, изображениями и видео в одном пространстве
  • voyage-context-4— контекстуализированные chunk-эмбеддинги, контекст 120,000 токенов

Anthropic не делает свою embedding-модель. В официальной документации рекомендует Voyage AI как основной вариант.

Открытые модели(без API-подписки, запускаются локально или через Hugging Face):

  • Multilingual-E5-large— многоязычная, хорошо работает с русским, часто используется в RU-стартапах
  • BGE-M3— открытая мультиязычная модель, поддерживает dense, sparse и multi-vector представления

Как сравнивать модели — естьMTEB(Massive Text Embedding Benchmark) на Hugging Face. Это открытый бенчмарк для оценки embedding-моделей: 56 датасетов, 8 задач, 112 языков. Лидерборд сводит >2000 результатов моделей. Если выбираешь модель под задачу — начни с MTEB, отсортируй по нужным метрикам.

Разбор по официальным источникам разработчиков.

Qdrant(qdrant.tech) — открытый исходный код, написан на Rust, 30k+ звёзд на GitHub. Поддерживает dense, sparse, multivector, named vectors. Есть managed cloud, можно ставить на свой сервер. Клиенты Qdrant Cloud — TripAdvisor, HubSpot среди прочих.

Pinecone(pinecone.io) — managed serverless вектор-база. Не self-hosted, только облако. Хорошо документированный SDK. Формулирует себя как «сочетание возможностей традиционной базы с специализацией на векторных embedding».

Weaviate(weaviate.io) — открытый исходный код и managed cloud. Умеет комбинировать векторный поиск с обычной фильтрацией. Индексация через HNSW, поддержка vector quantization для экономии памяти. Есть дополнительно Query Agent (agentic search) и Engram (memory для AI-агентов).

pgvector(github.com/pgvector/pgvector) — открытое расширение для PostgreSQL. Добавляет типvector(до 16,000 измерений),halfvec(half-precision),bit(бинарные, до 64,000),sparsevec(разреженные). Индексы HNSW и IVFFlat. Метрики: L2, inner product, cosine, L1, Hamming, Jaccard. Плюс — если у тебя уже есть PostgreSQL, не нужно ставить отдельную БД. Минус — на очень больших объёмах уступает специализированным.

Chroma(trychroma.com) — открытая (Apache 2.0), позиционируется как «open-source data infrastructure for AI». Есть Chroma Cloud (serverless) и self-hosted. Умеет dense, sparse и hybrid поиск. Часто используется в прототипах и RAG-стартапах.

Как выбирать: если проект уже на Postgres и объём до нескольких миллионов векторов — pgvector. Если нужен self-hosted с высокой скоростью и продвинутыми возможностями — Qdrant или Weaviate. Если хочешь serverless без администрирования — Pinecone или Chroma Cloud.

Простой пример RAG-схемы (Retrieval-Augmented Generation) на связке embedding + векторная БД. Псевдокод:

# 1. Индексация документов (один раз)
from openai import OpenAI
from qdrant_client import QdrantClient
from qdrant_client.models import Distance, VectorParams, PointStruct
openai = OpenAI()
qdrant = QdrantClient("localhost:6333")
qdrant.create_collection(
"docs",
vectors_config=VectorParams(size=1536, distance=Distance.COSINE),
)
documents = ["текст статьи 1", "текст статьи 2", ...]
for idx, text in enumerate(documents):
vector = openai.embeddings.create(
model="text-embedding-3-small",
input=text,
).data[0].embedding
qdrant.upsert("docs", [PointStruct(id=idx, vector=vector, payload={"text": text})])
# 2. Поиск по вопросу (для каждого запроса)
query = "как оформить командировку"
query_vector = openai.embeddings.create(
model="text-embedding-3-small",
input=query,
).data[0].embedding
results = qdrant.search("docs", query_vector=query_vector, limit=5)
# 3. Передача найденных кусков LLM в контекст — это и есть RAG
context = "\n\n".join([r.payload["text"] for r in results])
# → передать context + query в Claude/GPT для генерации ответа

Всё то же самое можно собрать на pgvector:CREATE EXTENSION vectorв Postgres, колонкаembedding vector(1536), запросORDER BY embedding <=> query_vector LIMIT 5(оператор<=>— cosine distance).

  • Работает из РФ напрямую.OpenAI и Voyage API — требуют зарубежной регистрации и оплаты. YandexGPT Embeddings и GigaChat Embeddings — работают из России без ограничений. Открытые модели (E5, BGE, voyage-4-nano) можно скачать и запустить локально — без внешних API вообще.
  • Оплата в РФ.OpenAI Embeddings и Voyage AI — через зарубежную карту или API-посредников. Yandex и Сбер — обычной картой российского банка по договору.
  • RU-локализация.Все крупные embedding-модели работают с русским. Специально для русского оптимизированы Yandex Embeddings и Multilingual-E5-large.
  • Векторные БД в РФ.Qdrant, Weaviate, pgvector, Chroma — self-hosted, ставятся на любой сервер, вопрос страны не стоит. Pinecone — только облако, инфраструктура зарубежная.

Актуально на 30.07.2026. Модели, цены и условия доступа меняются часто. Voyage AI регулярно обновляет линейку (voyage-4 вышла январь 2026, voyage-context-4 — июнь 2026). MTEB-лидерборд перестраивается еженедельно. Перед бизнес-решением всегда сверяйся с первоисточником по ссылкам выше.