Перейти к содержимому
AI / ML~3 мин чтения

Embedding

Преобразование текста (или картинки) в вектор чисел, который представляет смысл. Похожие смыслы = похожие векторы. Основа semantic search и RAG.

Развёрнутое объяснение

Embedding — числовое представление смысла. «Кот» и «кошка» — разные слова, но близкие embeddings. «Кот» и «автомобиль» — далёкие.

Создаётся через embedding-модель: text → tokens → нейросеть → вектор размером 768/1536/3072. Стандарты: OpenAI text-embedding-3 (1536), Anthropic Voyage (1024), open-source (E5, BGE).

Используется в: semantic search, RAG, рекомендации, кластеризация, классификация, поиск дубликатов.

Где это в услугах WRAW

  • Embeddings всех документов клиента в Vector DB для RAG
  • Embedding пользовательского запроса для поиска

Частые вопросы

Какой embedding-модели лучше?

Для большинства — OpenAI text-embedding-3-small (быстро, дёшево). Для качества — text-embedding-3-large или Voyage. Для русского/казахского — Voyage.

Сколько стоит embedding?

$0.02 за 1M токенов (text-embedding-3-small). База на 10 000 документов = ~$0.10.

Связанные термины

Покажем, где Embedding даст результат

Опишите задачу своими словами — за 1 рабочий день пришлём понятное предложение с шагами и стоимостью.