ontocast.tool.vector_store.embedding¶
Embedding provider abstraction for vector store workflows.
EmbeddingTool
¶
Bases: Tool
Base embedding tool with provider-specific implementations.
Source code in ontocast/tool/vector_store/embedding.py
create(config)
classmethod
¶
Factory for provider-specific embedding tools.
Source code in ontocast/tool/vector_store/embedding.py
embed(texts)
¶
Return vectors for all given texts as documents.
Serialisation, where it is needed, belongs to whatever owns the model — the shared encoder for local checkpoints, nothing for remote providers.
Source code in ontocast/tool/vector_store/embedding.py
embed_one(text)
¶
Return a vector for one query text.
Source code in ontocast/tool/vector_store/embedding.py
embed_query(texts)
¶
Return vectors for all given texts as queries.
Asymmetric retrieval models are trained with distinct query and document
instructions and lose accuracy when both sides are encoded identically. With
empty prefixes — the default, suiting a symmetric paraphrase model — this is
exactly :meth:embed.
Source code in ontocast/tool/vector_store/embedding.py
FastembedBm25SparseTool
¶
Bases: Tool
BM25-style sparse text embeddings via fastembed (Qdrant-compatible).
Source code in ontocast/tool/vector_store/embedding.py
embed_sparse(texts)
¶
Return Qdrant sparse vectors for indexing all given texts (thread-safe).
Source code in ontocast/tool/vector_store/embedding.py
embed_sparse_query(texts)
¶
Return Qdrant sparse vectors for querying with all given texts.
BM25 is asymmetric: documents carry term-frequency saturation weights, queries carry flat per-term weights, and the IDF factor is applied by the store. Encoding queries with the document encoder instead squares the term-frequency weighting and drops the query/document distinction entirely.
Source code in ontocast/tool/vector_store/embedding.py
HuggingFaceEmbeddingTool
¶
Bases: EmbeddingTool
Local HuggingFace/SentenceTransformer embeddings.
Source code in ontocast/tool/vector_store/embedding.py
OllamaEmbeddingTool
¶
Bases: _LangChainEmbeddingTool
Ollama embeddings using either LangChain or direct API fallback.
Source code in ontocast/tool/vector_store/embedding.py
OpenAIEmbeddingTool
¶
Bases: _LangChainEmbeddingTool
OpenAI embeddings via langchain-openai.