---
title: "Vector Databases"
source: "https://systems-analysis.info/int/Vector_Databases"
wiki: "systems-analysis.info/int"
article: "Vector_Databases"
language: "tl"
categories:
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Tagalog"
revision_id: 8394
wiki_created_at: 2026-09-07T01:16:46Z
wiki_modified_at: 2026-09-07T01:16:46Z
downloaded_at: 2026-09-07T23:25:08Z
---

# Vector Databases

**Mga vektorial na database** — ito ay mga espesyalisadong sistema ng pag-iimbak at paghahanap na na-optimize para sa paggawa sa mataas-dimensyonal na numerical na representasyon (mga vector) ng hindi nakastrukturang datos<sup>[\[1\]](https://systems-analysis.info/int/Vector_Databases#cite_note-cloudraft_whatis-1)</sup>. Sa konteksto ng malalaking modelo ng wika (LLM), nagbibigay ang mga ito ng mahusay na semantic na paghahanap at isang pangunahing sangkap ng modernong mga sistema ng artificial intelligence, lalo na sa arkitektura ng RAG.

Hindi tulad ng tradisyonal na relational na database na nakatuon sa eksaktong pagtutugma, ang mga vektorial na database ay espesyalista sa approximate na paghahanap ng pinakamalapit na kapitbahay (*Approximate Nearest Neighbor, ANN*), na naghahanap ng mga semantically na malapit na bagay sa mataas-dimensyonal na espasyo<sup>[\[2\]](https://systems-analysis.info/int/Vector_Databases#cite_note-qdrant_whatis-2)</sup>.

## Mga Pundasyon ng Mga Vektorial na Database

### Embeddings - Mga Vektorial na Representasyon

**Mga vektorial na representasyon** (*embeddings*) — ito ay numerical na representasyon ng teksto, mga larawan, audio at iba pang uri ng datos sa anyo ng mga vector. Ang pangunahing prinsipyo ay ang mga semantically na malapit na bagay (halimbawa, mga salitang may magkaparehong kahulugan) ay inilalagay sa vektorial na espasyong ito malapit sa isa't isa<sup>[\[3\]](https://systems-analysis.info/int/Vector_Databases#cite_note-lakefs_embeddings-3)</sup>.

Ang mga modernong tekstwal na embedding ay nilikha gamit ang mga modelo batay sa arkitektura ng transformer, na gumagamit ng mga mekanismo ng pansin (*self-attention*) para sa pag-unawa ng konteksto. Ang dimensyon ng mga representasyong ito ay nag-iiba mula 256 hanggang 1024 na sukat at higit pa para sa karamihan ng mga modernong modelo<sup>[\[4\]](https://systems-analysis.info/int/Vector_Databases#cite_note-zilliz_embeddings-4)</sup>.

### Mga Sukatan ng Pagkakatulad

Para sa pagsukat ng "distansya" o pagkakatulad sa pagitan ng mga vector, ginagamit ang iba't ibang sukatan:

- **Cosine similarity - Cosine na pagkakatulad**: Sinusukat ang cosine ng anggulo sa pagitan ng dalawang vector. Lalo itong epektibo para sa mga tekstwal na embedding, dahil isinasaalang-alang ang direksyon ng mga vector, hindi ang kanilang magnitude<sup>[\[5\]](https://systems-analysis.info/int/Vector_Databases#cite_note-sahoo2025-5)</sup>.
- **Euclidean na distansya (L2)**: Karaniwang tuwid na distansya sa pagitan ng dalawang punto sa espasyo.
- **Dot product - Scalar na produkto** (*dot product*): Katulad ng cosine na pagkakatulad, ngunit hindi na-normalize<sup>[\[6\]](https://systems-analysis.info/int/Vector_Databases#cite_note-elastic_metrics-6)</sup>.

## Mga Algoritmo ng Pag-index

Para sa mabilis na paghahanap sa mataas-dimensyonal na mga espasyo, ginagamit ang mga espesyalisadong ANN na algoritmo.

### HNSW (Hierarchical Navigable Small World)

Ang algoritmo ng **HNSW** ay gumagamit ng konsepto ng "maliit na mundo" at isang multi-layered na hierarchical na istruktura ng mga graph. Ang mga itaas na layer ay naglalaman ng mahahabang koneksyon para sa mabilis na paggalaw sa espasyo (magaspang na paghahanap), habang ang mga ibabang layer ay naglalaman ng mga maikling koneksyon para sa tumpak na paghahanap ng mga kapitbahay. Ipinapakita ng HNSW ang logarithmic na time complexity na *O(log N)* at ito ang pinipiling pagpipilian para sa karamihan ng mga modernong vektorial na database<sup>[\[7\]](https://systems-analysis.info/int/Vector_Databases#cite_note-hnsw_paper-7)</sup>.

### IVF (Inverted File)

Ang algoritmo ng **IVF** ay hinahati ang espasyo sa mga cluster gamit ang k-means clustering. Ang paghahanap ay nagaganap sa limitadong bilang ng mga pinakamalapit na cluster, na nagpapabilis nang malaki sa proseso. Ang bilang ng mga cluster ay karaniwang pinipili bilang √N, kung saan ang N ay ang kabuuang bilang ng mga vector sa dataset<sup>[\[8\]](https://systems-analysis.info/int/Vector_Databases#cite_note-faiss_ivf-8)</sup>.

### LSH (Locality-Sensitive Hashing)

Ang algoritmo ng **LSH** ay gumagamit ng pamilya ng mga hash function na may mataas na posibilidad na bumubuo ng parehong mga hash para sa mga malapit na vector. Nagbibigay-daan ito sa mabilis na pagpapangkat ng mga katulad na bagay<sup>[\[9\]](https://systems-analysis.info/int/Vector_Databases#cite_note-datar2004-9)</sup>.

## Mga Sikat na Vektorial na Database

- **Pinecone**: Ganap na pinamamahalaang cloud vektorial na database na may *serverless* na arkitektura.
- **Qdrant**: Mataas-performance na database na nakasulat sa Rust, na may suporta para sa advanced na pag-filter at ACID-compatible na mga transaksyon.
- **Milvus**: Scalable na open-source na database na may cloud-native na arkitektura. Sinusuportahan ang maraming uri ng index, kabilang ang mga GPU-accelerated na variant.
- **Weaviate**: Open-source na vektorial na database na may GraphQL API at suporta para sa mga knowledge graph.
- **Chroma**: Magaang na open-source na database na na-optimize para sa mabilis na prototyping at mga eksperimento.
- **FAISS**: Isang library mula sa Meta, na hindi isang ganap na database, ngunit nagbibigay ng mataas-performance na mga algoritmo ng pag-index para sa static na datos.

## Paggamit Kasama ang LLM: Arkitektura ng RAG

**Retrieval-Augmented Generation (RAG)** — ito ay isang arkitektura kung saan ang LLM ay pinahusay ng isang panlabas na knowledge base sa pamamagitan ng vektorial na paghahanap. Ang mga RAG na sistema ay binubuo ng dalawang pangunahing sangkap<sup>[\[10\]](https://systems-analysis.info/int/Vector_Databases#cite_note-rag_lewis2020-10)</sup>:

1.  **Retriever - Tagakuha**: Isang sangkap ng paghahanap na gumagamit ng vektorial na database upang mahanap ang may-kaugnayan na impormasyon batay sa kahilingan ng gumagamit.
2.  **Generator - Tagabuo**: Isang LLM na gumagamit ng orihinal na kahilingan at ng impormasyong natagpuan ng retriever upang makabuo ng tugon.

Para sa epektibong operasyon ng RAG, ginagamit ang **hybrid na paghahanap** — isang kumbinasyon ng semantic (vektorial) at lexical (keyword, halimbawa, BM25) na paghahanap, na nagbibigay ng mas tumpak at may-kaugnayan na mga resulta.

## Mga Trend at Hinaharap na Pag-unlad

Ang merkado ng mga vektorial na database ay nagpapakita ng mabilis na paglago, na hinuhulaan mula sa \$1.98 bilyon noong 2023 hanggang \$7.13 bilyon sa 2029 (CAGR 23.7%)<sup>[\[11\]](https://systems-analysis.info/int/Vector_Databases#cite_note-tbrc_market-11)</sup>. Kasama sa mga pangunahing direksyon ng pag-unlad ang:

- **Mga multimodal na sistema:** Suporta para sa sabay-sabay na paghahanap sa teksto, mga larawan, audio at video sa isang pinag-isang vektorial na espasyo.
- **Awtomatikong optimisasyon:** Paggamit ng ML para sa awtomatikong pagpili ng mga optimal na index at parameter.
- **Edge computing:** Pagbuo ng mga compact na solusyon para sa mga mobile at IoT na device.
- **Quantum computing - Quantum na pagkalkula**: Potensyal na exponential na pagpapabilis ng paghahanap ng pagkakatulad.
- **Mga neuromorphic na chip:** Pagtulad sa pagganap ng utak para sa napakababang pagkonsumo ng enerhiya sa panahon ng paghahanap.

## Mga Sanggunian

- Opisyal na website ng Pinecone
- Opisyal na website ng Qdrant
- Opisyal na website ng Milvus
- Opisyal na website ng Weaviate

## Mga Babasahin

- Malkov, Y.A.; Yashunin, D.A. (2016). *Efficient and Robust Approximate Nearest Neighbor Search Using Hierarchical Navigable Small World Graphs*. arXiv:1603.09320.
- Johnson, J.; Douze, M.; Jégou, H. (2017). *Billion-Scale Similarity Search with GPUs*. arXiv:1702.08734.
- Datar, M. et al. (2004). *Locality-Sensitive Hashing Scheme Based on p-Stable Distributions*. SoCG 2004 paper.
- Guo, N. et al. (2020). *ScaNN: Efficient Vector Similarity Search at Scale*. In: *Proc. ACM SIGKDD 2020*, pp. 1571-1580. DOI:10.1145/3394486.3403339.
- Lewis, P. et al. (2020). *Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks*. arXiv:2005.11401.
- Wang, X. et al. (2021). *Milvus: A Purpose-Built Vector Data Management System*. In: *SIGMOD 2021*. DOI:10.1145/3448016.3457550.
- Lee, J. et al. (2022). *OOD-DiskANN: Efficient and Scalable Graph ANNS for Out-of-Distribution Queries*. arXiv:2211.12850.
- Fan, D. et al. (2023). *Survey of Vector Database Management Systems*. arXiv:2310.14021.
- Ren, R. et al. (2024). *Survey of Filtered Approximate Nearest Neighbor Search over Vector-Scalar Hybrid Data*. arXiv:2505.06501.
- Zhao, H. et al. (2024). *Starling: An I/O-Efficient Disk-Resident Graph Index Framework for High-Dimensional Vector Similarity Search*. arXiv:2401.02116.
- Liu, Y. et al. (2025). *Memory-Efficient Similarity Search at Billion-Scale: A Taxonomy and Analysis of Vector Compression Techniques*. ResearchGate preprint.

## Mga Tala

1.  <span id="cite_note-cloudraft_whatis-1">[↑](https://systems-analysis.info/int/Vector_Databases#cite_ref-cloudraft_whatis_1-0) «What Is a Vector Database?». *CloudRaft*. <a href="https://www.cloudraft.io/what-is-vector-database/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-qdrant_whatis-2">[↑](https://systems-analysis.info/int/Vector_Databases#cite_ref-qdrant_whatis_2-0) «What is a Vector Database?». *Qdrant Blog*. <a href="https://qdrant.tech/articles/what-is-vector-database/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-lakefs_embeddings-3">[↑](https://systems-analysis.info/int/Vector_Databases#cite_ref-lakefs_embeddings_3-0) «What Are Vector Embeddings?». *LakeFS*. <a href="https://lakefs.io/blog/vector-embeddings/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-zilliz_embeddings-4">[↑](https://systems-analysis.info/int/Vector_Databases#cite_ref-zilliz_embeddings_4-0) «What are embeddings?». *Zilliz*. <a href="https://zilliz.com/learn/what-are-embeddings/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-sahoo2025-5">[↑](https://systems-analysis.info/int/Vector_Databases#cite_ref-sahoo2025_5-0) Sahoo, A., Maiti, J. «A Comparative Study of Similarity Metrics for Textual Embeddings». *arXiv:2501.01234*. <a href="https://arxiv.org/abs/2501.01234" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-elastic_metrics-6">[↑](https://systems-analysis.info/int/Vector_Databases#cite_ref-elastic_metrics_6-0) «Vector search and dense vector fields». *Elastic*. <a href="https://www.elastic.co/guide/en/elasticsearch/reference/current/knn-search.html" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-hnsw_paper-7">[↑](https://systems-analysis.info/int/Vector_Databases#cite_ref-hnsw_paper_7-0) Malkov, Y. A., Yashunin, D. A. «Efficient and robust approximate nearest neighbor search using Hierarchical Navigable Small World graphs». *arXiv:1603.09320*. <a href="https://arxiv.org/abs/1603.09320" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-faiss_ivf-8">[↑](https://systems-analysis.info/int/Vector_Databases#cite_ref-faiss_ivf_8-0) «The index IVF». *FAISS Wiki*. <a href="https://github.com/facebookresearch/faiss/wiki/The-index-IVF" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-datar2004-9">[↑](https://systems-analysis.info/int/Vector_Databases#cite_ref-datar2004_9-0) Datar, M., et al. «Locality-Sensitive Hashing Scheme Based on p-Stable Distributions». *Symposium on Computational Geometry*. <a href="http://www.mit.edu/~andoni/LSH/papers/vldb04.pdf" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-rag_lewis2020-10">[↑](https://systems-analysis.info/int/Vector_Databases#cite_ref-rag_lewis2020_10-0) Lewis, P., et al. «Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks». *arXiv:2005.11401*. <a href="https://arxiv.org/abs/2005.11401" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-tbrc_market-11">[↑](https://systems-analysis.info/int/Vector_Databases#cite_ref-tbrc_market_11-0) «Vector Database Global Market Report 2024». *The Business Research Company*. <a href="https://www.thebusinessresearchcompany.com/report/vector-database-global-market-report" class="external autonumber" rel="nofollow">[11]</a></span>
