34 · pgvectorscale 与生态选型
34 · pgvectorscale 与生态选型一句话数据量到上亿、pgvector 吃力时可上 pgvectorscaleStreamingDiskANN扩展再不够才考虑专用向量库。本章标 帮你在继续用 PG和换专用库之间做正确决策。1. pgvector 的规模天花板pgvector 很强但 HNSW 索引要尽量放内存才快。当数据量到上亿级向量维度高1536索引大到内存放不下查询就会因为频繁读磁盘而变慢。这时有两条路pgvectorscale或专用向量库。2. pgvectorscale 是什么pgvectorscale是 Timescale 开源的 PG 扩展在 pgvector 之上增强大规模能力核心是StreamingDiskANN 索引。关键优势DiskANN 思路索引可以高效利用磁盘/SSD不必全塞内存 → 支撑更大数据量、更省内存。SBQ 量化内置流式二值量化进一步降本。过滤性能更好对带过滤的向量检索有专门优化。与 pgvector共存用 pgvector 的vector类型加装 pgvectorscale 提供新索引。3. 基本用法示意-- 需先安装 pgvector 和 pgvectorscale 扩展CREATEEXTENSIONIFNOTEXISTSvector;CREATEEXTENSIONIFNOTEXISTSvectorscale;-- 用 StreamingDiskANN 索引替代 HNSWCREATEINDEXONitemsUSINGdiskann(embedding vector_cosine_ops);-- 查询写法不变依然是 SELECTidFROMitemsORDERBYembedding[...]LIMIT10;查询 SQL 几乎不用改主要是索引类型从hnsw换成diskann。4. HNSW vs StreamingDiskANN维度pgvector HNSWpgvectorscale DiskANN存储偏向内存磁盘友好规模千万~亿亿级更从容内存成本高更低带过滤检索需迭代扫描/分区有专门优化依赖仅 pgvector额外装 pgvectorscale5. 什么时候上 pgvectorscale数据量千万级、内存放得下 → pgvector HNSW 就够 数据量上亿、内存吃紧 → 上 pgvectorscale DiskANN 带过滤检索是主场景、要高性能 → pgvectorscale 有优势6. 什么时候才考虑专用向量库pgvector / pgvectorscale 覆盖了绝大多数场景。只有这些情况才值得引入专用库Milvus、Qdrant、Pinecone 等信号说明数十亿~百亿级向量超出单 PG 舒适区极高检索 QPS需要专门的分布式向量引擎团队已有向量库运维能力边际成本低需要向量库特有功能如特定 ANN 算法、GPU 加速7. 选择 PG 系的核心理由别轻易迁走除非规模真的顶天优先留在 PG 生态因为✅向量和业务数据同库能 JOIN、能事务、一致性强。✅一套技术栈不用多维护一个分布式系统。✅过滤 向量一条 SQL混合查询自然专用库常较弱。✅ 迁移成本、运维成本都低。很多团队盲目上专用向量库最后发现数据同步 双系统运维的成本远超收益。8. 决策树数据量 ├─ 千万级以内 ──► pgvectorHNSW ├─ 上亿、内存紧 ─► pgvectorscaleStreamingDiskANN └─ 数十亿/超高QPS/特殊需求 ──► 评估专用向量库 但先确认 PG 系真的扛不住9. 一句话总结pgvector 撑千万级上亿且内存紧就上 pgvectorscale 的 DiskANN磁盘友好、更省内存只有数十亿级或超高 QPS 才考虑专用向量库能留在 PG 就别轻易迁走。➡️ 下一章35-容量规划与成本估算.md算清楚多少数据要多少资源和钱。