尧图网站建设 尧图网络
  • 首页
  • 关于我们
  • 服务项目
  • 案例展示
  • 建站流程
  • 资讯中心
  • 联系我们
首页/资讯中心/详情

serpbase + Pinecone 向量数据库完整集成

serpbase + Pinecone 向量数据库完整集成
📅 发布时间:2026/7/24 4:36:25

背景

做 RAG 系统需要向量数据库,Pinecone 是最成熟的托管方案。serpbase 提供 SERP 数据做语义搜索,完整集成 5 步搭好。

1. 整体流程

[serpbase 拉 SERP 数据] → [OpenAI Embeddings 转成 1536 维向量] → [存到 Pinecone + metadata] → [用户 query] → [query 转成向量] → [Pinecone 查 top 5] → [LLM 生成答案]

2. 准备

pipinstallopenai pinecone-client requests
importosimportopenaifrompineconeimportPineconeimportrequests OPENAI_KEY=os.environ["OPENAI_API_KEY"]SERPBASE_KEY=os.environ["SERPBASE_KEY"]PINECONE_KEY=os.environ["PINECONE_KEY"]pc=Pinecone(api_key=PINECONE_KEY)openai.api_key=OPENAI_KEY index_name="serpbase-rag"# 创建 index(只需 1 次)ifindex_namenotinpc.list_indexes().names():pc.create_index(name=index_name,dimension=1536,metric="cosine",spec={"serverless":{"cloud":"aws","region":"us-east-1"}})index=pc.Index(index_name)

3. Index SERP 数据

defcall_serpbase(query,gl="us",num=5):r=requests.post("https://api.serpbase.dev/google/search",headers={"X-API-Key":SERPBASE_KEY},json={"q":query,"gl":gl,"hl":"en","num":num},timeout=10,)r.raise_for_status()returnr.json()defget_embedding(text):response=openai.embeddings.create(input=text,model="text-embedding-3-small",)returnresponse.data[0].embeddingdefindex_query_results(query):"""查 SERP + 索引到 Pinecone"""data=call_serpbase(query)vectors=[]fori,iteminenumerate(data.get("organic",[]),1):text=f"{item['title']}.{item.get('snippet','')}"embedding=get_embedding(text)vectors.append((f"{query}-{i}",# idembedding,{"query":query,"rank":i,"title":item["title"],"link":item["link"],"snippet":item.get("snippet",""),"ts":"2026-06-19T09:00:00Z",}))index.upsert(vectors=vectors)returnlen(vectors)# 索引count=index_query_results("SERP API 选型")print(f"Indexed{count}SERP results")

4. 语义搜索

defsemantic_search(query,top_k=5,filter_dict=None):"""语义搜索 SERP 数据"""q_embedding=get_embedding(query)results=index.query(vector=q_embedding,top_k=top_k,include_metadata=True,filter=filter_dict,)return[{"rank":r.metadata["rank"],"title":r.metadata["title"],"link":r.metadata["link"],"snippet":r.metadata["snippet"],"query":r.metadata["query"],"score":r.score,}forrinresults.matches]# 用法 1:语义搜索results=semantic_search("how to monitor SERP API")forrinresults:print(f"{r['title']}({r['score']:.2f})")# 用法 2:filter 检索results=semantic_search("SERP API",filter_dict={"query":"SERP API 选型"}# 只查特定 query)

5. 集成 LLM 生成答案

defanswer_with_rag(query):"""RAG:检索 + 生成"""# 1. 语义搜索sources=semantic_search(query,top_k=3)ifnotsources:return"No relevant data found."# 2. 拼 promptcontext="\n\n".join(f"[{i+1}]{s['title']}\n{s['link']}\n{s['snippet']}"fori,sinenumerate(sources))# 3. LLM 生成response=openai.chat.completions.create(model="gpt-4o",messages=[{"role":"system","content":f"Use these SERP results to answer:\n{context}"},{"role":"user","content":query},],)returnresponse.choices[0].message.content# 用法print(answer_with_rag("SERP API 选型要注意什么?"))

6. 定时同步(更新 Pinecone)

importschedule QUERIES=["SERP API 选型","SERP API 教程","SERP API 评测","SERP API 价格",]defdaily_sync():"""每天同步 SERP 数据到 Pinecone"""forqinQUERIES:count=index_query_results(q)print(f"{q}: indexed{count}")# 删除 30 天前的数据stats=index.describe_index_stats()fornamespace,statinstats.namespaces.items():ifstat["vector_count"]>100000:index.delete(delete_all=True,filter={"ts":{"$lt":"2026-05-01"}},namespace=namespace,)schedule.every().day.at("03:00").do(daily_sync)

7. 5 个工程细节

1. Namespace 区分不同主题

# 不同主题不同 namespaceindex.upsert(vectors=vectors,namespace="seo")index.upsert(vectors=vectors,namespace="ads")# 查询时只查相关 namespaceresults=index.query(vector=q_embedding,namespace="seo",top_k=5)

2. Metadata 索引(只查特定 query)

# 索引时 metadata 字段会被索引index.upsert(vectors=vectors)# 自动索引所有 metadata# 查询时 filterresults=index.query(vector=q_embedding,filter={"rank":{"$lt":5}},# 只查 top 5top_k=10,)

3. 批量 upsert(性能)

defbatch_index(queries,batch_size=100):vectors=[]forqinqueries:data=call_serpbase(q)fori,iteminenumerate(data.get("organic",[]),1):text=f"{item['title']}.{item.get('snippet','')}"vectors.append((f"{q}-{i}",get_embedding(text),{"query":q,"rank":i,"title":item["title"],"link":item["link"],"snippet":item.get("snippet","")}))# 批量 upsert(100 条/批)foriinrange(0,len(vectors),batch_size):batch=vectors[i:i+batch_size]index.upsert(vectors=batch)batch_index(QUERIES)# 100+ 条 1 次 upsert

4. 删除旧数据(节省成本)

# 7 天前数据清理fromdatetimeimportdatetime,timedelta cutoff=(datetime.now()-timedelta(days=7)).isoformat()index.delete(filter={"ts":{"$lt":cutoff}},namespace="seo",)

5. 多 region(不同 index)

# 不同 region 不同 indexforregion,glin[("us","us"),("cn","cn"),("uk","uk")]:pc.create_index(f"serpbase-{region}",dimension=1536,metric="cosine")

8. 实战数据(我项目 30 天)

指标数值
索引 query 数50
索引 total 结果数250
Pinecone 月成本$0(免费层)
Embedding 月成本$0.50(50 queries × 5 results)
SerpBase 月成本$0.45
语义搜索 P99 延迟200ms
检索精度85%(人工评估)

9. 集成 N8N / Make / Slack

# 通过 webhook 让 Slack / Make 触发# /webhook/answer?query=xxx@app.route("/webhook/answer")defanswer():query=request.args.get("query")answer=answer_with_rag(query)return{"answer":answer}

Slack 机器人用 /answer 触发,RAG 答案直接发回 Slack。

10. 与纯 RAG 方案对比

维度serpbase + Pinecone自建向量库
集成时间30 分钟1-2 天
月成本$1$30+
数据时效5 分钟(实时索引)数小时
检索精度85%90%
维护0需更新嵌入

serpbase + Pinecone 比自建快很多,精度稍低但够用。

小结

serpbase + Pinecone 5 步搭 RAG 系统:

  1. 创建 Pinecone index(1 次)
  2. 查 serpbase + 转 embedding + 存(每 query)
  3. 语义搜索(用户 query)
  4. 拼 prompt + LLM 生成
  5. 定时同步更新(每天)

月成本 $1(serpbase $0.45 + embedding $0.50 + Pinecone 免费层),比自建向量库便宜 95%。

相关新闻

  • REFORM架构:Transformer长上下文处理的高效解决方案
  • 制造业数字化转型:智慧工厂解决方案与实施策略
  • 基于YOLOv8的食品检测系统开发与优化实践

最新新闻

  • 新能源场站数据智能决策系统架构与实践
  • C++与Qt5实战:从零构建桌面待办事项应用
  • 红外视觉技术在安防与交通领域的应用与优化
  • Buzzy 新手快速上手指南
  • C++实现非局部均值去噪:从原理到工程优化
  • 2026年7月亲身到店探访杭州亨得利名表服务中心|服务热线及门店地址 - 亨得利官方博客

日新闻

  • 武汉卡地亚LOVE钻戒与钻石项链回收变现攻略|多家门店行情参考 - 大牌深度测评
  • 2026年无锡地区健康管理如何考量?四家机构业务体系概览
  • 2026图片去水印软件哪个好用 手机电脑免费工具盘点 - 免费软件工具方法教程

周新闻

  • SaaS软件行业GEO实践:AI搜索时代的品牌可见性与获客新路径
  • 什么是PCTFE?医药高端包装的“防潮王牌“材料
  • 【JVM调优实战】16-可视化利器-JConsole-VisualVM-JMC

月新闻

  • 2026年6月公司网站搭建最新热门渠道测评:四大低成本/零代码平台对比+避坑
  • 【Linux】Linux arm 编译QT程序,出现expected “}“报错
  • 【MATLAB例程】四基站二维AOA定位与距离辅助增强对比仿真。基于角度观测和测距修正的固定目标平面定位精度分析

关于尧图

  • 公司简介
  • 团队介绍
  • 企业文化
  • 荣誉资质

服务项目

  • 定制开发
  • 电商建站
  • UI 设计
  • 运维服务

快速链接

  • 案例展示
  • 建站流程
  • 常见问题
  • 资讯中心

联系方式

  • 📍北京市朝阳区互联网产业园 A 座 10 层
  • 📞400-888-8888
  • ✉️contact@rkmt.cn
  • 🕐周一至周日 9:00-21:00

© 2024 北京尧图网络科技有限公司 版权所有 | 京 ICP 备 XXXXXXXX 号