登录社区云,与社区用户共同成长
邀请您加入社区
图 7:本章总结Vector Store 不负责让模型变聪明。它负责把资料找准。找得准,模型才有机会答得准。找不准,后面的 Prompt 再漂亮,模型也只能胡说。源码层面,它就是一套统一抽象:Document 入库,Embedding 生成向量,VectorStore 保存索引,Retriever 调用检索,最后返回 List[Document]。工程层面,它是一套选型问题:小数据用轻量方案,快速
通过本文,你已经掌握了Milvus和Redis从安装、配置到基础使用的完整流程。Milvus 帮助你轻松应对向量相似性搜索等 AI 场景,而 Redis 则是提升应用性能的缓存利器。建议在开发环境先用 Docker 快速搭建,生产环境则根据数据量、并发和可用性要求进行细致的配置与集群部署。不断实践,探索它们更强大的高级功能吧!
电商语义搜索与推荐系统实践 本文介绍了基于Milvus向量引擎和阿里云通义模型的电商语义搜索解决方案,解决传统关键词检索在语义理解、推荐多样性等方面的不足。系统通过多字段拼接生成商品语义向量(如品牌、分类、卖点),支持自然语言搜索、相似商品推荐及重复商品检测。采用SpringBoot+Java技术栈,实现异步向量构建、HNSW索引优化等工程化设计,满足280万商品规模下的高性能检索(P99;30m
目前建档功能已经完成了主要闭环,但还有一些可以继续优化的地方:第一,管理端可以增加“原始回答”和“AI 结构化结果”的对照展示。这样可以更直观看出 AI 是否理解正确。第二,支持管理员手动修订档案。因为 AI 整理结果不一定百分百准确,如果管理员可以修改结构化字段和 Markdown,会更适合后续运营。第三,支持重新调用 AI 整理档案。后续如果优化了 prompt,可以基于已有原始问答重新生成档
到这里大模型应用开发的技术已经全部讲完,之前内容向量数据库为了从原理让大家理解,采用手写的Numpy实现的Json本地文件存储和一些轻量级的向量数据库。这里给大家介绍一款开源的企业级向量数据库,也是目前被广泛应用的数据库之一。
Milvus:企业级向量数据库解决方案 摘要:Milvus是一款专为大规模向量数据设计的高性能开源数据库,采用分布式架构解决单机数据库在十亿级向量场景下的性能瓶颈。其核心优势包括:1)存算分离的微服务架构,支持水平扩展;2)支持IVF、HNSW等高效ANN索引算法;3)提供四种一致性级别(强一致到最终一致)满足不同业务需求;4)支持多副本和故障转移机制确保高可用性。与轻量级方案ChromaDB相比
本文探讨了RAG(检索增强生成)技术在实际生产环境中的优化实践。通过同时接入Chroma和Milvus两种向量数据库,构建了一个支持混合检索的知识库系统。系统核心创新点包括:文档解析阶段保留Markdown结构、基于Token的智能文本切分、向量与BM25混合检索策略、查询扩展与RRF融合算法,以及重排序模型的应用。文章详细介绍了技术选型考量、文档处理流程、检索链路设计,并对比了不同方案的优缺点。
长期记忆(存储 Agent 对话历史的知识片段)、知识库索引(RAG 的核心组件)和语义检索引擎(替代传统关键词搜索)。无论选择哪个产品,都要关注三个关键指标:召回率、查询延迟和写入吞吐量。在实际项目中,我建议先用 Chroma 快速验证方案可行性,当数据量增长或性能成为瓶颈时再平滑迁移到 Milvus 或 Qdrant。这种渐进式策略可以避免过早引入复杂的基础设施,同时保证后续的扩展能力。向量数
向量数据库已经从「有没有必要用」的阶段进入了「怎么用好」的阶段。对于 AI 应用开发者来说,理解不同向量数据库的定位和权衡,比纠结于某一种技术的细节更重要。从 Milvus 的工业级能力到 Chroma 的极简体验,向量数据库正在不断降低 AI 应用的门槛,让开发者能更专注于业务逻辑而非基础设施。
本文介绍了如何通过DBAPI企业版的HTTP执行器参数映射功能接入Milvus向量数据库。主要内容包括: Milvus简介:专为AI设计的开源向量数据库,支持海量向量存储和相似度搜索 DBAPI接入优势:统一API管理、参数映射简化、安全管控、零代码对接 核心功能:自定义映射模式通过JSON模板和Groovy表达式实现参数转换 实战步骤: 创建HTTP数据源指向Milvus服务 配置插入向量API
本文深入分析2026向量数据库技术选型:从Milvus到Pinecone,RAG场景下的性能对比与最佳实践:技术突破与开发实践全解析的核心技术突破、架构设计和开发实践,为AI开发者提供可落地的技术参考。
本文将以实战为导向,从零开始手把手带你完成以下目标:深入理解 Milvus 与 Redis 在 AI 系统架构中的定位与作用掌握 Docker Desktop 的安装与环境配置使用 Docker Compose 一键编排并部署 Milvus 和 Redis通过 Python SDK 完成服务的连接验证与基本操作了解常见问题的排查与解决思路无论你是刚接触容器化技术的新手,还是需要快速搭建本地开发环境
从本地文件夹 all-MiniLM-L6-v2 中加载预训练好的句子嵌入模型,创建一个可以直接把文字转成语义向量的工具all-MiniLM-L6-v2 放到项目同级目录。print(f"相似度得分:{hit['distance']:.4f} | 内容:{hit['entity']['text']}")这行代码是LangChain 里专门用来切分长文本的工具,作用只有一个:把一篇长文章、长文档,切成
看到这个报错先别急,这个问题通常是由于你拉取的 Milvus 镜像版本与系统的 NVIDIA 驱动,或是与 NVIDIA Container Toolkit 版本不兼容导致的。这是一个软硬件版本匹配的问题。我们可以通过以下三步,重新配置一个能正确调用 GPU 的 Milvus 环境。
在前一篇文章中,我们学习了 Embedding 模型如何将文本转换为语义向量,并构建了基于内存的文本分类器。但当你需要将成千上万甚至上亿个向量持久化存储并实现毫秒级检索时,简单的内存存储就力不从心了。向量数据库(Vector Database)正是解决这一挑战的核心基础设施,它专门优化了高维向量的存储、索引和相似度搜索。
面试官可能会这么问:"现在模型能力、工具调用、MCP 都成熟了,为什么 Agent 真正上生产还是容易翻车?"这个问题很关键。很多录友会说:"因为模型还会幻觉。"
过去八九年,我们一直在做一件事:把向量数据库从一个很小众的系统方向,做成 AI 基础设施里的关键组件。
过去大半年里,我一直在帮不同规模的团队落地 AI Coding。从最早的一两个人试点,到十几个人的团队尝试让 AI 参与日常交付,再到开始设计下一步的演进路径,我反复碰到同一个现象:试点阶段所有人都很兴奋——代码生成快,骨架搭得漂亮,连测试都能帮忙补上几条。但到了推广阶段,事情就开始走形。
SDD:Spec-Driven Development,中文叫规格驱动开发,是在正式编码之前,先把需求变更的目标、范围、系统行为、设计约束和任务拆分通过文档(规格文档)确定下来,再让AI按照这些文档去开发,能够把模糊需求变成稳定的工程上下文,从而减少AI自己猜需求、误改历史逻辑和实现跑偏的问题。
医疗 AI 最重要的边界不是“能不能回答”,而是不能在证据不足、版本不明、责任未闭环时假装给出临床结论。如果一名住院医把这样的问题交给 AI:一位 58 岁男性,反复发热三周,胸部 CT 有磨玻璃影,肝酶升高,外院用过两轮抗生素无效,既往有类风湿关节炎并长期服用甲氨蝶呤,最近还出现皮疹和轻度低氧;请判断下一步检查和用药策略。这个问题看上去像“疑难病例问答”,实际上不是一个问答问题,而是一个由病历时
过去我们开发 AI 应用,最常见的方式是:用户输入一句话,模型返回一段回答。这种方式适合聊天、问答、内容生成,但一旦你想让 AI 完成更复杂的任务,比如:
它最大的差异化在于闭环学习:在用工具解决问题的同时,它会写下可复用的 “skill” 文档,并维护一个持久化的记忆文件——这意味着这个 agent 真的会越用越聪明。Hermes 就是一个 harness:它的 47 个工具、四层审批、迭代预算、SessionDB——所有这些都不是「让模型变聪明」,是「让一个会犯错的幽灵在生产里能用」。跳过这一招,你的前缀缓存就完蛋了。)会在通用工具派发之前被拦截
随着 AI 应用的爆发式增长,如何设计一套既能支撑海量用户,又能控制运维复杂度的架构,成为每一位技术负责人必须面对的课题。轻量高效型:面向百万级用户,以最低成本快速落地分布式高性能型:面向千万至亿级用户,支撑高并发和海量向量检索无论你的产品处于哪个阶段,都能从中找到适合的架构参考。维度百万级方案千万/亿级方案Redis主从集群(≥12 节点)PostgreSQL主从Citus 分片 / TiDB向
但到了企业级 Agent 场景,仅靠一次 LLM 调用或一个 RAG 链路就不够了。真实业务往往需要:
如果你最近也在看 Agent 框架,会发现很多项目的问题不是「能不能调模型」,而是消息从哪来、上下文怎么保住、工具怎么接、中途怎么停、历史怎么找回来。Hermes Agent 这篇架构拆解刚好把这些工程细节摊开了。它不是只讲一个漂亮的 Agent 循环,而是把命令行、消息网关、IDE 插件、工具注册、压缩和会话存储放在同一张图里看,适合想自己搭 Agent 系统的开发者细读。
Agent 落地会遇到哪些坑?稳定性、安全、成本、可解释性,这四大挑战。能具体说说吗?加超时、加权限控制、用小模型降成本、加日志。
本文介绍了AgentX技术专栏中的双层记忆架构设计,通过Redis实现短期记忆存储和Milvus实现长期记忆存储,解决LLM无状态问题。Redis存储最近20轮对话,24小时TTL自动过期,保证多实例一致性;Milvus存储语义化知识片段,支持RAG检索。文章详细解析了RedisMemoryStore的实现、Fallback机制保障高可用,以及如何与LangChain4j集成。同时总结了序列化、m
很多人对 RAG 的第一印象,仍然停留在一张非常简洁的架构图里:前端负责提问,后端负责调度,向量库负责检索,大模型负责回答。这张图当然没有错。它适合解释 RAG 的基本原理,也足够让人快速理解“检索增强生成”这件事。但问题在于,一旦系统从 Demo 走向真实业务,这张图就开始不够用了。
Milvus是一款高性能开源向量数据库,专为相似性搜索设计,支持十亿级向量的毫秒级检索。其2.x版本采用分布式架构,包含接入层、协调服务层、工作节点层和存储层,支持多语言SDK和多种索引类型。Milvus 2.3-2.4版本新增GPU加速、稀疏向量支持、混合检索等特性。数据模型包含Collection、Partition、Field等核心概念,支持多种向量和标量数据类型。学习路线分为基础概念、性能
本文介绍了Milvus向量数据库的核心概念、性能特点和部署方式。Milvus是一款开源的高性能向量数据库,支持多种向量索引类型和搜索功能,具备云原生架构和分布式扩展能力。文章详细阐述了Milvus的关键特性,包括非结构化数据处理、多模态搜索、大模型赋能等,并对比了其与内存数据库的性能差异。最后提供了Milvus的三种部署方案,重点说明了Docker安装Standalone版本的具体步骤。Milvu
探讨了构建实用Agent记忆系统关键作用。文章提出三层记忆架构:工作记忆(处理当前任务)、情景记忆(记录历史事件)和语义记忆(存储长期知识),并分析了HER机制如何从失败中学习。通过医疗问答,展示不同记忆层协同工作:工作记忆保持上下文连贯,情景记忆召回相似对话,语义记忆提供专业知识,HER则优化后续响应策略。还给出工程实现建议,包括Redis存工作记忆、MySQL+Milvus管理情景记忆、知识图
RAG 进阶:用 Milvus + bge-m3 构建语义企业知识库 本文介绍了如何利用 Milvus 向量数据库和 bge-m3 嵌入模型构建比传统 ES 更懂语义的企业知识库系统。文章首先分析了 ES 关键词检索在口语化查询场景下的结构性缺陷,指出向量检索通过语义相似度匹配能有效解决"用户提问与文档术语不匹配"的问题。重点讲解了 bge-m3 模型的特点(支持稠密、稀疏和多向量三种检索模式)和
你是不是也觉得"调好 Prompt 就万事大吉"了?说实话,小编当初也这么想。但随着项目越做越复杂,我才发现——Prompt 只是起点,后面还有两层更硬核的工程等着你。本文带你一口气吃透 AI 工程的三次进化:Prompt Engineering → Context Engineering → Harness Engineering。零基础友好,万字长文,建议收藏慢慢看。
本文系统介绍了开源分布式向量数据库Milvus的核心架构与索引选型。Milvus采用分层解耦设计,包含Proxy接入层、Coordinator协调层、Workers执行层和DurableStorage存储层,支持弹性扩展。重点解析了FLAT、IVF_FLAT、IVF_SQ8、HNSW、SCANN和DISKANN六种索引类型的特点及适用场景,并对比了L2、IP和COSINE三种相似度量方式。作为RA
本文记录了我独立开发"水质三维智能监测与分析系统"过程中,在 AI 工程化方向积累的三个核心实战经验。文章涉及自研 Agent 工具调用框架的架构设计与流式难题、RAG 四层检索的参数调优与效果对比、以及 Milvus 向量数据库从连接超时到数据一致性的全线防御策略。项目完整源码已开源在 GitHub。
本文解析了Milvus中稠密向量与稀疏向量的核心概念与应用。稠密向量擅长语义理解,表现为固定长度的高维浮点数组;稀疏向量则专注于精准字面匹配,采用权重矩阵结构。文章详细阐述了L2、COSINE和IP三种距离度量方式的适用场景,以及归一化带来的性能优化。特别强调了BM25稀疏向量的抗噪机制和多路混合检索的实现逻辑,包括Python代码示例。最后指出生产环境中必须保持模型一致性,并提供了不同业务场景下
2026年2月,OpenAI发了一篇博客,悄悄重新定义了软件工程师的日常工作。标题只有两个词: **"Harness Engineering"** 。
本文介绍 Milvus 在 RAG 开发中的实战:从 Docker 部署 etcd、MinIO 与 Milvus 开始,使用阿里云 Embedding 模型向量化文本,通过 PyMilvus 完成存储与检索,并结合大模型生成答案。对比 RecursiveCharacterTextSplitter 与 SemanticChunker 的优缺点,演示 DirectoryLoader、PyMuPDFLo
摘要:Milvus是一款开源向量数据库,专为处理AI时代的非结构化数据(文本、图像等)而设计。它支持三种部署模式(Lite/Standalone/Distributed),采用计算与存储分离的云原生架构。核心功能包括:1)高效向量检索,支持十亿级数据毫秒响应;2)混合搜索能力,结合向量相似性、标量过滤和全文检索;3)丰富的索引类型(HNSW/IVF/DISKANN等)。通过Schema定义数据模型
RAG 系统上线后答案出错,绝大多数团队的第一反应都是换更贵的模型、反复调试 prompt。但有时候,问题其实出在检索层,RAG根本没有召回正确的文档。而这种问题,如果没有量化评估,几乎很难被发现。
他们以为向量数据库就是"把向量存进去、搜出来",选哪个差别不大。但真的上了生产才发现:选错了,要么搜得太慢,要么存得太贵,要么你需要的功能它不支持。
大模型不是从天上掉下来的,它是一套严密的工程流程的产物,每一个你能感知到的行为,背后都有对应的训练决策。模型"知识丰富"——预训练数据的功劳模型"听得懂人话"——SFT 微调的功劳模型"不乱说话"——RLHF 对齐的功劳模型"能快速响应"——量化和工程优化的功劳模型"答案随机/确定"——你调的 temperature 参数的功劳当模型答错了,你知道这可能是训练数据里没有这个知识,也可能是 SFT
摘要:RAGEval-Chat V2.0项目实现了从CLI到Web应用的架构升级,采用FastAPI+Vue3前后端分离设计,集成Docker一键部署方案。系统核心功能包括基于SSE的流式对话、知识库可视化管理和RAG质量评估体系,支持Recall@K、MRR等指标量化分析。项目创新性地引入AICoding范式,将开发者角色转变为"架构师+指挥官",并计划未来实现自动化参数调优
总体来看,通过这次升级我感觉 FAISS 知识向量数据库更像是一种内存级的知识向量数据库,Milvus 像是更像是一种存在文件系统里面的数据库,可能用传统数据库打比方,FAISS 更像是 Redis ,Milvus像是Mysql。当前的 Paper-RAG-Agent-with-LangGraph 系统使用的 FAISS 知识向量数据库,但是和落地场景下的实际项目还有差距,这次升级主要目的是把这个
**RAG(检索增强生成)** 通过检索外部知识增强大模型回答,解决幻觉与知识滞后。核心流程:文档切片(滑动窗口500/50)→ Embedding(统一模型,本地BGE或云端API)→ 向量检索(Milvus)→ 可选混合检索(加BM25+RRF)→ 可选Rerank(高精度)。索引默认IVF_FLAT,大数据用HNSW;度量选COSINE。选型原则:敏感数据用本地BGE;含专有名词用混合检索;
本文介绍了如何在SpringAI项目中集成Milvus向量数据库实现RAG(检索增强生成)功能。主要内容包括:1)MilvusLite在Windows环境的快速安装指南;2)SpringAI项目配置,包括依赖添加和yml文件设置;3)核心代码实现,涵盖文档加载、文本分块、向量存储及RAG问答流程;4)方案优势分析,强调轻量便捷、持久化存储和兼容性特点。该方案通过统一VectorStore接口实现向
map(r -> new 检索结果(r.getText(), r.getScore()))**技术栈**:Java / Spring Boot / Milvus / RAG / 向量检索。- ✅ **丰富的 SDK**:Java、Python、Go、Node.js 全覆盖。- ✅ **多种索引**:HNSW、IVF_PQ、DiskANN 等按需选择。- **RAG 知识库首选**:Milvus(独
摘要: 某教育集团高中学生管理系统V2.0采用FastAPI+异步SQLAlchemy技术栈,深度融合AI能力,打造智能化管理平台。系统通过AI Agent架构解决传统管理痛点:数据孤岛、评价主观、家校沟通生硬等问题。核心创新包括AI自动评语生成、违纪处理话术教练、学业趋势分析及沉浸式文化学习体验。采用分层解耦设计,支持多模态存储和混合检索,效率较传统方式提升60倍。系统基于国产大模型,通过RBA
本文系统对比了五大主流向量数据库(Chroma、Faiss、Milvus、Pinecone、Elasticsearch)的核心原理与适用场景。作者从RAG应用需求出发,首先解析向量数据库的核心概念,包括ANN算法(HNSW、IVF等)和关键性能指标(QPS、召回率等)。随后对每个数据库进行深度剖析:Chroma适合轻量级入门,Faiss专注高性能检索,Milvus提供分布式能力,Pinecone是