登录社区云,与社区用户共同成长
邀请您加入社区
《TimesFM2.5时间序列大模型快速实践指南》摘要: Google开源的时间序列基础模型TimesFM2.5(200M)支持开箱即用的预测分析,无需训练即可应用于单变量预测、多变量协变量建模和异常检测三大场景。该模型特点包括:①直接输出概率分布(10%-99%分位数);②支持512点长序列输入;③跨平台兼容性。本文通过全球温度预测(单变量)、异常检测(无监督)和零售销售预测(引入促销/天气等协
本文提供Windows系统下部署Google TimesFM2.5时间序列模型的完整指南: 环境准备 需安装Miniconda/Anaconda 创建Python 3.11虚拟环境 修复pip并安装必要依赖包 提供GPU加速安装选项 关键配置 设置HuggingFace国内镜像(hf-mirror.com) 执行系统预检脚本验证环境 首次运行会自动下载约800MB模型文件 测试验证 提供完整测试脚
LoRA通过低秩分解,只需要训练极少量的附加参数(通常是原模型参数的0.1%-1%),就能在特定任务上达到接近全量微调的效果。这意味着:- 在消费级GPU上(24GB VRAM)可以微调7B甚至13B参数模型- 微调时间从几天缩短到几小时- 多个任务的LoRA权重可以单独管理,随时切换- 部署时可以与基础模型合并,不增加推理开销本文将从工程实践角度,给出LoRA微调的完整指南,覆盖数据准备、训练配
但在生产系统中,你的下游代码需要的不是一段流畅的自然语言,而是可解析的、格式固定的结构化数据。:如果用本地模型,Outlines的约束解码比提示词方式可靠100倍结构化输出是LLM工程化的基础设施,掌握它,你的AI应用才能真正稳定地运行在生产环境中。—## 四、本地模型的结构化输出:Outlines当你使用Llama、Qwen、Mistral等本地模型时,无法依赖云端API的结构化输出能力。:越复
## 三、上下文管理:解决Vibe Coding最大痛点长时间的Vibe Coding会话中,最常见的问题是"AI开始忘事"——它不再记得项目的架构决策,开始生成与现有代码风格不一致的代码,甚至引入已经修复过的bug。——在享受AI编程加速的同时,建立可持续的代码质量保障体系。—## 一、Vibe Coding的工程化核心:Context Engineering如果说Vibe Coding的核心操
Vibe Coding这个词在2025年开始流行,到2026年已经成为开发者日常工作的一部分。但"Vibe Coding"这个名字带来了一个严重的误解——很多人以为它就是随便用AI写写代码、玩玩原型的事。本文要讨论的是另一个问题:当你需要用AI辅助编程构建真正需要维护的生产系统时,工程化的实践方法是什么。
# 方法一:原生结构化输出(首选)OpenAI、Anthropic等主流模型现在都支持原生的结构化输出,通过在API层面约束输出格式,可靠性比提示词方法高得多。JSON格式对了,但字段值是模型"编的"——比如要求输出置信度(0-1之间的数字),模型输出了0.99999,看起来没问题,其实是没有根据的。LLM的输出天然是自由形式的文本,但AI应用需要的往往是结构化数据。字符串里包含未转义的特殊字符,
核心工具python# 入门阶段必须熟练掌握的技术栈tools = { "LLM API": ["OpenAI", "Anthropic", "通义千问"], "框架": ["LangChain(基础使用)"], "向量数据库": ["Chroma(本地开发用)", "Pinecone(生产用)"], "Web框架": ["FastAPI"], "环境管理": ["conda", "venv",
本教程系统介绍了VIC水文模型输入数据的完整制备流程。主要内容包括:1)VIC模型核心输入文件概述;2)使用Python统一处理各类空间数据,包括网格生成、地形数据提取、气候态降水计算;3)基于HWSD土壤数据和MODIS植被数据分别制备土壤参数和植被参数;4)利用MERRA-2数据生成强迫文件;5)全局文件配置及模型安装运行说明。教程提供了详细的代码实现和数据处理方法,适用于0.1°×0.1°空
## 反模式3:直接粘贴AI代码到生产永远先在本地跑一遍,跑测试,审查一遍,再merge。—## Vibe Coding的反模式### 反模式1:无限接受AI的建议AI永远会给你一个"看起来能跑的"答案。—## 工作流的三个阶段### 阶段一:意图结晶(Crystallization)在动手写任何代码之前,先把需求说清楚——不是给人听,是给AI听。—## Vibe Coding不是"偷懒",是换一
摘要 本报告分析了QuoteApp智能报价系统的设计与实现情况。该系统面向中小机加工企业,通过AI自动解析图纸特征并计算加工成本,将传统2-3天的报价周期缩短至30分钟。核心功能包括:支持7种图纸格式解析、3D预览引擎、13步成本核算公式链、本地Gemma+云端AI双推理引擎等。系统包含129个Python文件(37,261行代码),UI模块占比44.9%。开发周期36天,提交70次,但存在三大风
有GPU?├── 是 → 需要最高质量?│ ├── 是 → AWQ INT4(vLLM部署)│ └── 否 → BitsAndBytes NF4(快速实验)└── 否 → GGUF Q4_K_M(llama.cpp CPU推理)模型要微调?└── 是 → BitsAndBytes NF4 + QLoRA(4位基础 + LoRA微调)
Context Engineering(上下文工程)错误做法pythonasync def summarize_for_context(long_text: str, focus: str, max_words: int = 300) -> str: """将长文本压缩为聚焦于特定主题的摘要""" prompt = f"""请将以下内容压缩为不超过{max_words}字的摘要。重点保留与"{fo
特征工程是从原始数据中提取、转换和创建新特征以提升机器学习模型性能的关键过程。文章介绍了序贯特征选择(SFS)方法,通过逐步添加最优特征来优化模型表现,并详细探讨了过拟合问题及其解决方案。防止过拟合的技术包括正则化(调整树模型参数、添加Dropout层)、早停机制和集成方法(如Blending)。文中还提供了XGBoost、神经网络和线性模型的具体实现代码,强调通过交叉验证和业务逻辑约束来提升模型
MCP的核心价值json{ "name": "code_review", "description": "代码审查提示模板", "arguments": [ { "name": "code", "description": "需要审查的代码", "required": true }, { "name": "language", "description": "编程语言", "required":
本文介绍了一个基于Ollama本地大模型和RAG架构的财报分析Agent开发过程。文章从实际需求出发,分析了传统财报分析的痛点,详细阐述了技术选型(选择Ollama本地模型保障数据隐私)、开发环境搭建(VSCode+ClaudeCode插件)以及系统架构设计(包含RAG检索增强生成流程)。开发过程中解决了PDF解析OOM、多线程优化等关键问题,通过与longcat-2.0-preview模型的多次
- 国产模型(Kimi K2.6、DeepSeek V4)首次进入全球TOP 2- 中国AI团队在数学推理领域取得决定性优势- 成本效益比:DeepSeek V4 >> 所有国际竞品### 1.2 推理模型专项排行| 模型 | MATH-500 | GPQA | LiveCodeBench ||------|---------|------|---------------|| Kimi K2.6
## 6.2 典型成本参考| 任务类型 | 平均Token消耗 | 费用(Claude 3.5 Sonnet) ||---------|--------------|------------------------|| 代码审查(1个PR) | ~15K tokens | ~$0.05 || 生成单元测试 | ~20K tokens | ~$0.07 || 代码库架构分析 | ~50K token
- 相同 prompt,不同 temperature 会给出不同回答- 模型版本升级,相同 prompt 的行为可能改变- 长对话中早期内容会影响后续回答- 工具调用链路非常长,中间任何一步都可能失败这意味着 LLM 测试不能直接断言输出,而要。:分层运行,控制成本,单测跑每次提交,E2E 只在定时任务中跑测试不能消灭 LLM 应用的不确定性,但能把它控制在可接受的范围内。这才是工程化的核心目标。
本文介绍了在消费级显卡(如RTX 4060 8G)上实现大语言模型人类对齐的奖励模型(RM)训练方法。文章首先解释了为什么需要进行人类对齐,指出预训练模型存在的三大缺陷:幻觉问题、指令遵循困难和价值观未对齐。接着概述了RLHF(基于人类反馈的强化学习)的核心三步流程,重点聚焦于奖励模型的训练与实现。详细阐述了RM模型的输入输出规范、结构改造和数学原理,包括Bradley-Terry模型和极大似然估
## 1.2 延迟和吞吐量的双重压力推理优化目标通常有两个方向:| 目标 | 关注指标 | 典型场景 ||------|----------|----------|| 低延迟 | TTFT(首 token 时间)、TPS(单请求速度)| 实时对话、代码补全 || 高吞吐 | RPS(每秒请求数)、GPU 利用率 | 批量处理、异步任务 |两者往往相互制约,需要根据业务场景做取舍。更糟糕的是,许多企
## 方案五:GGUF(llama.cpp格式)### 什么是GGUFGGUF(GPT-Generated Unified Format)是llama.cpp生态的标准量化格式,特点是:1.:- 量化质量优于BitsAndBytes(使用了校准数据)- 需要一次性量化过程(时间成本)- 推理速度快(Triton/CUDA kernel优化)-方法:在量化之前,使用少量校准数据(calibratio
会话上下文上下文工程工具。
节省潜力先量化。
本文是一篇全面的Python3指南,从基础语法到AI开发实战。主要内容包括: 基础数据类型:数字(整数、浮点数、复数)、字符串(f-string格式化、切片操作)、布尔值等核心概念和操作。 数据结构: 列表(增删改查、切片、推导式) 字典(创建、访问、遍历、合并) 集合(去重、集合运算) 元组(不可变性、解包特性) 特色功能: 字符串f-string格式化 列表/字典推导式 集合运算 元组解包 变
本文深入探讨了LangGraph框架如何通过持久化机制解决复杂Agent系统的状态管理问题。核心内容包括:1)区分线程级持久化(Thread和Checkpoint)与跨会话持久化(Store);2)Checkpoint作为执行快照的关键作用,保存状态值、下一步节点等关键信息;3)持久化实现的三大价值:中断恢复、短期记忆支持和调试能力增强。文章强调LangGraph不仅是工作流工具,更是托管状态生命
本文介绍了使用FastAPI和SQLAlchemy 2.0异步ORM进行MySQL数据库开发的全过程。主要内容包括:1)安装异步ORM依赖;2)创建异步数据库引擎和模型类;3)实现自动建表功能;4)通过依赖注入管理数据库会话;5)完成书籍的CRUD操作(增删改查)。文章特别讲解了异步ORM的优势,提供了可直接运行的完整代码,并详细说明了查询、插入、更新和删除操作的实现方法。适合刚学习FastAPI
torch.compile + FlashAttention + 量化。
冷启动优化是关键。
人机协作中的分工优化。
LoRA(Low-Rank Adaptation)已成为2026年大模型微调的事实标准。它让在消费级GPU上微调70B大模型成为可能,让企业以极低成本打造专属领域模型。本文从LoRA的数学本质出发,系统讲解微调全流程、关键超参数调优、常见问题排查,以及生产部署的最佳实践。
大语言模型的推理速度直接决定产品体验与服务成本。一个70B模型如果没有优化,单请求延迟可能高达数分钟。本文系统梳理2026年最主流的LLM推理加速技术,从原理到工程实践,帮助你把推理速度压到极致。
同样是用Cursor,为什么有些人用得飞起,有些人却频繁纠错、反复解释?(新版叫这篇文章将系统讲解Cursor Rules的设计哲学、最佳实践,以及如何用Rules构建一个真正"懂你"的AI编程助手。—## 一、Cursor Rules是什么?Cursor Rules是一套给AI编程助手的"系统级指令"——在每次对话开始之前,这些规则就已经被注入到AI的上下文中,让AI在整个项目中都遵循你的偏好和
2026年4月,阿里云正式发布Qwen3系列模型,这次更新被业界视为国产开源大模型的重要里程碑。Qwen3不仅在多项基准测试上追平甚至超越了国际顶级模型,更重要的是其混合推理(Hybrid Thinking)能力和灵活的MoE架构,为中文场景下的工程实践提供了新的选择。本文从技术层面深度解析Qwen3的架构创新,并给出实际工程落地的最佳实践。
## 1.5 第五代:大规模通用Embedding模型(当前主流)OpenAI text-embedding-3系列、Cohere Embed v3、阿里云通义Embedding等,用数十亿文本对训练,泛化能力极强。:无法捕捉语义,"大模型"和"LLM"是完全不同的向量。### 1.2 第二代:Word2Vec/GloVe(词级静态向量)2013年Word2Vec的出现革命性地引入了语义向量空间:
当模型不确定时,它不会说"我不知道",而是倾向于生成一个"听起来像答案"的序列——这正是幻觉的根源。—## 一、什么是幻觉?:步骤看似合理,但逻辑链条有缺口—## 二、幻觉的根本成因### 2.1 训练数据的噪声LLM从海量互联网文本学习,其中包含:- 错误的维基百科编辑(在被纠正前)- 博客中的主观臆断被当作事实陈述- 过期信息(某项技术"最新版本"在训练截止后已更新)- 数据重复导致特定错误被
训练大模型是「烧钱」,推理大模型是「持续烧钱」。当你的 AI 应用每天有百万次请求时,推理成本直接决定了商业模式的可行性。本文深度解析三大主流推理加速技术:量化、知识蒸馏和投机解码,帮你找到适合自己场景的加速方案。
定位。
全量微调一个 7B 参数的大模型需要 8 张 A100,但 LoRA 让这件事在一张 RTX 4090 上成为现实。本文从原理到实战,带你完整走完用 LoRA 打造专属领域模型的全流程——数据准备、训练配置、合并推理,每一步都有可直接运行的代码。
不只是"怎么做”,更是"为什么这么做":| 决策场景 | 需要权衡的维度 ||---------|-------------|| 选模型 | 精度、成本、延迟、合规、可控性 || 微调vs提示 | 效果上限、维护成本、部署复杂度 || 自建vs托管推理 | 成本、安全性、运维能力 || RAG vs 长上下文 | 准确率、延迟、成本 |- 知道何时用gpt-4o,何时用gpt-4o-mini- 能
## 第一章:提示词设计的基础原则(快速回顾)在深入进阶之前,确认你掌握了这些基础原则:### 原则一:具体优于模糊。### 技术三:动态Few-Shot(基于相似度检索示例)静态Few-Shot的问题是示例固定,对某些输入不够针对性。—## 第二章:高级Prompt技术### 技术一:思维链(Chain-of-Thought)的正确用法CoT不是到处都适用的银弹。:没有评估指标的Prompt优化
”“),(“human”, “当前状态:\n{state}\n\n请决定下一步行动。”,“proposal”: proposal,“action”: “approve_or_reject”})if human_input[“decision”] == “approve”:return {“approved”: True, “messages”: [AIMessage(content=“操作已批准,
本文详细介绍了在WSL2环境下部署vLLM运行大语言模型的完整流程。首先需要具备NVIDIA显卡(≥4GB显存)并安装Python和WSL2。主要步骤包括:1)安装Miniconda并创建Python3.10虚拟环境;2)安装WSL2专用CUDA12.1工具包;3)通过conda安装vLLM框架;4)从魔搭社区下载Qwen3.5-0.8B模型;5)启动API服务并进行测试。整个过程涉及环境配置、依
labview调用halcon实现语义分割,源码,labview2018 64位,halcon22.05,里面包含模型和数据集,包含所有安装包,支持cpu和gpu推理,模型训练可用halcon的DLT。labview调用halcon实现语义分割,源码,labview2018 64位,halcon22.05,里面包含模型和数据集,包含所有安装包,支持cpu和gpu推理,模型训练可用halcon的DL
列举在Optisystem仿真软件中用到的基本功能和元器件,并建立了波分复用传输系统的基本仿真模型,测量了波分复用和解复用后光信号的频谱,通过检测Q因子误码率等数据分析了波分复用设计方案的可行性,并得出了一些结论。这玩意儿就像在光纤里开高速公路,八个车道各自跑不同颜色的光(波长),想想就有意思。列举在Optisystem仿真软件中用到的基本功能和元器件,并建立了波分复用传输系统的基本仿真模型,测量