登录社区云,与社区用户共同成长
邀请您加入社区
清华大学PRIME实验室提出的TTRL(Test-Time Reinforcement Learning)是一种在无标注数据上进行强化学习的新方法,解决了传统RLVR(Reinforcement Learning with Verifiable Rewards)依赖标准答案的局限性。TTRL通过多数投票(majority voting)从模型自身采样中提取伪标签作为奖励信号,驱动GRPO(Grou
GLM-5.2是智谱AI联合清华大学THUDM团队推出的新一代开源稀疏大模型,依托优化的MoE稀疏架构与IndexShare分层索引技术,实现了上下文能力、工程落地性与国产化适配性的全方位升级,是当前国产开源大模型中适配长文本与工程智能任务的核心基座。该模型原生官方接口存在并发配额受限、高频调用波动大、批量实验稳定性差等工程落地问题,难以满足科研批量对照实验、工业级持续迭代开发的需求。针对上述痛点
本身就是你从原始数据中取的 75%,现在 PyCaret 又把它拆成了 70%/30%,用于训练过程中的验证。——它接收你的数据,配置预处理管道,划分训练/测试集,建立交叉验证策略,为后续的所有建模工作做好准备。获得的最佳模型(在你的例子中是 Ridge Classifier)抽取了 75%(576行)作为训练集,但 PyCaret 的。:设置随机种子,保证每次运行代码时抽取的结果都一样(可复现)
类别不平衡(Class Imbalance):数据集中各类别样本数量差距悬殊。常见于欺诈检测、医疗诊断、异常检测等场景。准确率(Accuracy)失效——多数类占 99%,全猜多数类也有 99% 准确率模型偏向多数类,少数类(正类)几乎学不到信号交叉熵损失被多数类主导,梯度更新忽略少数类。
会议记录APP排行没有固定的标准答案,适合你使用场景的就是最好用的,我整理的简单选择路径可以直接用:全团队用飞书协作直接选飞书妙记,需要转写口音方言选讯飞听见,日常用阿里系办公选通义听悟,偶尔用要免费选网易见外,需要自动整理结构化纪要、提取待办行动项,可以考虑听脑AI。
AI 赋能高水平 SCI 全链路实战|从选题→写作→制图→投稿→审稿博弈→冲刺 CNS 顶刊一站式破局
这篇文章总结了15个实用的经营分析模型,帮助财务人员从业务层面深入理解利润变化的原因。核心内容包括: 基础分析模型:同环比分析、趋势分析、结构分析 业务诊断工具:帕累托分析、波士顿矩阵、5Why分析、鱼骨图分析 财务专用模型:本量利分析、杜邦分析、敏感性分析、现金流分析 运营效率工具:人效分析、周转分析 文章强调经营分析要结合业务实际,通过数据发现和解决具体问题。作者提供了现成的分析模板和工具链接
说了这么多,这五个核心技术其实是相互配合的。Token是基础,处理文字的基本单位;MoE提高了效率和专业性,不同任务让不同专家处理;RAG补充了知识的时效性和深度,能查最新资料;强化学习优化了模型表现,通过反馈让它不断进步;智能体扩展了模型的应用范围,让它能和现实世界交互。这五个技术加在一起,让大模型有了现在这样强大的能力。随着技术不断发展,这些技术还会不断进步,大模型也会变得越来越智能、越来越有
论文复现的核心原则是"模块化验证,逐步对齐"。本文的四阶段流程为:精读提取 → 基线搭建 → 逐步对齐 → 消融验证。关键工具为:论文信息提取模板(识别省略信息)、模块级验证器(逐层对比中间输出)、偏差追踪器(记录每次实验与论文的差距)。复现偏差超过 5% 时应回溯定位,而非盲目调参。建议优先复现论文开源代码,确认环境一致后再独立实现。补充落地建议:围绕“论文复现方法论:从阅读到验证的系统化实践框
的本质是一个适配器模式——它将"Agent 多轮交互"(业务关注点)与"RL 训练数据生产"(基础设施关注点)完全解耦。这条解耦线画在了generate()函数上。线以上是 Agent 开发者的世界——OpenAI API、工具调用、业务逻辑。线以下是 RL 基础设施的世界——Session Server、TITO、token 对齐、loss mask、异常降级。Agent 开发者不需要知道线以下
抖音推荐系统通过精密算法实现"千人千面",主要分为三个环节:首先构建512维用户向量和视频向量,通过多模态技术解构视频内容(视觉、音频、文本、图像);其次采用四层漏斗筛选(召回→粗排→精排→重排),结合双塔模型和向量计算从海量内容中精准匹配;最后通过20%的探索机制打破信息茧房,平衡用户偏好与内容多样性。整个系统基于用户实时行为数据持续优化,实现"你在刷抖音,抖音也在算你"的智能交互。
数字孪生和世界模型,二者的技术边界正在慢慢融合吗?
本文提出ReCast框架,针对传统时间序列预测方法在复杂局部模式建模和高计算成本方面的不足,通过分块量化和双路径架构实现轻量高效预测。核心创新是可靠性感知的码本增量更新策略,结合表征质量、历史一致性和OOD敏感性三个可靠性因子,采用分布鲁棒优化实现码本稳健更新。实验表明,ReCast在8个真实数据集上12项指标达到SOTA,仅需1M参数和25ms单轮训练,显著优于现有方法。
应对销量预测中的概念漂移,可通过构建一个轻量级残差校准器与LightGBM热更新结合的混合策略来实现。该策略的核心是:保留一个训练好的LightGBM基础模型,并叠加一个能实时在线更新的残差校准器,最后通过定期热更新LightGBM模型来巩固长期学习效果。| :--- | :--- | :--- | :--- || LightGBM基础模型 | 提供基础销量预测 | 每周或每月(热更新) | 捕捉
RAG评估是确保问答系统质量的关键步骤,通常被忽视但至关重要。文章指出,90%的RAG系统问题源于未经系统评估,而非模型本身。评估应分为检索和生成两个独立阶段:检索阶段关注召回率、MRR和NDCG等指标,确保找到正确文档;生成阶段评估忠实度、相关性、完整性和流畅度,避免幻觉和遗漏。建议结合自动化工具(如Ragas、LangSmith)和人工抽检,并将评估集成到CI/CD流程和生产监控中,形成持续优
聊到最后,这位同学释然了:“我做开发,也就是增删改查。现在开源这么发达,架构也都是抄来抄去。老师也笑了:“是的,真正涉及高并发、架构设计的场景真不多。做管理,技术不重要,横向沟通才重要。你跟业务部门关系搞好了,他们才会告诉你真正的需求和困难。这次私教辅导,没有给他晦涩的算法,也没有给他复杂的框架。而是帮他拨开了职场的迷雾,看清了“混乱”背后的本质和机遇。对于所有技术人来说,职业发展从来不是只有“钻
本篇文章讲一讲机器学习和深度学习模型算法常用的交叉熵损失,它的变形,以及常见应用场景和pytorch的代码适配情况(部分),很多都是自己做实践做项目和学习过程中的心得总结与经验分享,希望大家认真阅读。
它不是给模型唯一标准答案,而是通过人类偏好让模型知道多个候选答案里哪个更符合人类或业务偏好。一句话解释:DPO 直接用“好回答 vs 差回答”的偏好对训练模型,让模型更倾向于好回答,不再单独训练 Reward Model,也不走复杂 PPO 流程。一句话解释:RLHF 不是给模型一个标准答案,而是告诉模型:多个候选答案里,人类更喜欢哪一个。基模越来越强后,低质量垂类微调确实容易被抹平,但控行为、控
整体来看,具身智能数据采集正在形成几条主要路线:灵初智能代表的人类操作数据预训练路线,智元代表的大规模真机轨迹路线,智平方代表的商业场景闭环路线,银河通用代表的垂直场景高频数据路线,自变量机器人代表的灵巧操作真机数据路线,星海图代表的多形态平台数据路线,千寻智能代表的全身力控工程数据路线。换句话说,机器人不再只从机器人自己的低频、低量、低多样性数据中学习,而是先从更丰富的人类操作数据中获得基础动作
高考防舞弊进入AI时代:多地禁智能眼镜入场,同时启用AI巡考系统,展现"人机协同智慧防控新格局。然而AI落地考场面临三重矛盾:物理环境差异、考务规则动态变化及系统稳定性要求。解决方案提出三步校准法:1)采集本届考场典型片段构建案例库;2)通过专项训练实现模型精准适配;3)建立AI预警-人工复核标准化流程。
本文介绍了一款基于DeepSeek AI和规则图学习的双团队生存游戏。游戏采用回合制,两队(A和B)各有一名英雄和三个机器人,由独立的DeepSeek API实例控制。核心机制包括: Matrix Rule Graph:可学习的符号规则系统,通过关联规则挖掘从游戏经验中发现新规则,用于评估和推荐动作。 动作仲裁:比较规则图置信度与阈值,决定是否覆盖AI决策。 游戏环境:30×15网格世界,包含怪物
AI 知识库驱动下的客服智能体技术体系是一个多层次、模块化的复杂系统。从数据层的知识存储,到模型层的语言理解,再到引擎层的业务执行,最后到接口层的系统集成和监控层的运维保障,每个层次都有其特定的功能和技术要求。深入理解这一技术体系,对于企业构建高效、智能、可靠的客服智能体具有重要意义。企业需要根据自身的业务特点和技术能力,选择合适的技术方案,构建适合自己的客服智能体技术体系。同时,需要关注技术的演
世界大模型与大模型的区别
做科研最痛苦的是什么?是面对海量文献找不到重点?是复现Baseline时环境报错跑到崩溃?还是有了Idea却不知道怎么设计实验路径?别慌,你的AI科研搭子——又进化了!本次版本更新聚焦科研文献管理与实验流程优化,提升研究任务上下文构建能力,还为大家准备了超丰厚的。
时至今日,RAG 技术已经普及了很长时间,大家不再只关注能不能跑通系统,而是追求更高的检索精度、更自然的问答效果。很多人把精力放在模型选型、向量算法、重排序这些进阶环节,却忽略了分块这个最基础、也最容易拉开差距的环节。在我看来,Chunk 大小和重叠度的调优,是投入成本最低、见效最快的优化手段。不用复杂的架构改造,只需要沉下心分析文档类型、耐心做几组对比测试,就能明显感受到检索精度的提升。
机器学习临床预测模型作为数字化辅助工具,通过整合多维度医疗数据,实现个性化风险评估和治疗方案制定。其构建流程包括:1.明确临床需求与预测目标(分类、生存分析等);2.多源数据收集与预处理(处理缺失值、异常值);3.特征工程与算法选择(逻辑回归、随机森林等);4.模型训练与多维度评估(AUC-ROC、校准度);5.临床部署与持续监控。模型需注重可解释性和外部验证,最终目标是融入临床工作流,提升诊疗效
2026 年 4 月那篇分析 Claude Code 架构的学术论文,最后提了一个让我印象深刻的观察:Anthropic 自己对 132 名工程师和研究员做了一项研究,发现过度依赖 AI 辅助编程的开发者,在代码理解测试中得分低了 17%——他们把理解的能力"外包"给了 AI,而自己的能力在悄悄退化。这不是 Agent 架构的问题,但它提醒了我们:Harness Engineering不只是用来约
氮和硫的大气沉降作用主要指的是人为排放的氮和硫化合物进入大气中,通过天气沉降进入生态系统,进而对土壤、水体等环境介质产生耦合影响的过程。氮(N)和硫(S)的大气沉降被认为是严重的环境问题,可导致生态系统广泛酸化和富营养化,以及对人类的健康造成损害。该数据集主要以excel的格式存储,模拟的是2005、2010、2015、2020年的沉降值,单位为kg ha-1 yr-1,数据包含了总氮(Total
模型压缩的两种路径各有适用场景。剪枝适合需要保留原模型架构的场景,结构化剪枝的加速比更可预测;蒸馏适合可以接受更小模型架构的场景,灵活性更高。落地时建议先尝试知识蒸馏(实现更简单、风险更低),如果压缩比不够再叠加结构化剪枝。压缩后的模型必须在实际业务数据上验证精度,不能只看公开数据集的结果。温度参数和 alpha 权重是蒸馏效果的关键超参数,需要网格搜索确定。
《图解机器学习》 是一个从零开始的机器学习入门系列,用图解和案例讲清楚机器学习的核心概念。从数据、特征、标签,到模型训练、损失函数、评估指标和经典算法,带你一步步建立完整的机器学习基础。
损失函数定义"什么是对",梯度下降指引"怎么走到对"。
编程是一场马拉松,不是短跑。保持好奇心,持续学习,享受解决问题的过程。
如果你正在做科研助手、文献综述 Agent、生命科学 Copilot,或者想把通用 Agent 接进更可信的科学数据流,可以从 Sciverse 的公开 Cookbook、API 和 Agent Tools 开始。先把“能回答”升级成“能引用、能追溯、能复核”,这一步通常比再换一个更大的模型更重要
摘要: 加州大学伯克利分校等机构提出的LIVR(Latent Implicit Visual Reasoning)框架,通过隐式视觉推理提升多模态大模型的视觉任务性能。该框架创新性地结合可学习潜在Token与视觉瓶颈注意力机制,无需显式监督即可自主提取关键视觉特征。潜在Token作为独立视觉表征空间,通过注意力掩码约束强制模型通过其传递视觉信息,弱化文本偏置。实验表明,LIVR在计数、拼图、空间定
AI 进入学术写作以后,一个新问题正在出现:我们不只担心学生或作者用 AI 代写,也开始担心自己写出来的文字会不会被误判为 AI。这听起来有些反常。过去,学术写作追求的是清楚、规范、结构完整。我们会使用连接词,会写复杂句子,会通过转折、并列和递进来组织论证。可是,当 AI 检测器开始进入学校、期刊和评审流程以后,这些原本属于正式学术写作的特征,也可能让作者自己变得犹豫:这句话会不会太像 AI?这个
手写数字识别作为模式识别与计算机视觉领域的经典任务,是人工智能技术落地的重要验证场景。本文围绕MNIST数据集构建端到端的深度学习手写数字识别系统,旨在实现高精度、低延迟、可部署的识别能力。研究采用卷积神经网络(CNN)作为核心模型架构,结合数据增强、批量归一化、Dropout正则化及Adam优化器等关键技术提升泛化性能;系统设计涵盖前后端分离架构,前端提供交互式手绘板与结果可视化界面,后端集成F
大模型安全的本质是"纵深防御"——在输入层、推理层和输出层分别设置防线,将单一防线的绕过风险降到最低。本文方案的核心链路为:输入层 Prompt 注入检测 → 推理层系统提示强化 → 输出层内容审查与脱敏 → 监控层异常检测与审计。落地时需重点关注三个参数:注入检测风险阈值(建议 0.5)、输出审查误拒率上限(建议 3%)、PII 脱敏覆盖率(建议 100%)。建议建立红队测试机制,定期模拟攻击并
Prompt Engineering 的本质是将"试错式调优"转化为"模式化设计 + 系统化评估 + 迭代优化"的工程流程。本文方案的核心链路为:选择设计模式 → 模板化编写 → 自动化评估 → 基于结果的迭代优化。落地时需重点关注三个参数:评估样本量(建议至少 100 条)、准确率阈值(建议 85% 以上)、格式合规率阈值(建议 95% 以上)。建议建立 Prompt 版本管理和评估报告体系,每
Python 并发选型的本质是在"GIL 限制"和"任务特征"之间找到匹配方案。本文的核心结论:纯 I/O 密集选 asyncio(高并发、低开销),I/O + CPU 混合选 asyncio + 进程池,纯 CPU 密集选 multiprocessing。落地时需重点关注三个参数:线程/协程并发度(I/O 建议不超过 1000)、进程池大小(建议等于 CPU 核心数)、任务超时时间(建议 30
知识蒸馏的本质是通过软标签将教师模型的"暗知识"迁移给学生,在参数量大幅缩减的同时保留大部分能力。本文方案的核心链路为:教师模型推理 → 温度缩放软标签 → KL 散度蒸馏损失 → 逐层特征对齐 → 精度评估。落地时需重点关注三个参数:温度 T(分类任务建议 4-8,生成任务建议 2-4)、硬标签权重 α(建议 0.5-0.7)、蒸馏数据量(建议至少 100 万条)。建议从分类和简单生成任务开始蒸
with DAG(description='用户行为数据日度 ETL 管道',schedule_interval='0 2 * * *', # 每天凌晨 2 点catchup=False, # 不回填历史) as dag:'date': '{{ ds }}', # Airflow 模板变量,逻辑日期},sql="""""",# 定义依赖关系ETL 工程化的本质是将"脚本式数据处理"转化为"可调度、
推理框架选型的本质是在"吞吐量、延迟、显存效率"三维空间中找到与业务 SLA 匹配的最优点。本文评测的核心发现:vLLM 在长上下文和多租户场景下显存效率更优,TGI 在延迟敏感场景下更稳定。落地时需重点关注三个参数:P99 延迟上限(决定框架和批大小选择)、最大上下文长度(决定 KV Cache 策略)、并发请求峰值(决定 GPU 数量和部署方案)。建议在目标硬件上运行与生产流量模式一致的 Be
多模态模型融合推理的核心挑战在于"跨模态对齐"和"计算效率"的平衡。本文方案的核心链路为:ViT 视觉编码 → 投影层对齐 → Token 压缩 → 语言模型生成。落地时需重点关注三个参数:视觉 Token 压缩数量(建议 64-256,根据任务精度需求调整)、投影层类型(简单任务用线性投影,复杂任务用 Q-Former)、推理精度(建议 FP16,显存紧张时考虑 INT8 量化)。建议从单图推理
单细胞层面,能够更加明确的看到肿瘤微环境中的异质性细胞群体,数据层面也扩展到一个样本对应数万个细胞。逻辑上,患者的预后不是由所有细胞平均决定的,而是由某些关键细胞亚群决定的。对应的数据格式是很清晰的,每个样本的基因表达以及生存事件,在此基础上可以用 Cox 模型预测患者级别的预后风险。图:scSurvival 模型框架 (A-H) 与具体下游的应用(I-K),其实模型还是相对简单的,并且框架还是比
SWITCH 用一对 `<swi>/</swi>` 边界 token,把 Coconut 风格的潜空间推理重新接回 on-policy GRPO 训练;在 Qwen3-8B 上 MATH-500 拿到 79.3%、GSM8K 89.2%,论文 + 代码 + LoRA 权重 + 数据集全开源。
本文介绍了大模型量化技术的核心概念和应用。量化是一种通过降低模型参数精度来减少资源占用的技术,将高精度浮点数转换为低精度整数(如FP32到INT8)。文章通过实例解释了量化的基本原理,包括缩放因子和零点的计算方法,以及量化与反量化的过程。量化能显著降低内存和计算需求,同时保持模型性能在可接受范围内。文中还展示了量化后模型大小的直观对比,并提供了相关学习资源链接。量化技术是大模型优化的重要手段,在效
上个月帮朋友内推一个大模型应用开发岗,面试官问了一个问题:"你们 Agent 的 Function Calling 准确率只有 70%,你怎么做?" 他说优化 Prompt、加了 few-shot、调了 temperature,折腾两周准确率涨了 3 个点。面试官追问:"有没有考虑微调?" 他愣了一下,说没有 GPU。