64arXiv
📄 全文✅ 官方资源 ⭐6
HF 👍29uncertainty-quantificationmechanistic-interpretabilityhallucination-detectionactivation-steeringreasoning-models
U-Space 用锚点词经 J-Lens 拉回残差流,构造“歧义/信息缺失/证据冲突/一般不确定”四维正交子空间;它在单次生成、无标签、无训练的条件下给出 token 级不确定性来源图,并在 end-of-thinking 处与平均预测熵相乘得到置信度分数。经长度控制后,该分数仍略优于各类基线。
要点
应用落地在自托管开源模型的客服或问答系统里加一个零成本的“转人工/追问”路由器:A_cone×平均熵高于阈值就转人工。还可以按主导类别给出不同动作:incompleteness → 自动追问缺失信息,conflicting evidence → 提示知识库条目冲突并生成知识库修订工单,ambiguity → 让用户澄清。在审计后台用 token 热图向运营人员标出“这一句模型没把握”。
研究跟进1) 只在 27–31B 的思考型模型上验证过,非推理模型、小模型(1–8B)和 RAG 场景都未测。2) 四类 taxonomy 缺乏人工标注的定量评估。3) 二阶信号用的是固定 2/3 层,但 A_cone 随层深波动很大(Fig.5),层选择或多层融合还有空间。4) 论文自己提出可用 diff-in-means 自动发掘多语言锚点替代英文词表,尚未验证。5) 可以用 U-Space 信号做 RL 奖励或 early-exit,例如在推理中途检测到不确定性时触发检索或停止生成。6) 没有报告校准指标(ECE),只看排序能力。
可复用方法可直接复用的配方:给定任意一对正/负概念词表,经 J-Lens 拉回、两极质心相减、正交化,就得到一个免标签的语义探针(情绪、reward hacking、谄媚、拒答意图等都可以做)。neuronpedia 已公开 Gemma 4/Qwen3.5 的 Jacobian;其他模型用约 100 条 WikiText、长度 128 的 prompt 做反向传播即可估计,不需要训练。读出只是一个 d×4 的矩阵乘,可嵌进推理服务的 hook。评估层面,长度分 10 个分位箱再计算 AUROC 的做法应作为任何置信度模块的标配,否则很容易被长度捷径骗。
背景与方法
背景 现有 LLM 不确定性估计有三类主要做法:Semantic Entropy 等多次采样、需要正确性标签的 probe、以及只输出单一标量的打分。它们要么成本高,要么跨任务迁移差,而且都不告诉你不确定性出在推理的哪一步、属于什么原因。此外,推理模型答错时回答往往更长,很多估计器的 AUROC 其实主要来自输出长度这一捷径(单用长度就有 68.6 AUROC),评估本身被长度混淆。
方法 第一步,把 Chen et al. 2018 的不确定性词表和 Rocklage et al. 2023 的确定性词表,用句向量模型分到 4 个类别。第二步,对每个锚点词用 (W_U·diag(γ)·J̄_ℓ)^⊤e_a 通过平均 Jacobian(J-Lens)拉回到中间层残差流;正、负两极各取质心后相减,得到每类的双极方向,再用 B(B^⊤B)^{-1/2} 正交化得到基 U_ℓ,读取层固定在网络 2/3 深度。第三步,U-Lens 把每个 token 的归一化 hidden state 投影到这 4 维上,经 softplus(√C·norm(α)) 映射进正锥,得到 token×类别的不确定性热图;在 end-of-thinking 处取正锥向量的范数 A_cone(二阶、可言语化信号),乘以思考段的平均预测熵(一阶分布信号),得到最终分数 S(r)。同一组方向还可以用于 activation steering,让模型在简单问题上也表现出犹豫。
关键结果
- 三模型、四 benchmark 平均(未做长度控制):U-Lens AUROC 71.1,高于五次前向的 TokUR 69.6、监督式 Feature-Gaps 68.8 和纯生成长度 68.6;AUPRC 45.5 为最高。长度控制后 U-Lens 只降 1.8,生成长度降 16.2,TokUR 降 9.4 (p.7, Table 1)
- 长度控制后,U-Lens 在 Gemma 4/Qwen3.5/Magistral 1.1 上的 AUROC 分别为 68.4/71.0/68.3,比最强基线高 2.2/1.9/4.7 点,9 个模型×指标组合全部第一。单独的 A_cone 为 66.3/66.7/67.6,与预测熵互补 (p.8, Table 2)
- 开销:U-Lens 每条额外耗时 <0.001s,且无需额外生成或标签;TokUR 11.4s,Semantic Entropy/SentenceSAR ≥55.6s(Gemma 4 31B,单卡 H200)(p.32, Table 18)
- 监督 probe 域内 AUROC 75.4–81.8,跨 benchmark 迁移后掉 9.8–22.1 点。最稳的 mass-mean probe 长度控制后为 67.3/63.1/62.4,低于 U-Lens (p.28)
- 同一套构造迁移到其他属性:GoEmotions 情绪读出 AUROC 73.0–79.8(关键词计数基线只有 51.3–66.7)(p.20, Table 5);reward-hacking 检测在未见作弊方法上 AUROC 91.4–96.9 (p.22, Table 7)
真正的新东西
真正新的有两点。一是把 J-Lens 的“词表方向拉回残差流”加上“语义两极做差”的组合,做成一个免训练、可替换锚点的语义子空间构造方法,并且证明它不是简单的关键词匹配:词表 top-n 解码方法接近随机,无锚点词的子集上效果不变。二是认真处理了长度混淆,全面报告长度分箱后的结果,这比多数 UQ 论文严谨。至于“一阶×二阶”的乘法组合,本质是一个 hidden-state 方向投影乘以平均熵,理论包装大于实质。四类不确定性的 taxonomy 只有定性展示,没有定量验证分类是否正确(例如没有人工标注的不确定性类型数据集)。核心组件 J-Lens、diff-in-means、steering 都是已有工作,本文是组合加应用。
证据核查
整体比较克制,长度控制做得扎实,但有几处需要打折。1) 提升幅度不大:长度控制后领先 2–5 个 AUROC 点,绝对值仅约 68–71,远谈不上可靠的错误检测器。跨模型标准差 ±4.7,比相对提升还大。2) 未做长度控制时并非全面领先:Gemma 4 上 TokUR 达到 75.1,高于 U-Lens 的 73.2;Magistral 上 U-Lens 只有 65.7,低于自己的 A_cone 68.5 和纯长度 67.8,说明乘法组合并不总是有益 (p.27)。3) “比监督方法迁移更好”成立,但域内监督 probe 有 75–82 AUROC,明显更强;只要有少量同域标签,probe 仍是更好选择。4) 层选择虽声称预先固定,但 Fig.5 显示 A_cone 随层深剧烈波动,鲁棒性存疑。5) Steering 的“因果证据”几乎都是 2+2 这类定性、挑选过的示例,没有量化指标。6) Reward-hacking 实验的锚点由带标签的配对数据导出,并非真正 label-free,且作者承认它检测的是“读起来怪异”,而不是作弊意图。7) 无 ECE 等校准评估,也没有小模型或非推理模型的结果。
资源与复现
✅ 官方资源 · https://github.com/s2labres/U-Space
官方仓库已存在(⭐6,无 license,2026-10 有更新)。论文称安装 requirements.txt 后用 run.sh 跑全流程,可复现 Table 2 和 Table 12。不涉及训练权重。Gemma 4/Qwen3.5 的 Jacobian lens 来自 neuronpedia 公开 artifact,Magistral 的需要自己用 Anthropic 的 jacobian-lens 参考实现估计。数据集全部公开(MMLU-Pro、Omni-MATH、SuperGPQA、TriviaQA,每个抽样 1000 条)。算力要求高:要运行 27–31B 的思考模型,生成上限 65k token,三个 seed 各生成一遍,Semantic Entropy 基线还要 10 次采样,论文在 H200 上计时,个人复现成本不低。由于没有 license,商用复用需谨慎。
55arXiv cs.CV
📄 全文✅ 官方资源 ⭐14
HF 👍16multimodal-agentdeep-researchprocess-rewardvideo-understandingtool-usedata-synthesis
OneSearch-VL 用“视觉锚点—实体—来源事实—答案运算”的证据图(VGEG)统一构造单图、多图和视频 deep research 数据,并以此派生过程奖励 EVGR。基于 Qwen3-VL-8B 经 SFT+GRPO 训练后,在 7 个单图基准、VideoDR 及两个自建基准上超过同规模开源 agent。
要点
应用落地可做“拍照/录屏即调研”类功能:用户上传多张商品图或一段视频,agent 先 crop 局部、反向图搜识别实体,再文本检索补全参数并做比较或计算(如比价、型号对比、地标或品牌溯源),每步保留来源 URL。适合电商导购、二手车或奢侈品鉴别辅助、旅行地标问答。
研究跟进(1) 自建 benchmark 与训练数据出自同一 pipeline、同一视频源,需要在独立分布上验证,例如做人工构造的多图 deep research 集;(2) EVGR 依赖闭源 Seed 2.0 Pro 作 judge,可研究开源 judge 或蒸馏小 judge 的效果和成本;(3) 检索快照化以保证可复现;(4) 自适应工具预算:平均 10.1 轮工具调用,成本高;(5) 端侧小模型(2-4B)能否承载这种多轮视觉工具调用策略。
可复用方法可直接复用的技巧:① 证据事实记录为 (head, relation, tail, URL, 引文),并用确定性解析器校验引文是否真实出现在原文(≥6 字符匹配),能有效防止生成数据时的幻觉;② 纯文本探针过滤“不看图也能答”的题;③ 实体模糊化改写,把实体名换成视觉描述,迫使模型真正使用视觉信息;④ 用 0<n_correct<8 筛选 RL 任务难度;⑤ 锚定分档 rubric(0/0.25/…/1),并明确不奖励冗长和仅答案匹配;⑥ SFT 时 mask 工具观测 token;⑦ Qwen3-VL-Embedding 帧去重阈值:图像相似度 0.9、文本相似度 0.8。
背景与方法
背景 多模态 deep research 此前多只覆盖单图或视频,多图场景基本空白。已有的 perception–knowledge chain、事实 rubric、证据图等结构,没有完整保留“局部视觉锚点→实体关系→有来源支撑的事实→答案组合运算”这条依赖链。视频 pipeline 也只把实体或关键帧当检索种子,没有端到端溯源,因此难以做过程监督,也难以做操作级评测。
方法 数据侧:从 2.5M 个 YouTube 视频筛到约 70k,构建“视频→事件→关键帧→物体框”的稠密 caption 树;再经反向图搜、OCR 和文本检索建立带 URL 与引文的实体证据图 G_X;按任务投影出 VGEG Γ=(锚点A, 事实F, 运算O, 依赖R),由此生成六类操作题(lookup/多跳/条件计数/join/算术/比较)。随后做规则校验、答案重答验证、实体模糊化改写和纯文本探针过滤。轨迹侧:用 Seed 2.0 Pro 在真实工具环境中合成专家轨迹,工具包括 Crop/OCR/超分/锐化/透视校正/ImageSearch/TextSearch/SelectFrame/SelectTimespan;经答案正确性和过程质量双重拒绝采样,得到 SFT-110K(单图 36k/多图 37k/视频 35k)。训练侧:在 Qwen3-VL-8B 上先做 masked SFT,再在 RL-10K 上用 GRPO 训练。奖励为 0.6·Racc + 0.2·Rquery + 0.2·EVGR,其中 EVGR 由 judge 依据 VGEG rubric 分两次调用打分:证据可追溯性 r_trace 和视觉定位 r_ground,均为 0/0.25/0.5/0.75/1 的锚定分档。
关键结果
- 单图 7 基准平均 58.3,比 Qwen3-VL-8B Agent(42.0)高 16.3,比 OpenSearch-VL-8B(56.6)仅高 1.7;7 项全部领先,VDR 23.6 vs 20.8 (p.9-10, Table 2)
- OneSearch-MI-Bench 55.8 / OneSearch-Video-Bench 35.5 / VideoDR 57.0,对应 Qwen3-VL-8B Agent 的 35.6 / 17.9 / 30.0;OpenSearch-VL-8B 为 44.5 / 24.7 / 47.0;直接推理的 Gemini-2.5-Pro 为 45.2 / 32.3 / 50.0 (p.10, Table 3)
- SFT 数据混合(6 基准平均):I+M+V 55.8;单类型训练为 51.7–55.1,其中 video-only 已达 55.1,联合训练只多 0.7 (p.11, Table 4a)
- RL 奖励消融:SFT 55.8 → Acc 56.3 → +Query 57.3 → +Trace 59.0 / +Ground 59.3 → 全奖励 61.1 (p.11, Table 4b)
- 算力:SFT 用 64×H800 约 4 天(8 epoch,32k 上下文);RL 用 32×H800 约 4 天(200 步,n=8,SGLang 异步 rollout)(p.25-28, Table 7/9)
真正的新东西
真正的新增量有三点:(1) 把多图 deep research 作为独立设定,并给出 benchmark;(2) 用一个任务级结构(VGEG)同时串起数据生成、校验、轨迹过滤、RL rubric 和评测分类,工程整合度高;(3) 把视觉定位单独拆成一维过程奖励,与证据可追溯性并列。但各组件大多有前作:citation-aware rubric reward(Zhang et al. 2026)、实体锚点信用分配、OpenSearch-VL 的 Racc/Rquery/fatal-aware masking 与单图数据被直接复用,GRPO 和工具集也都是常规配置。本质上是 OpenSearch-VL 的扩展版:加入多图/视频数据,加一个 LLM-judge 过程奖励,方法论上的突破有限。
证据核查
整体可信但有水分:(1) 单图上相对最强 baseline OpenSearch-VL 只高 1.7,且无多 seed 方差报告;该工作与 OpenSearch-VL 作者团队重叠,单图数据也直接复用 OpenSearch-VL,大幅提升主要来自对比原生 Qwen3-VL-8B。(2) 摘要中最醒目的 +20.2/+17.6 出自自建 benchmark,而该 benchmark 与训练数据共享 YouTube 来源、Seed 2.0 Pro 出题风格和同一题型分类,存在分布匹配优势;benchmark 各约 300 题,细分类别仅 25–77 题,单类别提升波动很大。外部 VideoDR 上比 OpenSearch-VL 高 10 点,是更有说服力的证据。(3) 视频方向没有与 VideoSearcher、Video-DeepResearch 等同期视频 deep research agent 对比,闭源模型也只给了 direct reasoning 结果,没有给工具版本。(4) 联合训练的增益很小(55.8 vs video-only 55.1),“三类数据互补”的结论偏弱。(5) RL 消融中,全奖励相比单维度奖励在 InfoSeek 上从约 68 跳到 72.3,幅度异常,且全奖励行恰好与主表数字完全一致,缺少更多 seed 支撑。(6) 评测用 GPT-4o 二值判分,训练 judge 与专家轨迹都用 Seed 2.0 Pro,未讨论 judge 偏差。(7) Table 3 与 Table 4a 的 Qwen3-VL-8B baseline 在 MI-Bench 上分别为 35.6 和 35.5,存在细小不一致。
资源与复现
✅ 官方资源 · https://github.com/appletea233/OneSearch-VL
官方仓库存在(Apache-2.0,14 star,2026-10-08 有推送),论文另给出 HF 组织页 huggingface.co/OneSearch-VL;推测会发布权重和 SFT-110K/RL-10K 数据,但具体内容未逐一核验。完整复现门槛高:SFT 需 64×H800 约 4 天,RL 需 32×H800 约 4 天;数据引擎依赖 Seed 2.0 Pro、GPT-4.1、GPT-4o 等闭源 API,以及商用反向图搜和文本搜索服务;RL 的 EVGR judge 也调用 Seed 2.0 Pro。网页内容随时间变化,论文自己承认结果难以精确复现。prompt 模板在附录中被省略。推理侧若有权重,8B 模型在单卡上即可部署,但需自行接入搜索工具。
50arXiv cs.RO
📄 全文✅ 官方资源 ⭐63
HF 👍62Embodied NavigationAgent HarnessTool CallingAgent SkillsMLLMRobotics
SuperNav 用 Codex CLI + MCP 把闭源 MLLM(GPT-5.6 Terra)包装成导航 Agent:模型不做导航微调,在四视角图像上“指点”目标点(view,[u,v]),由几何或学习型执行器负责走过去,并配合按需读取的 Markdown Navigation Skills 和进度/终止工具,在实例、多目标、需求驱动和类别级导航上明显超过端到端 VLN 模型。
要点
应用落地室内服务机器人或巡检机器狗的“自然语言找东西”功能:上层直接调用云端 MLLM,加一套 Skills Markdown;底层沿用现成的 LiDAR+A* 导航栈。这样不需要收集导航数据,就能支持“帮我找充电器”“依次去打印机和垃圾桶”这类请求。
研究跟进(1) 换成开源或小模型(例如 Qwen-VL 7B)后性能掉多少,能否用 RL 只训练“指点”能力来补回;(2) Skills 能否从失败轨迹中自动总结和演化,而不是人工撰写;(3) 时延和 API 成本建模,论文只承认“substantial latency variability”,没有给出数字;(4) 长序列需求任务在 SR4 之后接近 0,需要更强的任务账本或记忆机制;(5) 在公平设置下对比,即基线同样使用四视角和几何执行器。
可复用方法可直接复用的做法有四点。① 图像上下文裁剪:已处理过的旧图删除像素负载,只留文件路径和文字摘要,模型需要时再按路径回取,可大幅降低多模态 token 成本。② 将“进度账本工具”(pending/found)与“终止工具”(achieved/blocked)分开,并把终止声明与真实成功分开评估。③ 用 Markdown Skills 承载 SOP,只把名称和描述暴露给模型、按需加载正文,并对 Skill 快照做 hash 校验以保证可复现。④ 让 MLLM 直接输出归一化坐标 [u,v],这比先用外部 grounding 模型再让模型多选一更好(Table 3:55.83 vs 68.33)。
背景与方法
背景 端到端 VLN 模型(NaVid、UniNaVid、StreamVLN 等)靠导航轨迹数据微调,换任务或换场景后泛化很差;在多目标任务上 SR 几乎为 0。模块化零样本方法(VLFM、ApexNav 等)依赖为每类任务手写的流程,从找类别换成找实例、多目标或抽象需求时,探索、确认和终止逻辑都得重写。
方法 (1) Agent loop:基于 Codex CLI 实现,环境操作通过 MCP 暴露。上下文中已处理过的旧图像只删除像素负载,保留文本历史、任务状态和图片路径,需要时 MLLM 可以回取旧图。goal-progress 工具维护 pending/found 目标,close 工具声明 achieved 或 blocked。(2) Agent-oriented Tools:每次观测返回 front/right/back/left 四张带方向标签的 RGB 图,MLLM 调用 PointNav(view,[u,v]) 在图上指定目的地。执行后端可替换:Geo-based Executor 用深度反投影加 navmesh 或 LiDAR A* 规划;Learned Executor 是类 NoMaD 的点目标策略,结构为 DINOv2、age-aware 历史 Transformer 和 flow-matching 头。(3) Navigation Skills:以 Markdown 包的形式提供搜索、复查候选、受阻恢复、完成验证四类程序性经验,由 MLLM 按需加载进上下文,不在程序层面强制执行。
关键结果
- 自建 InteriorGS 实例导航 benchmark(150 个单目标任务):SuperNav+Geo SR 78.00 / SPL 0.4127,最强基线 UniNaVid 为 34.00 / 0.1833;Learned Executor 版本 SR 68.00 (p.6, Table 1)
- 有序多目标(150 个任务,每个 2–5 个目标):两种后端 SR 均为 34.00,基线最高只有 OmniNav 的 4.00;Demand-Bench 200 个任务:Geo 59.50、Learned 45.00,OmniNav 为 37.50 (p.6, Table 1)
- HM3D-OVON val-unseen 的 120-episode 子集:0.25m 阈值下 SR 68.33 / SPL 0.3837,1m 阈值下 73.33 / 0.4105,高于 AstraNav-Memory 的 62.50 / 0.3490 (1m)。HM3Dv2 0.2m 阈值下 SR 80.30,高于 ApexNav 的 76.20,但 SPL 0.3338 低于 ApexNav 的 0.3800 (p.8, Table 2)
- 消融(OVON,0.25m):去掉 Skills 后 SR 从 68.33 跌到 35.00;改为仅前视图交互降到 52.50;用 LocateAnything 做语言 grounding 代替直接指点只有 55.83;把决策模型换成 GPT-6 Astra (medium) 升到 71.67 / 0.4579 (p.8, Table 3)
- 仅前视图交互时平均每集 30.28 次工具调用、17.56 次转向;完整版只需 11.17 次调用、0.41 次转向 (p.17, Table 6)
真正的新东西
真正的新意有限,本质是把 Codex/Claude Code 式的 harness 工程(MCP 工具、按需加载的 Skills、上下文裁剪)系统地搬到具身导航。同期已有 HarnessVLN、AgenticNav(同样是 pixel-goal 加工具调用)、Show-Harness,“MLLM 在图上指点、底层执行器负责走”的思路也早有 PIVOT、AgenticNav 等先例。比较有价值的点有三个:一是四视角带方向标签的观测配合 view+[u,v] 统一接口,并验证了同一接口可以切换几何和学习两种执行器;二是消融清楚地量化了 Skills(程序性提示)的贡献最大,0.25m 阈值下 SR 几乎翻倍;三是 Learned Executor 把 NoMaD 的图像目标改成“图上标点”目标,并用 flow matching 替代 diffusion。整体属于扎实的工程整合,而不是方法论突破。
证据核查
有几处明显的公平性问题。(1) Table 1 的基线是 NaVid/UniNaVid/StreamVLN 这类端到端 7B 模型,只用前视单目输入;SuperNav 用四视角加 GPT-5.6,Geo 后端还使用模拟器 depth 和 navmesh 等特权几何,等于拿“前沿闭源模型 + 规划器”对比“小模型直接输出动作”,SR 翻倍并不意外。相对公平的是 Learned Executor(68 vs 34),但它的决策层仍是闭源大模型。(2) 实例和多目标 benchmark 是作者自建的,标注由 VLM 生成,各 150 个任务,没有报告多次运行的方差。(3) HM3D 结果只在 120-episode 子集上测,协议也不同:OVON 评测不要求 STOP,且有 2 个不可达 episode 按满分计入。作者自己也承认与已发表数字不可直接比较。HM3Dv2 上 SPL 低于 ApexNav。(4) 文件系统隔离只是指令层面的约束(danger-full-access),存在理论上的信息泄露风险。(5) 时延、token 成本、单集耗时都未量化,而这些恰恰是落地的关键。(6) 标题“Any Task in Any Scene”过度宣称:长序列需求任务在 SR5 只有 9.09%,SR6 以后为 0;真机部分只有 3 个定性演示,没有统计数字。总体结论站得住的部分是“强闭源 MLLM 加好的工具接口和 Skills 可以零微调完成多种导航任务”,其中 Skills 消融是最有信息量的证据。
资源与复现
✅ 官方资源 · https://github.com/zju3dv/SuperNav
官方仓库存在(⭐63,最近 push 2026-10-10,license 未声明/NOASSERTION),但无法确认其中是否包含 Learned Executor 权重、Skills 包和自建 benchmark。复现有三方面门槛。(1) 决策层依赖 Codex CLI 加闭源的 GPT-5.6 Terra (high),每集最长 3600s,API 成本和时延没有报告。(2) 仿真需要 Habitat-Sim/Habitat-GS、InteriorGS 场景,以及需申请许可的 HM3D 数据;Demand-Bench 来自一篇仍在 under review 的匿名论文。(3) Learned Executor 要在 Habitat 专家轨迹上训练 45k 步、batch 256,backbone 为 DINOv2 ViT-S,单机多卡即可。真机部分需要 Unitree Go2,外加四路 RGB 和 LiDAR。