方法论

这一页写清楚明辨是怎么工作的、每个数字是怎么算的,以及它不能做什么。 一个研判工具如果不敢公开自己的口径,那它给出的置信度就没有意义。

名字的来历
取自《中庸》:「博学之,审问之,慎思之,明辨之,笃行之。」 这不只是个名字——它直接命名了流水线的五个阶段,每个阶段做什么、交付什么,都对得上。
铁律
无证据不立论
每条实质性判断都必须绑定证据。论点强度由代码按独立来源数判定, 模型说自己「很有把握」一律不采信。绑不上证据的论点会被标成「无证据」并计入质检失分。
引用必须真实存在
模型给出的每个链接后端都会真的访问一次,取到正文才算 sourced。 引用了不在证据池里的 ID,会被直接丢弃并记一条质检问题。
「没搜到」不等于「不存在」
检索器返回的不是空数组,而是带检索范围、尝试过的关键词、索引时效的结构体。 任何否定陈述都必须有「检索是权威的」这一正面证明背书。
绝不编数字填洞
取证失败时只有两条路:如实标注缺口,或者把选择权交还给你。 用估算数字把报告填满是最省事也最危险的做法。
证据从哪来:双通道取证
引擎自己会联网检索,明辨也自己查。两路都跑,是因为它们各有各的盲区—— 引擎的检索由模型自主决定查什么,明辨的检索由领域规则决定往哪儿查。
InfiniSynapse 引擎自查
deepseek-v4-pro 的 agent 循环会自主发起十几轮联网检索与页面抓取。 这些动作在实时工作台的思维流里逐条可见,不是黑箱。
明辨自有取证层
博查 Web Search 全网索引作主通道,返回结构化摘要与发布时间; 语义排序按与问题的相关度重排,滤掉关键词碰巧命中的噪声; 行情接口补实时数字;博查不可用时退到搜狗 / 百度 / 360 的 HTML 抓取兜底, 并在报告里标明本次走的是哪一级通道。
为什么在意发布时间和正文摘要:可信度打分里「有没有发布日期」「时效多久」 「正文是否真的抓到」全是加减分项。拿不到这些字段,打分就只能靠猜。
证据的五种状态
「有证据」和「没证据」这个二分法丢掉了太多信息。我们用五种状态:
来源可信度打分(0-100,纯规则)
不经过模型。让模型给来源打分是不可复现也无法解释的——这套规则可以当着任何人的面手算复现。
基础分:按来源类型
调整项
权威域名 +10
低质聚合站 −5
标注了发布日期 +6
发布于一年内 +5 / 两年内 +2 / 超三年 −5
原文抓取成功 +6 / 仅拿到摘要 −8
摘录超 200 字 +3
未取到实证:总分封顶 20
权威域名白名单
论点强度的判定规则
强度不是形容词,是可计算的。规则刻意做得很简单:
条件强度含义
≥ 2 个不同域名的证据 ●●● 交叉验证通过,多个独立来源相互印证
≥ 2 条证据但同源 ●●○中等 有据可循,但可能是同一稿源的转载
仅 1 条证据 ●○○ 孤证,建议自行核实
正反两方都有证据 存在争议 会被单独提到「未解张力」面板,不强行调和
没有任何证据 ○○○无证据 触发质检失分,可能导致整份报告返工
概率词表(对照 IPCC)
「可能」这个词在不同人心里能差出 60 个百分点。所以凡是出现模糊词的地方,都能对到这张表上。
术语概率区间可视化
指标口径
质检与返工
质检分两层。第一层是规则:证据条数、独立域名数、论点绑证据率、必备章节是否齐全—— 这些永远可用、可复现。第二层是质检官 LLM 的五维评审,它能看出规则看不到的东西, 比如「这个维度压根没提」。LLM 挂了就回落规则分,质检不会整体失效。
打回博学补采
当问题出在「料不够」——某个论点没有独立来源、证据总数不足。 系统会针对这些点生成新的检索词重新取证。
打回慎思重推
当问题出在「没想清楚」——维度覆盖不够、结构缺章节。 系统会带着具体问题清单要求重新推理。
返工额度按档位分配:速判 0 轮、深研 1 轮、专家 2 轮。用满额度仍未达标时, 不达标项会如实写进报告,而不是悄悄放行。
明辨不能做什么
它不预测未来,只整理当下可核验的证据并给出条件化判断。 它引用的来源可能本身就是错的——可信度打分衡量的是「来源类型和时效」,不是「内容真伪」。 它的检索范围限于博查全网索引、公开中文网页与部分行情接口;付费数据库、内部资料、线下信息一概拿不到。 同一篇稿子被多家网站转载时,我们按主域归一并做文本雷同聚类,但仍可能有漏网的洗稿副本。 置信度是基于给定证据的主观概率,不是统计意义上的频率保证。 所有输出仅供决策参考,不构成投资、法律或医疗建议。