方法论

这一页写清楚明辨是怎么工作的、每个数字是怎么算的,以及它不能做什么。 一个研判工具如果不敢公开自己的口径,那它给出的置信度就没有意义。

名字的来历
取自《中庸》:「博学之,审问之,慎思之,明辨之,笃行之。」 这不只是个名字——它直接命名了流水线的五个阶段,每个阶段做什么、交付什么,都对得上。
铁律
无证据不立论
每条实质性判断都必须绑定证据。论点强度由代码按独立来源数判定, 模型说自己「很有把握」一律不采信。绑不上证据的论点会被标成「无证据」并计入质检失分。
引用必须真实存在
模型给出的每个链接后端都会真的访问一次,取到正文才算 sourced。 引用了不在证据池里的 ID,会被直接丢弃并记一条质检问题。
「没搜到」不等于「不存在」
检索器返回的不是空数组,而是带检索范围、尝试过的关键词、索引时效的结构体。 任何否定陈述都必须有「检索是权威的」这一正面证明背书。
绝不编数字填洞
取证失败时只有两条路:如实标注缺口,或者把选择权交还给你。 用估算数字把报告填满是最省事也最危险的做法。
证据从哪来:三路取证
引擎自己会联网检索,明辨也自己查,被派遣的取证专家还各查各的。 三路都跑,是因为它们各有各的盲区——引擎的检索由模型自主决定查什么, 泛检索由领域规则决定往哪儿查,专项检索则是奔着「最可能推翻结论的那类材料」去的。
InfiniSynapse 引擎自查
deepseek-v4-pro 的 agent 循环会自主发起十几轮联网检索与页面抓取。 这些动作在实时工作台的思维流里逐条可见,不是黑箱。
明辨泛检索通道
博查 Web Search 全网索引作主通道,返回结构化摘要与发布时间; 语义排序按与问题的相关度重排,滤掉关键词碰巧命中的噪声; 行情接口补实时数字;博查不可用时退到搜狗 / 百度 / 360 的 HTML 抓取兜底, 并在报告里标明本次走的是哪一级通道。
取证层专家分头补采
本次派遣的每位取证专家带着自己的切口再查一轮: 司法风控查判决与处罚,官方公告专家查备案与批复,社区口碑专家查投诉与亲历, 关联溯源专家查股东与实控人。每条补采到的证据都记在这位专家名下, 专家册里的数字就是这么来的; 哪一路空手而归,也会照实写进证据缺口。
为什么要拆成专项:判决书、处罚决定、投诉记录这类材料,泛检索几乎捞不到—— 热度高的正面内容会把它们挤出前排。不专门去找,报告就会只剩「大家都在说的那一面」。 另外,可信度打分里「有没有发布日期」「时效多久」「正文是否真的抓到」全是加减分项, 所以三路都要求拿到发布时间与正文摘要,拿不到就降级处理。
证据的五种状态
「有证据」和「没证据」这个二分法丢掉了太多信息。我们用五种状态:
来源可信度打分(0-100,纯规则)
不经过模型。让模型给来源打分是不可复现也无法解释的——这套规则可以当着任何人的面手算复现。
基础分:按来源类型
调整项
权威域名 +10
低质聚合站 −5
标注了发布日期 +6
发布于一年内 +5 / 两年内 +2 / 超三年 −5
原文抓取成功 +6 / 仅拿到摘要 −8
摘录超 200 字 +3
未取到实证:总分封顶 20
权威域名白名单
论点强度的判定规则
强度不是形容词,是可计算的。规则刻意做得很简单:
条件强度含义
≥ 2 个不同域名的证据 ●●● 交叉验证通过,多个独立来源相互印证
≥ 2 条证据但同源 ●●○中等 有据可循,但可能是同一稿源的转载
仅 1 条证据 ●○○ 孤证,建议自行核实
正反两方都有证据 存在争议 会被单独提到「未解张力」面板,不强行调和
没有任何证据 ○○○无证据 触发质检失分,可能导致整份报告返工
概率词表(对照 IPCC)
「可能」这个词在不同人心里能差出 60 个百分点。所以凡是出现模糊词的地方,都能对到这张表上。
术语概率区间可视化
最终概率一律夹在 3%–97% 之间,哪怕基准率加调整项算出来是 100%。 这不是为了好看:明辨的全部依据是公开可检索到的材料, 而「我们没查到反例」和「不存在反例」是两回事。留出的那 3 个百分点, 是给取证范围之外的未知,也是给我们自己会错的可能。 看到 97% 时请理解成「在能查到的范围内,找不到能推翻它的东西」,而不是「板上钉钉」。
指标口径
质检与返工
质检分两层。第一层是规则:证据条数、独立域名数、论点绑证据率、必备章节是否齐全—— 这些永远可用、可复现。第二层是质检官 LLM 的五维评审,它能看出规则看不到的东西, 比如「这个维度压根没提」。LLM 挂了就回落规则分,质检不会整体失效。
打回博学补采
当问题出在「料不够」——某个论点没有独立来源、证据总数不足。 系统会针对这些点生成新的检索词重新取证。
打回慎思重推
当问题出在「没想清楚」——维度覆盖不够、结构缺章节。 系统会带着具体问题清单要求重新推理。
返工额度按档位分配:速判 0 轮、深研 1 轮、专家 2 轮。用满额度仍未达标时, 不达标项会如实写进报告,而不是悄悄放行。
选择性辩论门控
多智能体辩论很贵:一轮就是两次长上下文推理。而大多数问题在证据摊开之后 并没有真正的分歧——「日返 1.5% 是不是骗局」不需要辩,证据一边倒。 这时候强行开辩,两个 Agent 只会互相客套一轮,烧掉算力又不改变结论, 还会让人误以为「辩过了所以更可靠」。 所以我们先算分歧度,够分才开辩;不开也把判据写出来。
分歧信号权重判定规则
怎么定开不开
辩论怎么组织
正方不单独陈词——报告本身就是正方立场,再复述一遍纯属浪费算力。 每轮两次调用:红队官发起攻击(只许打可证伪的点),质检官作为裁判逐条裁定。 裁判有权修正立场与概率,但单轮最多挪动 20 个百分点: 一轮辩论就把结论掀翻,通常只说明模型在迎合最后一个说话的人。
裁定产生的概率修正会作为一条新的调整项并入置信度阶梯,而不是直接改掉那个数字—— 辩论改了概率却不写进推演过程,这个数就又变成不可审计的了。 报告正文也不做回溯改写,改了就等于伪造推理过程;结论卡上会挂一条修正说明。
立场演变轨迹
一份研判最容易被质疑的地方是:结论到底是查完之后得出的,还是一开始就想好了、 后面只是找材料凑。轨迹层专治这个——流水线每个关键节点打一个点, 记下当时的立场、概率、论点数与证据结构,并把两点之间的差算出来。 所有变化说明由代码按前后差值生成,不经模型润色。
看完这条线就能回答三个问题:引擎最初的先验是什么、取证之后有没有被推翻、 质检打回那一轮究竟改善了什么、辩论有没有真的动摇结论。
明辨不能做什么
它不预测未来,只整理当下可核验的证据并给出条件化判断。 它引用的来源可能本身就是错的——可信度打分衡量的是「来源类型和时效」,不是「内容真伪」。 它的检索范围限于博查全网索引、公开中文网页与部分行情接口;付费数据库、内部资料、线下信息一概拿不到。 同一篇稿子被多家网站转载时,我们按主域归一并做文本雷同聚类,但仍可能有漏网的洗稿副本。 置信度是基于给定证据的主观概率,不是统计意义上的频率保证。 所有输出仅供决策参考,不构成投资、法律或医疗建议。