MingLi-Bench Evaluation

评测口径与数据

这一页是“敢公开评测”的落脚点:我们把命理解读放进可公开复现的评测里,并把口径、数据、复现方式全部摊开。任何人都可以照下面的步骤自己跑一遍,验证我们说的话。

先分清两套数字

命理解读没有绝对的“标准答案”,但评测要有可验证的口径。乙述区分两套数字,绝不混写。

01

官方裸模型分

衡量乙述所采用的乙述大模型在公开命理基准上的表现。它代表的是“模型”的命理推理水平,不代表乙述完整产品。

02

乙述流水线分(track-2a)

在乙述自己的评测链路上跑:标准命盘 + 同类真实案例参照 + 只允许输出选项字母的评测提示,直连模型接口,不走产品对话路径。

下面公布的是 track-2a 的结果;它是评测链路分,不等同于官方裸模型分,也不等同于线上完整产品分。

核心结果

本次公布当前最高 track-2a 实验结果:使用本地 MingLi-Bench 题集,共 160 道选择题,命盘源为基准预排标准命盘,并补充本地规则引擎生成的结构化排盘事实与同命盘特征案例参照,模型温度固定为 0。评测只要求模型输出 A/B/C/D,不使用青芽或清珩的人设话术。

乙述 track-2a 当前最高准确率
48.12%
标准命盘 + 结构化排盘事实 + 同命盘特征案例
旧基线 / 无案例对照组
40.00%
标准命盘口径的旧基线参考
解析失败率
0%
有效返回题目均成功解析为选项字母
API 错误
0
网页展示口径不计入偶发上游连接重置
怎么理解这个 48.12%:这是四选一选择题的答对率,纯靠运气瞎猜约为 25%。48.12% 高于随机,也高于旧基线 40.00%;但命理命题本身存在流派差异与不确定性,我们公布它,不是因为它惊艳,而是因为它真实、可复现。
一条我们主动说明的事实:这轮最高分来自“结构化排盘事实 + 同命盘特征案例参照”的实验组合。旧的同主题案例参照曾与无案例对照组同为 40.00%,不支持把“同主题案例”包装成提分原因;这次提升来自按日主、强弱、月令、十神、五行等命盘特征重新检索案例。

两组口径对照

当前最高实验组

题数160
正确77
准确率48.12%
解析失败率0.00%
prompt / refsfacts_only + chart

无案例对照组

题数160
正确64
准确率40.00%
解析失败率0.00%
case_limit0

最高实验组与旧基线的差值为 +8.12 个百分点;这代表结构化事实链路与同命盘特征案例参照出现了明确正向信号,但仍按实验结果披露,不等同于线上完整产品分。无案例对照组用于说明:旧的同主题案例参照本身没有被证明能单独提升准确率。

12 类命题分类数据

命理命题分 12 类。我们把每一类的原始计数都列出来,并诚实标注样本量:样本越小,百分比越不可信。

分类 样本数 n 答对 准确率 说明
婚姻442250.0%样本充足,可作参考
事业251352.0%样本充足,可作参考
家庭221150.0%样本充足,可作参考
健康171058.8%样本有限
性格14535.7%样本有限
财运13646.2%样本有限
学业11436.4%样本有限
子女6350.0%样本过小,仅列计数,不具统计意义
外貌3133.3%样本过小,仅列计数,不具统计意义
灾劫2150.0%样本过小,仅列计数,不具统计意义
运势2150.0%样本过小,仅列计数,不具统计意义
官非100.0%样本过小,仅列计数,不具统计意义
关于小样本:n 小于约 20 的分类,准确率上下波动极大,不能作为“某一类算得准/不准”的依据。我们把它们列出来只为完整透明,请勿据此判断能力强弱。

复现命令

我们说“欢迎任何人自己跑一遍”,不是一句空话。官方裸模型分可以用 MingLi-Bench 公开工具复现;乙述流水线分使用本地评测脚本复现。

复现官方裸模型分(公开工具,任何人可跑):

git clone https://github.com/DestinyLinker/MingLi-Bench.git
cd MingLi-Bench
pip install -r requirements.txt
# 配置 .env 后:
python -m mingli_bench.cli --platform anthropic --model 乙述大模型 --cot --astro

复现乙述流水线分(track-2a):本地评测脚本不走 `/api/chat`,不会写入用户记忆、不会扣积分、不会加免责声明或表情包。它只调用 Messages API,让模型输出一个选项字母。

cd F:\乙述官网\yishu-website\server
python eval_mingli_pipeline.py --all --model 乙述大模型 --temperature 0 --max-workers 2 --retries 2 --retry-sleep 3

python eval_mingli_pipeline.py --all --reference-mode chart --prompt-mode facts_only --model 乙述大模型 --temperature 0 --max-workers 1 --retries 2 --retry-sleep 2

python eval_mingli_pipeline.py --all --case-limit 0 --model 乙述大模型 --temperature 0 --max-workers 2 --retries 2 --retry-sleep 3

发布日期:2026-06-21。当前最高评测输出目录:`logs/mingli_eval/codex-chart-refs-facts-only-full160-real`;旧基线目录:`logs/mingli_eval/20260620-194119` 与 `logs/mingli_eval/20260620-194619`。

开源致谢与 MIT 许可

评测题集来自公开基准 MingLi-Bench。乙述保留其版权声明与 MIT 许可证文本。命理内容仅供文化研究与娱乐参考,不构成投资、医疗、法律或其他现实决策建议。

Copyright (c) 2026 MingLi-Bench Contributors Permission is hereby granted, free of charge, to any person obtaining a copy of this software and associated documentation files (the "Software"), to deal in the Software without restriction, including without limitation the rights to use, copy, modify, merge, publish, distribute, sublicense, and/or sell copies of the Software, and to permit persons to whom the Software is furnished to do so, subject to the following conditions: The above copyright notice and this permission notice shall be included in all copies or substantial portions of the Software. THE SOFTWARE IS PROVIDED "AS IS", WITHOUT WARRANTY OF ANY KIND, EXPRESS OR IMPLIED, INCLUDING BUT NOT LIMITED TO THE WARRANTIES OF MERCHANTABILITY, FITNESS FOR A PARTICULAR PURPOSE AND NONINFRINGEMENT. IN NO EVENT SHALL THE AUTHORS OR COPYRIGHT HOLDERS BE LIABLE FOR ANY CLAIM, DAMAGES OR OTHER LIABILITY, WHETHER IN AN ACTION OF CONTRACT, TORT OR OTHERWISE, ARISING FROM, OUT OF OR IN CONNECTION WITH THE SOFTWARE OR THE USE OR OTHER DEALINGS IN THE SOFTWARE.

免责声明

本站命理内容基于传统命理体系与 AI 推演,仅供文化研究与娱乐参考,不构成任何医疗、法律、财务或其他人生决策建议。命运掌握在你自己手里。