人生变化 · AI实测
24个普通人 / 46件人生大事 / V6 重测

AI算命,
到底说中了
多少?

12款出生资料配置实测。第一名,
没赢过不看生日的“四句好话”。

统一模型:gpt-6-luna另测4种问事配置公开经历回测 · 非未来准确率
Wolke紫微斗数README星盘封面
看起来很专业
说中了,才算数。
项目README封面 · Wolke/ziwei-doushu ↗
装饰与项目展示图,不是本轮测试结果。
01 / 怎么测
先把问题问明白

不只问哪年结婚。
问的是:日子会怎么变?

藏起姓名和已知经历,只给出生资料与一段三年时间。让AI自己说,再把答案与公开记录对照。

24

个公开案例

46

件目标大事

16

种工具与模式组合

432

份主测试回答(含对照)

↗

事情对不对?

找工作、失业、恋爱、分手、赚钱、亏钱。不能用“有压力”冒充失业。

⇄

方向有没有说反?

实际变差却说变好,明确扣分。事业与钱财分别判断。

◷

时间与体验怎么样?

事情对了再算时间。差一两年有部分分;另外查套话、错生日和易用性。

开场说:这次我不让AI猜一个结婚年份,我让它回答普通人最关心的工作、感情和钱。方法是拿已经发生的事来核对。
02 / 最大看点
同样46件事 / 同一套判定

第一名说中4件。
“全说好事”对上19件。

工具组第一:雪眠八字

4 / 46件

最终分 16.7 / 100 · 方向说反4次

简单对照:全说好事

19 / 46件

最终分 40.3 / 100 · 方向说反9次

亮点=同类事件对上。灰点=没有命中选定事件,包含没说出来,不能全部叫算错。时间另评分。

对照不看生日,只说:会找到新工作、开始恋爱、进入新学习阶段、钱会增加。
常见好事也能拿分,所以“说中了几件”还不够。

对照也说反了9次,不是好预测器。本次样本挑选了有大事的年份,常见好事较多;这不代表随便说好话就能预测未来。

停在两组圆点这里:每个点是一件目标大事。强调19不是准确率,四句好话也犯错,只是一个提醒我们别被命中故事骗了的对照。
03 / 主榜
出生资料组 · 八字 / 紫微 / 印占等

完整排行榜。
第一名也只有16.7分。

按准确分排,最终分同时展示。点击工具名直达本轮实测的GitHub仓库。

名次 / 工具准确分 /85最终分 /100大事对上方向说对说反作答
01雪眠八字 ↗10.616.74/468/374次24/24
02金辰八字 ↗9.916.04/466/375次24/24
03命理大师 ↗6.411.72/468/375次24/24
04印度占星 ↗5.37.60/466/371次10/24
05Wolke紫微 ↗4.68.40/469/372次24/24
06太卜 · 紫微 ↗4.39.11/466/371次24/24
07八字+紫微 ↗2.45.70/465/371次24/24
08命语 ↗1.24.90/464/377次22/24
09高鑫八字 ↗0.22.00/461/372次10/24
10Horosa ↗0.21.80/461/372次9/24
11Suangua ↗0.00.00/460/370次0/24
12太卜 · 八字 ↗0.00.00/460/370次0/24

准确分85=大事45+方向25+时间15,并扣除明确说反。最终分100再加具体性、错输入对照、可观察易用性各5分,所以准确名次与最终总分大小不一定完全一致。0分可能是没有给判断,不能读成“24个人全部猜错”。

04 / 大家最关心
换个问题 / 名次也会变

谁更会说事业?
谁更会说感情?

这里仅看方向有没有对上:变好、变差、变动,或先后出现不同变化。点按钮切换。

分母是这个领域有经历记录的人数,不是所有人都有四个领域的资料。灰色部分包括未判断、未对上等;不全部等于方向相反。学业与钱财样本尤其少,差一两题就会换名次。

05 / 原答对照
匿名案例 V23 / 2021—2023

实际延期毕业。
AI却选了“学业推进”。

公开资料记载
2022年
延期毕业。
学业方向:受阻
雪眠八字 · 原答节选
“2022适合完成一项技术训练或资格准备,把专业能力做实。”
填写的学业方向:推进

这句话读起来顺耳,但没有提醒延毕;填的方向也与记录相反。它没有明确保证毕业,我们也不会把它改写成那种承诺。

查看案例来源 ↗ · 来源是作者命例转述,尚未独立核实。这里只展示本轮原答与来源的差别。

06 / 问事组
奇门 / 六爻 / 塔罗

这些也测了。
但要单独看榜。

同一批案例与时间窗口,提前固定咨询时刻和随机种子。今天重建的模拟咨询,不是当年真实起过的牌或卦。

名次 / 工具准确分 /85最终分 /100大事对上方向说对说反作答
01太卜 · 奇门 ↗4.69.73/463/371次24/24
02太卜 · 六爻 ↗1.05.10/461/370次23/24
03太卜 · 塔罗 ↗0.73.01/460/371次11/24
04Daman塔罗 ↗0.11.50/461/371次10/24
两套塔罗在缺出生时辰的体验题里,都要求补时辰。
但本题的牌已经固定,出生时辰不是必要资料。多问,不等于更专业。

这是本轮“skill+Luna”的实际回答表现,不是声称原项目代码都要求出生时辰。

07 / 看懂与算准
漂亮报告 ≠ 命中证据

排盘很漂亮。
结论要另核对。

右边是项目自己的README报告示例,确实有盘、有图、有术语。测评时我们把这些与“说对了什么”分开看。

24条

冠军的具体断言
在资料里无法核对

19条

冠军的套话/标签加戏
没有计为命中

无法核对,不等于已经证实算错。套话检查由另一次模型审阅完成,没有独立人工评审。

查看项目报告示例

报告图片保留在原作者仓库,点击下方来源链接查看。本仓库不复制图片中的联系信息。

项目原图见来源链接 · AdrianBOM/bazi-ziwei-skill README ↗
项目示例,不是本轮测试输出,不代表已验证其中的结论。
08 / 能说什么
录屏收尾

可以娱乐。
这轮还不足以让人放心信它。

本轮没有工具超过“全说好事”对照的准确分。

会说好话、能讲故事,并不自动证明生日能预测人生。

榜单能比较这次表现,不能保证下一次。

同一个Luna模型、24份公开资料和这套问题;换模型、换人群,名次可能变。

先查具体事情与方向,再听解释。

“注意沟通”“会有压力”谁都能用。看到具体断言,也要检查它是否真的有证据。

收尾别说“证明算命全是假的”。说:至少这次测试,没看到它们能稳定胜过简单对照。榜单有了,证据也给你,但别把分数当未来准确率。
方法边界 / 可查证附件

想看细节?
原答与证据都留着。

查看错生日、套话和易用性完整成绩
工具正确输入优势 /85无法核对套话/标签加戏易用分 /5
雪眠八字+10.024条19条4.7
金辰八字+11.025条16条4.6
命理大师+3.018条20条4.6
印度占星+10.00条0条1.7
Wolke紫微-5.00条0条3.8
太卜 · 紫微+0.09条0条4.5
八字+紫微+0.07条4条3.3
命语+10.07条0条3.0
高鑫八字+5.05条0条1.5
Horosa+5.04条0条1.3
Suangua+0.00条0条0.0
太卜 · 八字+0.00条0条0.0

正确输入优势=正确生日分-错生日分,仅比较5个婚恋案例。正数说明正确输入成绩更高;负数说明错输入反而更高。易用性没有真人满意度调查。

这次到底覆盖了哪些项目?

原图10个名字都映射到了本轮候选仓库;同名bazi-skill选了金辰和高鑫两个候选,另增Daman塔罗。合计12个仓库、16种配置。太卜的八字、紫微、奇门、六爻、塔罗分别列;多功能项目的西方占星、手相等未纳入本轮人生预测。原图多数没给作者,不能保证同名候选就是截图那个仓库。

为什么有些项目没回答、得了零分?

部分工具严格要求出生地点、分钟、子时规则;公开资料不总是足够。未交付判断拉低全题得分,但不是全部判断错误。普通AI对照也拒绝仅凭生日判断,所以它的0分不能反过来证明skill有效。

为什么这不是“未来准确率”?

来源是口述整理、命例作者转述和论坛自述,尚未独立核实;部分命盘可能根据过去经历校时。我们选了有事件的三年,模型也可能训练时见过公开资料。匿名和不准查答案不能彻底排除记忆影响;这是探索性回测,不是前瞻性双盲实验。

错生日、好不好用,真的测了吗?

测了5个婚恋案例的错输入对照,不能推广到事业与钱财。易用分看白话、直接回答、具体建议与追问,没有招募真人读者,不是用户满意度。时间只有事情命中才给分,差一两年给部分分;成绩不等于精确年份命中率。

图源:Wolke/ziwei-doushu 的 assets/banner.png;AdrianBOM/bazi-ziwei-skill 的 docs/jietu.png。封面按原仓库CC BY-NC-SA 4.0许可证署名使用;报告示例仅链接原项目。图表由v6最终成绩生成,没有重算或修改测试答案。