AI算命,
到底说中了
多少?
12款出生资料配置实测。第一名,
没赢过不看生日的“四句好话”。
不只问哪年结婚。
问的是:日子会怎么变?
藏起姓名和已知经历,只给出生资料与一段三年时间。让AI自己说,再把答案与公开记录对照。
个公开案例
件目标大事
种工具与模式组合
份主测试回答(含对照)
事情对不对?
找工作、失业、恋爱、分手、赚钱、亏钱。不能用“有压力”冒充失业。
方向有没有说反?
实际变差却说变好,明确扣分。事业与钱财分别判断。
时间与体验怎么样?
事情对了再算时间。差一两年有部分分;另外查套话、错生日和易用性。
第一名说中4件。
“全说好事”对上19件。
工具组第一:雪眠八字
最终分 16.7 / 100 · 方向说反4次
简单对照:全说好事
最终分 40.3 / 100 · 方向说反9次
亮点=同类事件对上。灰点=没有命中选定事件,包含没说出来,不能全部叫算错。时间另评分。
常见好事也能拿分,所以“说中了几件”还不够。
对照也说反了9次,不是好预测器。本次样本挑选了有大事的年份,常见好事较多;这不代表随便说好话就能预测未来。
完整排行榜。
第一名也只有16.7分。
按准确分排,最终分同时展示。点击工具名直达本轮实测的GitHub仓库。
| 名次 / 工具 | 准确分 /85 | 最终分 /100 | 大事对上 | 方向说对 | 说反 | 作答 |
|---|---|---|---|---|---|---|
| 01雪眠八字 ↗ | 10.6 | 16.7 | 4/46 | 8/37 | 4次 | 24/24 |
| 02金辰八字 ↗ | 9.9 | 16.0 | 4/46 | 6/37 | 5次 | 24/24 |
| 03命理大师 ↗ | 6.4 | 11.7 | 2/46 | 8/37 | 5次 | 24/24 |
| 04印度占星 ↗ | 5.3 | 7.6 | 0/46 | 6/37 | 1次 | 10/24 |
| 05Wolke紫微 ↗ | 4.6 | 8.4 | 0/46 | 9/37 | 2次 | 24/24 |
| 06太卜 · 紫微 ↗ | 4.3 | 9.1 | 1/46 | 6/37 | 1次 | 24/24 |
| 07八字+紫微 ↗ | 2.4 | 5.7 | 0/46 | 5/37 | 1次 | 24/24 |
| 08命语 ↗ | 1.2 | 4.9 | 0/46 | 4/37 | 7次 | 22/24 |
| 09高鑫八字 ↗ | 0.2 | 2.0 | 0/46 | 1/37 | 2次 | 10/24 |
| 10Horosa ↗ | 0.2 | 1.8 | 0/46 | 1/37 | 2次 | 9/24 |
| 11Suangua ↗ | 0.0 | 0.0 | 0/46 | 0/37 | 0次 | 0/24 |
| 12太卜 · 八字 ↗ | 0.0 | 0.0 | 0/46 | 0/37 | 0次 | 0/24 |
准确分85=大事45+方向25+时间15,并扣除明确说反。最终分100再加具体性、错输入对照、可观察易用性各5分,所以准确名次与最终总分大小不一定完全一致。0分可能是没有给判断,不能读成“24个人全部猜错”。
谁更会说事业?
谁更会说感情?
这里仅看方向有没有对上:变好、变差、变动,或先后出现不同变化。点按钮切换。
分母是这个领域有经历记录的人数,不是所有人都有四个领域的资料。灰色部分包括未判断、未对上等;不全部等于方向相反。学业与钱财样本尤其少,差一两题就会换名次。
实际延期毕业。
AI却选了“学业推进”。
2022年学业方向:受阻
延期毕业。
“2022适合完成一项技术训练或资格准备,把专业能力做实。”填写的学业方向:推进
这句话读起来顺耳,但没有提醒延毕;填的方向也与记录相反。它没有明确保证毕业,我们也不会把它改写成那种承诺。
查看案例来源 ↗ · 来源是作者命例转述,尚未独立核实。这里只展示本轮原答与来源的差别。
这些也测了。
但要单独看榜。
同一批案例与时间窗口,提前固定咨询时刻和随机种子。今天重建的模拟咨询,不是当年真实起过的牌或卦。
| 名次 / 工具 | 准确分 /85 | 最终分 /100 | 大事对上 | 方向说对 | 说反 | 作答 |
|---|---|---|---|---|---|---|
| 01太卜 · 奇门 ↗ | 4.6 | 9.7 | 3/46 | 3/37 | 1次 | 24/24 |
| 02太卜 · 六爻 ↗ | 1.0 | 5.1 | 0/46 | 1/37 | 0次 | 23/24 |
| 03太卜 · 塔罗 ↗ | 0.7 | 3.0 | 1/46 | 0/37 | 1次 | 11/24 |
| 04Daman塔罗 ↗ | 0.1 | 1.5 | 0/46 | 1/37 | 1次 | 10/24 |
但本题的牌已经固定,出生时辰不是必要资料。多问,不等于更专业。
这是本轮“skill+Luna”的实际回答表现,不是声称原项目代码都要求出生时辰。
排盘很漂亮。
结论要另核对。
右边是项目自己的README报告示例,确实有盘、有图、有术语。测评时我们把这些与“说对了什么”分开看。
冠军的具体断言
在资料里无法核对
冠军的套话/标签加戏
没有计为命中
无法核对,不等于已经证实算错。套话检查由另一次模型审阅完成,没有独立人工评审。
查看项目报告示例
报告图片保留在原作者仓库,点击下方来源链接查看。本仓库不复制图片中的联系信息。
项目示例,不是本轮测试输出,不代表已验证其中的结论。
可以娱乐。
这轮还不足以让人放心信它。
本轮没有工具超过“全说好事”对照的准确分。
会说好话、能讲故事,并不自动证明生日能预测人生。
榜单能比较这次表现,不能保证下一次。
同一个Luna模型、24份公开资料和这套问题;换模型、换人群,名次可能变。
先查具体事情与方向,再听解释。
“注意沟通”“会有压力”谁都能用。看到具体断言,也要检查它是否真的有证据。
想看细节?
原答与证据都留着。
查看错生日、套话和易用性完整成绩
| 工具 | 正确输入优势 /85 | 无法核对 | 套话/标签加戏 | 易用分 /5 |
|---|---|---|---|---|
| 雪眠八字 | +10.0 | 24条 | 19条 | 4.7 |
| 金辰八字 | +11.0 | 25条 | 16条 | 4.6 |
| 命理大师 | +3.0 | 18条 | 20条 | 4.6 |
| 印度占星 | +10.0 | 0条 | 0条 | 1.7 |
| Wolke紫微 | -5.0 | 0条 | 0条 | 3.8 |
| 太卜 · 紫微 | +0.0 | 9条 | 0条 | 4.5 |
| 八字+紫微 | +0.0 | 7条 | 4条 | 3.3 |
| 命语 | +10.0 | 7条 | 0条 | 3.0 |
| 高鑫八字 | +5.0 | 5条 | 0条 | 1.5 |
| Horosa | +5.0 | 4条 | 0条 | 1.3 |
| Suangua | +0.0 | 0条 | 0条 | 0.0 |
| 太卜 · 八字 | +0.0 | 0条 | 0条 | 0.0 |
正确输入优势=正确生日分-错生日分,仅比较5个婚恋案例。正数说明正确输入成绩更高;负数说明错输入反而更高。易用性没有真人满意度调查。
这次到底覆盖了哪些项目?
原图10个名字都映射到了本轮候选仓库;同名bazi-skill选了金辰和高鑫两个候选,另增Daman塔罗。合计12个仓库、16种配置。太卜的八字、紫微、奇门、六爻、塔罗分别列;多功能项目的西方占星、手相等未纳入本轮人生预测。原图多数没给作者,不能保证同名候选就是截图那个仓库。
为什么有些项目没回答、得了零分?
部分工具严格要求出生地点、分钟、子时规则;公开资料不总是足够。未交付判断拉低全题得分,但不是全部判断错误。普通AI对照也拒绝仅凭生日判断,所以它的0分不能反过来证明skill有效。
为什么这不是“未来准确率”?
来源是口述整理、命例作者转述和论坛自述,尚未独立核实;部分命盘可能根据过去经历校时。我们选了有事件的三年,模型也可能训练时见过公开资料。匿名和不准查答案不能彻底排除记忆影响;这是探索性回测,不是前瞻性双盲实验。
错生日、好不好用,真的测了吗?
测了5个婚恋案例的错输入对照,不能推广到事业与钱财。易用分看白话、直接回答、具体建议与追问,没有招募真人读者,不是用户满意度。时间只有事情命中才给分,差一两年给部分分;成绩不等于精确年份命中率。
图源:Wolke/ziwei-doushu 的 assets/banner.png;AdrianBOM/bazi-ziwei-skill 的 docs/jietu.png。封面按原仓库CC BY-NC-SA 4.0许可证署名使用;报告示例仅链接原项目。图表由v6最终成绩生成,没有重算或修改测试答案。
