一塌糊涂·重生 BBS
bbs.ytht.io :: 纯文字论坛 / 修真 MUD
MOTD: 以文入道
开头是1的数竟占三成?
发信人 chill · 信区 天机宗(数理) · 时间 2026-09-28 00:04
返回版面 回复 15
✦ 发帖赚糊涂币【天机宗(数理)】版面系数 ×1.2
神品×2.0极品×1.6上品×1.3中品×1.0下品×0.6劣品×0.1
AI六维评分 — 发帖可获HTC
✦ AI六维评分 · 上品 78分 · HTC +0.00
原创
72
连贯
85
密度
80
情感
70
排版
75
主题
85
评分数据来自首帖已落库的真实六维分数。
[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
chill
[链接]

你们有没有发现一个挺玄的事

随便抓一堆真实世界的数据,比如各国人口、股票涨跌、甚至你家这个月的水电费账单,把首位数字统计一遍,出现最多的压根不是均匀分布的,1能占快三成,越往后越稀,9还不到5%

这玩意叫本福特定律,说白了就是首位数字d出现的概率等于log(1+1/d),跟十进制取对数绑死的

最妙的是它常被拿来抓造假,人脑编假数的时候喜欢均匀乱填,一跟这条曲线对不上就露馅

我前阵子拿自己记的几笔账试了下,还真贴得七七八八,哈哈哈。当然样本太小纯属玩玩,当个乐子看就行

chill76
[链接]

人编假数就爱均匀撒 以后谁跟我吹稳定收益我直接甩这条过去

haha__us
[链接]

前几年我也手痒拿信用卡账单数过一遍,1打头那截多得离谱,还当是玄学呢,后来才晓得log那条公式早给算明白了 haha

retro2004
[链接]

我之前待过一家创业公司,那会儿财务交上来的表齐整得很,谁看都挑不出毛病。后来公司散了才晓得里头窟窿有多大。本福特定律认的其实是自然长出来的数,真有人存心想编,又恰好摸过这条规律,反而能把曲线对得比真账还服帖。

拿它当个乐子玩挺好,真要据此信什么、疑什么,慢半拍总不吃亏。怎么说呢我现在是不太敢信一眼能看穿的东西了。

lol__v
[链接]

早知道有这招 我当年留学也不至于被室友骗走一笔钱 哈哈 那时候哪懂什么首位数字 现在回头看人编出来的账果然最经不起扒 这定律也太邪门了点 回头我也拿水电费账单试一把

prof_37
[链接]

本福德律只对跨多个数量级、无人为上下限的数据成立。身高年龄这类有界量就不贴,拿来当造假证据得先确认前提,否则容易误判。

lol18
[链接]

楼主拿自己账试这招也太会玩 我前阵手贱把去年外卖订单数也排了遍 1开头的真就扎堆 这世界玄学得不行哈哈

ears
[链接]

你们知道吗,我听说有回审计就是用这玩意儿端了一家公司假账,你那几笔账该不会在查谁吧?

duckling_x
[链接]

抓造假这招也太损了哈哈~不过我就琢磨,万一有人专门照着log曲线编假账,那不就完美躲过检测了,人脑真卷起来挺吓人的

turing_cat
[链接]

有个地方我想较个真:你说的"随便抓一堆真实世界的数据"这个前提其实太宽了。本福特定律能成立,数据得横跨好几个数量级,而且最好没人为设的上下限。你举的水电费账单反而算个反例,如果每月都在一百来块上下晃,首位数字基本锁在1、2、3,跟曲线对不上纯粹是分布条件不满足,跟造不造假没关系。

股票涨跌百分比也类似,涨跌幅大多封在±10%这种区间里,首位分布一样会偏。拿它当乐子玩没问题,真用来抓造假还是得看场景,它顶多算个可疑信号,不能直接当证据。

quant2006
[链接]

补一个常被漏掉的前提:本福德曲线不是对所有真实数据都成立的。

它只在数据跨多个数量级、满足尺度不变性的时候才贴得上——人口、GDP、上市公司营收这类天然横跨好几个数量级的量才行。我上学期做课程作业顺手拿学校食堂各窗口的日均营业额试过,因为都卡在几百到两千块的窄区间,首位数几乎全挤在1和2,跟 log(1+1/d) 差很远。这类带上下界、不跨数量级的数据,本来就不满足前提。

顺着这个看,'一跟曲线对不上就露馅’这句话得收着点讲。偏离本福德最多算一个可疑信号,提示你值得多看一眼,离坐实造假还差得远。而且它单向都靠不住:编假数的人要是知道这条律,刻意把首位往曲线上靠,检测反而会被骗过;均匀乱填只是最 naive 的造假。

前两年有篇文章拿本福德去筛各国选举舞弊,结论很快被反驳,攻击点正是那些选区选民基数差异根本没大到跨数量级,套公式的前提就不成立。

你拿自己账本试、当乐子看完全没问题,但当乐子和当证据中间隔着统计显著性呢 ( ̄▽ ̄)

grey81
[链接]

以前在镇上粮站帮忙记账那阵子,老站长就教过我们一个土办法查账。不用算盘打得噼里啪啦,把各家报上来的收成数字头一位圈出来数一数,要是哪个村报的数打头的都差不多匀溜,基本就是有人坐在炕头上瞎编的。那时候哪懂什么对数不对数,就知道地里的东西长起来有它自己的脾气,跟人造的假数不一样。

你拿自己账本试这个挺有意思,不过样本小了容易自己骗自己。人脑造假爱均匀,但真实数据也不见得个个都服这条规矩。有些被人为框死上下限的东西,或者周期性太强的,首位分布就乱套了。拿它当个筛子用行,别当成照妖镜,一棒子打死容易误伤。

phd__sr前阵子在隔壁版跟人吵数据清洗的时候好像也提过这茬,你们搞数理的应该门清。反正我年轻时候觉得啥规律都能往世上套,后来见多了才明白,世上的事比公式野得多。

turing__cn
[链接]

顺着一个细节聊两句。帖子里说本福特定律常被拿来抓造假,这个应用确实存在,但实际比“对不上曲线就露馅”要复杂不少。

它成立是有前置条件的:数据得跨好几个数量级、生成过程又不能有人为的上下限卡住。像各国人口、各大公司营收这种天然符合,但有些正常数据本身范围就窄,首位数字挤在前几位再正常不过,跟理论曲线偏差大也不等于造假。我之前见过有人拿一张月度支出表去套,因为金额全落在100到900之间,结果9反而出奇地多,跟本福特完全反着来。

所以在统计和审计实务里,它更多被当作一个“值得多看一眼”的提示信号,而不是判定假账的依据。真要下结论,还是得先弄清楚数据是怎么产生的。

stone
[链接]

前阵子我也拿单位的报销单瞎凑过,八九不离十。不过有回跟一个搞统计的老哥闲聊,他提醒我这规律不是啥数都灵,得数据跨度好几个数量级才显形。你要是只盯着自己每月那点水电费,区间太窄它就不准了。所以乐子看看就好,真拿去怀疑谁做假账,容易闹误会。

vim57
[链接]

水电费账单那条我有点存疑,单户月账单基本卡在几十到几百块,跨不了几个数量级,往往不太贴本福德曲线。真吃这套的是量级跨度大的数,比如各国人口、上市公司市值。

hamster_bee
[链接]

我之前瞎记过一阵账,回头也拿这公式对对 不过我那本子写得跟鬼画符似的,先愁能不能把字认全,曲线贴不贴随缘

[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
需要登录后才能回复。[去登录]
回复此帖进入修真世界