Rozszerzenie tematu statystyki i logarytmów. W wielu naturalnych zbiorach danych pierwszą cyfrą jest 1 aż w ~30% przypadków, a 9 tylko w ~5% — rozkład jest logarytmiczny: P(d)=log₁₀(1+1/d). Odstępstwo zdradza sfałszowane dane, dlatego prawo Benforda używane jest w audytach. Spopularyzował je Frank Benford w 1938 r. (wcześniej Newcomb, 1881).
Co się właśnie stało?
W wielu naturalnych zbiorach danych — populacjach miast, kwotach rachunków, długościach rzek, stałych fizycznych — pierwsza cyfra NIE jest rozłożona równomiernie (nie po ~11% każda). Zamiast tego cyfra 1 pojawia się na początku aż w ~30% przypadków, a cyfra 9 tylko w ~5%. Rozkład jest logarytmiczny — to prawo Benforda.
Wzór Benforda:
gdzie to pierwsza cyfra. Stąd , , …, . Prawdopodobieństwa maleją „schodkowo" od 1 do 9 i sumują się do .
Skąd się to bierze?
Intuicyjnie: aby liczba wzrosła ze do (pierwsza cyfra 1), musi się podwoić, ale by wzrosła z do (znów pierwsza cyfra 1), wystarczy przyrost o ~11%. Dane rosnące wykładniczo (obejmujące wiele rzędów wielkości) „spędzają więcej czasu" z małą pierwszą cyfrą. Dlatego prawo spełniają nawet czysto matematyczne ciągi jak potęgi dwójki czy liczby Fibonacciego — możesz to sprawdzić w kontrolce powyżej.
Historia
Zjawisko zauważył astronom Simon Newcomb w 1881 r. — spostrzegł, że pierwsze strony drukowanych tablic logarytmicznych (te z cyfrą 1) są bardziej zużyte niż końcowe. Prawo spopularyzował fizyk Frank Benford w 1938 r., analizując ponad 20 000 liczb z bardzo różnych źródeł (od powierzchni rzek po masy atomowe).
Wykrywanie oszustw (niezmiennik w praktyce)
Najważniejsze zastosowanie: sztucznie sfałszowane dane — fikcyjne rachunki w księgowości, zmanipulowane wyniki wyborów — zwykle nie spełniają prawa Benforda, bo oszust wymyśla „równomiernie losowe" cyfry. Odstępstwo empirycznego rozkładu od krzywej zdradza manipulację. Dlatego prawo Benforda to realne narzędzie audytorów i śledczych do wykrywania fałszerstw finansowych i wyborczych (wybierz „Sfałszowane" powyżej, by zobaczyć płaski, podejrzany rozkład).
Po co Ci to na maturze:
To piękne połączenie logarytmów i rachunku prawdopodobieństwa z realnym zastosowaniem. Pokazuje, że rozkład bywa nierównomierny wbrew intuicji, i uczy krytycznego patrzenia na dane. Zapamiętaj wzór oraz to, że logarytm dziesiętny odpowiada tu za „ważenie" rzędów wielkości.
Zapamiętaj: w naturalnych danych rozciągniętych na wiele rzędów wielkości pierwsza cyfra ma rozkład logarytmiczny — cyfra 1 dominuje (~30%), cyfra 9 jest najrzadsza (~5%). Zbyt „równy" rozkład zdradza sfałszowane liczby.
Cyfra 1 — pojawia się na pierwszym miejscu aż w ~30% przypadków, a 9 tylko w ~5%.
P(pierwsza cyfra = d) = log₁₀(1 + 1/d) — rozkład logarytmiczny.
Do wykrywania oszustw — sfałszowane dane (rachunki, wyniki wyborów) zwykle nie spełniają tego rozkładu.