Statistik i betting handlar mindre om vilka siffror du hittar och mer om hur många observationer de bygger på. En vinstandel mätt över fem matcher har en felmarginal på drygt fyrtio procentenheter och säger därför ingenting alls. Samma andel över trettioåtta matcher säger något, men mindre än de flesta räknar med. Genomgången nedan går igenom de tre krav en siffra behöver klara innan den kan bära ett beslut.
När fem matchers form ska bära ett beslut
Formkurvor är den vanligaste ingången till en matchanalys och den svagaste. Problemet är inte att formen saknar betydelse utan att fem observationer är för få för att skilja verklig förändring från slumpmässig variation.
Osäkerheten i en uppmätt andel följer formeln 1,96 gånger roten ur p gånger ett minus p, delat med n. Här är p den uppmätta andelen och n antalet observationer. Uttrycket ger ett intervall där det sanna värdet ligger med 95 procents sannolikhet.
Sätt in ett lag som vunnit tre av fem matcher, alltså en andel på 60 procent. Insatt i formeln ger det 1,96 gånger roten ur 0,60 gånger 0,40 delat med 5, vilket ger 42,9 procentenheter. Lagets sanna vinstsannolikhet ligger någonstans mellan 17 och 100 procent. Det är inte ett underlag, det är ett intervall som rymmer varje tänkbar bedömning.
Kurvan planar ut. Att gå från fem till tjugo matcher halverar felmarginalen, medan steget från tjugo till trettioåtta bara tar bort ytterligare sex procentenheter. Det beror på att osäkerheten minskar med roten ur antalet observationer och inte med antalet. Fyra gånger fler matcher krävs för att halvera felet.
Vänd på formeln så framgår vad som krävs för en given precision. Vill du komma ner till fem procentenheters felmarginal kring en andel nära 50 procent behövs 1,96 i kvadrat gånger 0,25 delat med 0,05 i kvadrat, vilket ger 385 observationer. Det är tio säsonger av matchresultat för ett enskilt lag, och truppen har hunnit bytas ut flera gånger under tiden.
Talet 385 är värt att bära med sig, eftersom det gäller alla andelar nära hälften oavsett vad de mäter. Ett påstående om att ett lag vinner sextio procent av sina hemmamatcher i regn behöver samma storleksordning av observationer för att bli precist. Sådana urval finns sällan, och när de presenteras är de nästan alltid framplockade i efterhand ur ett större material.
Slutsatsen är obekväm men användbar. En hel säsong om trettioåtta matcher ger fortfarande ett intervall på drygt femton procentenheter kring en vinstandel. Ingen mängd matchresultat gör en säsongsstatistik precis, vilket är skälet till att seriösa modeller mäter något annat än matchresultat.
Om siffran mäter något annat än du tror
Urvalsstorlek är det första kravet. Relevans är det andra, och det brister oftare. En siffra är relevant när den mäter det som påverkar nästa match, inte när den beskriver vad som hände i de förra.
Gjorda mål utan justering för motstånd är standardexemplet. Ett lag som mött de fem svagaste lagen i serien har ett högre målsnitt än ett likvärdigt lag som mött de fem starkaste. Talet mäter då spelschemat i stället för lagets styrka, och det säger inget om nästa motståndare.
Tabellplacering har samma svaghet i förstärkt form. Placeringen är summan av utfall över en säsong, och utfall innehåller både prestation och slump. Två lag med identisk prestation kan skiljas åt av flera placeringar genom marginaler i enskilda matcher. Att använda placeringen som mått innebär att slumpen från redan spelade matcher får väga in i bedömningen av kommande.
Hemma- och bortaförhållandet är den tredje varianten. Ett målsnitt beräknat över alla matcher blandar två miljöer med systematiskt olika utfall. Snittet beskriver då ett genomsnittligt lag i en genomsnittlig miljö, vilket är en situation som aldrig inträffar på planen.
Där sammanhanget måste hållas konstant
Jämförbarhet är det tredje kravet. Två tal går att jämföra först när allt utom det du mäter hålls likadant. I praktiken bryter fyra saker jämförbarheten oftare än andra.
Truppen är den första. Ett snitt över tjugo matcher där laget saknat sin målskytt i åtta av dem är två snitt som lagts ihop, och det syns inte i talet. Den andra är tabellsituationen. Ett lag som spelar för en Europaplats och ett lag som redan är klart för nedflyttning spelar två olika sporter, även när matchen ser likadan ut i protokollet.
Den tredje är regeländringar och taktiska skiften mellan säsonger. Inbördes möten från en tidigare säsong beskriver ett annat lag med en annan tränare, och bevisvärdet sjunker snabbt med tiden. Den fjärde är matchtätheten. Ett lag mitt i en period med tre matcher i veckan roterar truppen, och siffrorna från de matcherna beskriver delvis ett andralag.
Kravet på jämförbarhet står ofta i konflikt med kravet på urvalsstorlek. Ju hårdare du filtrerar för att hålla sammanhanget konstant, desto färre observationer återstår. Att välja bort matcher utan målskytten löser ett problem och skapar ett annat, och avvägningen mellan de två är själva hantverket.
Under ytan skiljer prestation från utfall
Lösningen på konflikten är att byta observationsenhet. I stället för att räkna matcher räknar du händelser inom matcherna, och antalet observationer stiger med en storleksordning.
Förväntade mål är den etablerade tillämpningen inom fotboll. Varje avslut tilldelas en sannolikhet att bli mål utifrån situationens egenskaper, som avstånd, vinkel och typ av spelsituation. Summan över en match blir lagets förväntade målskörd, och den bygger på tio till femton observationer i stället för på ett enda resultat.
Effekten på precisionen är stor. Ett lag som gör elva avslut per match samlar runt fyrahundra avslut under en säsong om trettioåtta matcher. Det är elva gånger fler observationer än antalet matchresultat, och felmarginalen minskar med roten ur elva, en faktor på 3,3. Samma säsong ger ett underlag som är tre gånger så precist när det mäts per avslut.
Måttet löser också relevansproblemet delvis. Ett mål är ett utfall och innehåller slumpen i om bollen gick in. Ett avslut med tilldelad sannolikhet är ett prestationsmått och beskriver hur laget skapade läget. Prestationsmått är stabilare mellan matcher än utfallsmått, och det är skälet till att de används.
Casinospel faller utanför hela resonemanget, eftersom sannolikheterna där är fastställda av spelets konstruktion i stället för uppskattade ur data. En spelautomat har en angiven återbetalning och ingen urvalsfråga att lösa. Sajten http://kacinoportalen.se/ behandlar spelautomater.
Motsvarande logik finns i andra sporter. I basket mäts effektivitet per hundra bollinnehav i stället för per match, av exakt samma skäl. Enheten byts från match till bollinnehav, antalet observationer stiger, och tempoeffekten försvinner ur talet på köpet.
Det som gör en analys användbar i praktiken
De tre kraven ger en kort kontrollgång för varje siffra du möter. Hur många observationer bygger den på. Mäter den prestation eller utfall. Är sammanhanget detsamma som i den match du tittar på. Faller siffran på någon av frågorna är den inte fel, den är bara för osäker för att väga tungt.
Redovisningen är den andra halvan. En andel utan sitt n går inte att bedöma, och en siffra utan angiven källa går inte att kontrollräkna. Vi skriver därför alltid ut antalet observationer och varifrån talet kommer, och den ordningen gör det möjligt för dig att göra om räkningen själv.
Gränsen för vad statistiken kan göra är samtidigt tydlig. Ett bättre mått minskar felet i bedömningen av en sannolikhet. Det tar inte bort spelbolagets marginal, som ligger inbakad i varje odds oavsett hur väl analysen är gjord, och det gör inte utfallet i en enskild match förutsägbart. Sannolikheter beskriver fördelningar över många försök och säger ingenting om nästa.
En sak till hör hemma i bilden. De mått som beskrivs här är inte hemliga, och spelbolagen använder dem. Oddssättningen bygger på modeller som räknar per händelse och som justerar för motstånd, hemmaplan och trupp, med tillgång till mer data än en enskild spelare har. Ett odds innehåller därför redan den analys du gör, plus marginalen ovanpå.
Det gör inte räknandet meningslöst, men det flyttar poängen. Värdet ligger i att förstå vad talen betyder och att kunna avfärda de påståenden som inte håller, inte i att hitta något marknaden missat. Den som vet varför en formkurva över fem matcher saknar bevisvärde slipper fatta beslut på den grunden, och det är en konkret nytta även utan att någon vinstchans förbättras.
Det som återstår är en mindre men verklig sak. Skillnaden mellan att läsa en formkurva över fem matcher och att läsa ett prestationsmått över fyrahundra observationer är skillnaden mellan att gissa och att uppskatta. Ingen av delarna gör betting till en inkomst, men den ena är avsevärt mer intressant att hålla på med.
