NIKOLAJ MALCHOW-MØLLER OG ALLAN W ÜRTZ
INDBLIK
I STATISTIK
2. UDGAVE
– F O R S A M F U N D S V ID E N S K A B
HANS REITZELS FORLAG
Om dette eksemplar
Dette eksemplar er fremstillet af Nota til Louise Dalsgaard.
Eksemplaret er personligt og må ikke deles.
Misbrug kan
medføre udelukkelse fra Nota og retsforfølgelse.
Eksemplaret indeholder data, så det kan spores tilbage til
brugeren.
INDBLIK I STATISTIK er en pæ dagogisk allround-indføring
i sandsynlighedsregning og statistisk m etode i sam fundsviden­
skaberne. Bogen gennem går de estimatorer, hypotesetest og
tilhørende statistiske fordelinger, som danner grun d lag e t for
statistiske undersøgelser inden for b l.a. økonomi, sociologi og
statskundskab. Bogens praktiske tilgang illustreres af en syste­
matisk gennem gang af alle faser fra stikprøver og dataindsam ­
ling til bearbejdning og tolkning af data.
Der er i bogen lagt stor v æ gt på at forklare sammenhæ ngen
mellem sandsynlighedsregning og de statistiske metoder, og
der anvendes løbende eksempler på empiriske undersøgelser,
der ud byg g e r det teoretiske sto f og gør bogen u m iddelbart
anvendelig i praksis. Hvert kapitel afsluttes af opgaver, som kan
bruges til at tjekke forståelsen af teorierne og arbejde videre
med statistisk metode.
NIKOLAJ M ALCHOW - MØLLER er professor og dekan ved
Det Samfundsvidenskabelige Fakultet, SDU.
ALLAN WÜRTZ er lektor og institutleder ved
Institut fo r Økonomi, AU.
HANSREITZEL.DK
SAMFUNDS
VIDENSKABERNES
METODER
ISSN 2 2 4 5 -4 7 9 9
Indblik i statistik
– for samfundsvidenskab
SAMFUNDSVIDENSKABERNES METODER er en serie bøger om
forskningsmetode inden for statskundskab, sociologi, økonomi, antro­
pologi og tilgrænsende områder. Serien dækker både kvantitative og
kvalitative tilgange, og fokus er på frembringelse a f generaliserbar, sy­
stematisk, valid og reproducerbar viden ved hjælp a f samfundsviden­
skabelige metoder. Bøgerne er fagfællebedømt.
SAMFUNDSVIDENSKABERNES METODER redigeres a f professor
Lotte Bøgh Andersen, Aarhus Universitet og KORA, og lektor Peter
Thisted Dinesen, Københavns Universitet.
SAMFUNDS
VIDENSKABERNES
METODER
Nikolaj Malchow-Møller og
Allan H. Würtz
Indblik i
statistik
– for samfundsvidenskab
Hans Reitzels Forlag
Indblik i statistik
– for samfundsvidenskab
2. udgave, 1. oplag
© forfatterne og Hans Reitzels Forlag 2014
Forlagsredaktør: Martin Laurberg
Omslag: Harvey Macaulay
Typografisk tilrettelægning: Odd Design/Bent Nielsen
Sat med Helvetica Neue og Times New Roman
og trykt hos Ednas Print
Printed in Slovenia 2014
ISBN 978-87-412-5785-3
Denne bog er bind 6 i serien „Samfundsvidenskabernes metoder“
ISSN 2245-4799
Alle rettigheder forbeholdes. Mekanisk, fotografisk
eller anden gengivelse a f eller kopiering fra denne
bog er kun tilladt i overensstemmelse med overenskomst
mellem Undervisningsministeriet og Copydan Tekst & Node.
Enhver anden udnyttelse er uden forlagets skriftlige
samtykke forbudt ifølge dansk lov om ophavsret.
Undtaget herfra er korte uddrag til brug ved anmeldelser.
Hold dig orienteret om nye titler fra Hans Reitzels Forlag.
Tilmeld dig forlagets nyhedsbrev på hansreitzel.dk
Indholdsfortegnelse
Forord
1
13
Statistik og erkendelse 17
1.1 Eksempler på problemstillinger
1.2 Deduktion og induktion 20
1.3 Et kort overblik over kapitlerne
18
22
2
Populationer 25
2.1
Virkelige populationer 25
2.2 Måleskalaer 26
2.2.1
Nominal skala 27
2.2.2 Ordinal skala 27
2.2.3 Intervalskala 28
2.2.4 Ratioskala 28
2.2.5 Valg a f skala 28
2.3
Overblik over et enkelt karakteristikum 29
2.3.1
Frekvenser og histogrammer 30
2.3.2
Median og fraktiler 35
2.3.3 Box plot 38
2.3.4
Middelværdi og varians 39
2.4 Overblik over flere karakteristika 41
2.4.1
Krydstabel og punktdiagram 41
2.4.2
Kovarians og korrelation 43
2.5
Opgaver 46
3
Usikkerhed og
sandsynligheder 47
3.1 Usikkerhed 47
3.2
Fra population til stikprøve 49
3.2.1
Virkelige populationer 50
3.2.2 Superpopulationer 51
3.2.3 Udvælgelsesmekanisme og stikprøve
3.3
Sandsynlighedsmodellen 53
3.3.1 Udfaldsrum 54
3.3.2 Hændelsesalgebra 55
3.3.3 Sandsynlighedsmål 59
52
3.4
3.5
3.6
3.7
Regneregler for sandsynligheder 63
Betinget sandsynlighed 66
Uafhængighed og spuriøse sammenhænge 68
3.6.1
Uafhængighed 68
3.6.2
Direkte, indirekte og spuriøse sammenhænge
Opgaver 72
70
4
Stokastiske variabler 75
4.1
Definition a f en stokastisk variabel 75
4 .1.1 To typer af stokastiske variabler 77
4.2
Diskret stokastisk variabel 78
4.2.1 Sandsynlighedsfunktionen 79
4.2.2 Den kumulative sandsynlighedsfunktion 81
4.2.3
Sandsynlighedsfunktioner og andelsfunktioner 83
4.3
Sammenhænge mellem diskrete stokastiske variabler 85
4.3.1
Simultan sandsynlighed 85
4.3.2
Marginal sandsynlighed 86
4.3.3 Betinget sandsynlighed 88
4.3.4 Bayes’ formel 90
4.3.5 Uafhængighed 92
4.4
Kontinuert stokastisk variabel 93
4.4.1 Den kumulative sandsynlighedsfunktion 94
4.4.2 Tæthedsfunktionen 96
4.5
Sammenhænge mellem kontinuerte stokastiske variabler 98
4.6 Opgaver 100
5
Beskrivende mål 105
5.1 Beskrivende mål og stokastiske variabler 106
5.2 Momenter 108
5.2.1
Forventet værdi a f en diskret stokastisk variabel 108
5.2.2
Forventet værdi a f en kontinuert stokastisk
variabel 113
5.2.3 Varians af en diskret stokastisk variabel 1 1 4
5.2.4
Varians af en kontinuert stokastisk variabel 118
5.2.5 Momenter generelt 118
5.3 Fraktiler 120
5.4
Valg a f beskrivende mål 124
5.4.1 Modalværdi 125
5.5
Beskrivende mål for sammenhænge mellem stokastiske
variabler 126
5.5.1 Forventet værdi a f en sum a f stokastiske variabler 127
5.5.2 Kovarians 127
5.6
6
5.5.3
Opgaver
Korrelationskoefficient
132
133
Populære fordelinger 137
Bernoullifordelingen 137
Binomialfordelingen 140
Den hypergeometriske fordeling
Poissonfordelingen 149
Normalfordelingen 152
Multinomialfordelingen 157
Opgaver 161
6.1
6.2
6.3
6.4
6.5
6.6
6.7
146
7
Stokastiske processer 167
7.1 En stokastisk proces 167
7.2
Transformation a f en stokastisk proces 170
7.3 Tilstand og ventetider i enstokastisk proces 172
7.4 Fire typer af stokastiske processer 175
7.5 Bernoulliproces og binomialproces 177
7.5.1
Bemoulliproces 177
7.5.2
Binomialproces 178
7.5.3 Tilstandsfordeling for en binomialproces 180
7.5.4 Ventetidsfordeling for en binomialproces 181
7.6 Poissonproces 182
7.6.1Tilstandsfordeling for en Poissonproces 183
7.6.2Ventetidsfordeling for en Poissonproces
185
7.7 Gaussisk random walk 187
7.7.1 Tilstandsfordeling for en Gaussisk random walk 1 88
7.7.2 Ventetidsfordeling for en Gaussisk random walk 189
7.8 Wienerproces 189
7.8.1Tilstandsfordeling for en Wienerproces 191
7.8.2Ventetidsfordeling for en Wienerproces 191
7.9 Resumé a f udvalgte stokastiske processer 193
7.10 Opgaver 194
8
Fra deduktion til induktion 197
8.1 Induktive analyser 198
8.2 En oversigt over analysesituationer
8.3 Estimatorer og test 200
9
199
Stikprøvemetoder 203
9.1 Design a f stikprøveudvælgelse 204
9.2 Valg a f population og karakteristika 205
9.3
9.4
Opstilling a f stikprøveenheder og stikprøveramme 207
Udtræk fra stikprøveramme 208
9.4.1 Statistisk udtagning 208
9.4.2 Ikke-statistisk udtagning 209
9.5
Måling a f karakteristika 210
9.6
Stokastisk stikprøve 211
9.7
En model for stikprøven 213
9.8
Repræsentativ stikprøve 216
9.9
Konsekvenser a f en ikke-repræsentativ stikprøve 219
9.10 Fejlkilder ved udvælgelsesmekanismen 220
9.10.1 Fejl i stikprøveramme 221
9.10.2 Ikke-respondenter 222
9.10.3 Selvselektion i stikprøven 223
9.11 Observationsfejl 225
9.11.1 Typer a f observationsfejl 225
9.11.2 Konsekvenser a f observationsfejl 226
9.12 Opgaver 228
10
Skøn på middelværdi med simpel tilfældig stikprøve
10.1 Simpel tilfældig stikprøve 231
10.2 Konstruktion a f en estimator for middelværdien 234
10.3 Egenskaber ved estimatorer 236
10.3.1 C entrai estimator 237
10.3.2 Efficiens og konsistens a f estimator 238
10.4 Fordeling a f estimatoren
239
10.5 Opgaver 242
11
Skøn på middelværdi med stratificeret
stikprøve og klyngeudvælgelse 245
11.1 Stratifikation 245
11.1.1 Stratificeret stikprøvegennemsnit 246
11.2 Egenskaber ved stratificeret stikprøvegennemsnit
11.3 Valg a f stratumstikprøvestørrelse 254
11.3.1 Optimal allokering 254
11.3.2 Proportional allokering 256
11.3.3 Ikke-kontrolleret stratifikation 257
11.3.4 Stratifikation uden tilbagelægning 258
11.4 Klyngeudvælgelse 259
11.5 Opgaver 260
250
231
12
Skøn på andre beskrivende mål 263
12.1 Estimator for variansen 263
12.2 Estimatorer for højere ordens momenter 267
12.3 Estimatorer for kovarians og korrelationskoeffcient
12.4 Estimator for en fordeling 270
12.5 Estimatorer for fraktiler 273
12.6 Opgaver 277
269
13
Konfidensintervaller 279
13.1 Konfidensinterval for middelværdi ved simpel tilfældig
stikprøve 280
13.1. 1 Det generelle tilfælde med simpel tilfældig
stikprøve 282
13.1.2 Simpel tilfældig stikprøve af normalfordelte
observationer med kendt varians 284
13.1.3 Simpel tilfældig stikprøve a f normalfordelte
observationer med ukendt varians 285
13.1.4 Simpel tilfældig stikprøve a f Bernoullifordelte
observationer: konfidensinterval for andel 287
13.1.5 Konfidensintervaller for middelværdi ved simpel
tilfældig stikprøve – en oversigt 289
13.2 Konfidensinterval for middelværdi ved stratificeret
udvælgelse 289
13.3 Konfidensinterval for varians 292
13.4 Konfidensinterval for forskel mellem to middelværdier 295
13.4.1 Det generelle tilfælde 295
13.4.2 Konfidensinterval for forskel mellem to middelværdier
–
en oversigt 298
13.5 Konfidensinterval for forhold mellem to varianser 301
13.6 Valg a f stikprøvestørrelse baseret på konfidensintervaller 303
13.7 Opgaver 305
14
Hypotesetest 309
14 .1 Hypoteser og fejltyper 310
14.1.1 Opstilling a f hypoteser 310
14.1.2 Konklusioner og fejltyper 311
14.2 Konstruktion a f hypotesetest 313
14.2.1 Hypotesemål 314
14.2.2 Teststatistik 315
14.2.3 Beslutningsregel 317
14.2.4 Valg a f kritisk værdi baseret på type-I-fejl 3 18
14.2.5 Trade-off mellem type-I- og type-II-fejl 319
14.2.6 Tilfældet μ 0 > μ 1 322
14.2.7 Opsummering 323
14.3 Test a f middelværdi under forskellige
fordelingsantagelser 325
14.3.1 Ukendt fordeling, kendt varians 326
14.3.2 Ukendt fordeling, ukendt varians 327
14.3.3 Normalfordelte observationer, kendt varians 327
14.3.4 Normalfordelte observationer, ukendt varians 327
14.4 Simple og sammensatte hypoteser om en middelværdi 328
14.4.1 Simpel nulhypotese og sammensat dobbeltsidet
alternativhypotese 329
14.4.2 Simpel nulhypotese og sammensat enkeltsidet
alternativhypotese 331
14.4.3 Sammensat nulhypotese 332
14.5 Test a f middelværdi med Bernoullifordelte observationer 333
14.6 p-værdi 335
14.7 Opsummering a f hypotesetest a f middelværdi 337
14.8 Valg a f stikprøvestørrelse baseret på type-I- og type-IIfejl 339
14.9 Test a f varians 340
14.10 Statistisk signifikans versus reel signifikans 343
14.11 Sammenhæng mellem konfidensintervaller og
hypotesetest 344
14.12 Opgaver 345
15
Test af sammenhænge i kvantitative målinger 349
15.1 Test af forskel på to middelværdier 350
15.1.1 Det generelle tilfælde 351
15.1.2 Ens varianser 352
15.1.3 Normalfordelte observationer med kendte
varianser 354
15.1.4 Normalfordelte observationer med ukendte
varianser 354
15.1.5 Bernoullifordelte observationer 355
15.1.6 Test a f forskel på to middelværdier – en oversigt 356
15.2 Test af forskel på flere middelværdier (variansanalyse) 358
15.3
Test a f effekt a f en behandling 363
15.3.1 Behandlingsgruppe og kontrolgruppe observeres én
gang 363
15.3.2 Behandlingsgruppe observeres to gange uden
kontrolgruppe 364
15.3.3
Behandlingsgruppe og kontrolgruppe observeres to
gange 365
15.4 Test a f forskel på to varianser 368
15.5
Opgaver 370
16 Test af sammenhænge og fordelinger
for kvalitative data 375
16.1
2Xtesten
375
16.2 Test a f en fordeling 377
16.3 Test a f sammenhæng mellem to diskrete stokastiske
variabler 385
16.4 Test for homogenitet 390
16.5
Opgaver 390
17
Simpel lineær regression 395
17.1 Regression 395
17.1.1 Regressionsfunktionen 396
17.1.2 Forudsigelse a f Y med regressionsfunktionen 398
17.2 Simpel lineær regression 400
17.3 Estimation a f den simple lineære regressionsfunktion 403
17.3.1 Stikprøveanalogprincippet 403
17.3.2 Mindste kvadraters metode 405
17.3.3 Egenskaber ved OLS-estimatorerne 406
17.3.4 Ikke-stokastisk forklarende variabel 408
17.4 Specifikationstest a f simpel lineær regression 409
17.4.1 Antagelse 1: Funktionel form 411
17.4.2 Antagelse 2: Simpel tilfældig stikprøve 413
17.4.3 Antagelse 3: Homoskedasticitet 413
17.4.4 Antagelse 4: Normalfordelte observationer 415
17.5 Hypotesetest og konfidensinterval ved simpel lineær
regression 419
17.6 Usikkerhed på forudsigelser ved simpel lineær regression 422
17.6.1 Usikkerhed på forudsigelse a f den forventede værdi af
Y 423
17.6.2 Usikkerhed på forudsigelse a f værdien a f Y 425
17.7 Opgaver 426
18
Multipel lineær regression 429
18.1 Multipel lineær regression 429
18.2 Estimation af den multiple lineære regressionsfunktion
18.3 Specifikationstest a f multipel lineær regression 435
433
18.4 Hypotesetest og konfidensinterval ved multipel lineær
regression 436
18.4.1 Test a f hypotese om en enkelt koefficient 436
18.4.2 Test af samlet signifikans af alle de forklarende
variabler 438
18.4.3 Test a f andre hypoteser i den multiple lineære
regressionsfunktion 441
18.5 Forudsigelser ved multipel lineær regression 444
18.6 Ikke-lineære regressionsfunktioner 444
18.6.1 Estimation a f en ikke-lineær regressionsfunktion med
OLS 445
18.6.2 Lineær regression som approksimation til ikke-lineær
regression 447
18.6.3 Regression med interaktion mellem forklarende
variabler 447
18.7 Udeladte variabler 450
18.8 Spuriøs sammenhæng i regressionsanalyse 451
18.9 Opgaver 452
Sandsynlighedstabeller
Stikordsregister
463
455
Forord
Denne bog er skrevet med henblik på et indledende kursus (10 ECTSpoint) i statistik på videregående samfundsvidenskabelige uddannelser
på BA-niveau. Bogen, som i øvrigt er en videreudvikling a f Indblik i
statistik – en grundbog fo r videregående uddannelser, finder således
anvendelse inden for studier som fx økonomi, erhvervsøkonomi, psy­
kologi, statskundskab og sociologi.
Kapitel 2-7 dækker sandsynlighedsteori (populationer, sandsynlig­
hedsmål, stokastiske variabler, fordelinger, beskrivende mål og stoka­
stiske processer), mens kapitel 9-18 dækker statistiske metoder (estima­
torer, hypotesetest og konfidensintervaller for estimatorer, hypotesetest
af sammenhænge samt lineær regression).
Gennem hele bogen lægger vi vægt på at forklare sammenhængen
mellem sandsynlighedsteori og de statistiske metoder. Således bruger vi
kapitel 1 og 8 til at forklare, at det ultimative mål inden for samfunds­
videnskab ofte er at bruge en stikprøve til at opnå viden om en ukendt
population – fx den danske befolknings holdning til et politisk spørgs­
mål. Men for at kunne håndtere den usikkerhed, der er indeholdt i en
stikprøve, er vi nødt til at kende sandsynlighedsteorien.
Endvidere lægger vi vægt på at forstå sammenhænge mellem for­
skellige størrelser, der alle er påvirket a f usikkerhed – fx sammenhæn­
gen mellem indkomst og forbrug a f bestemte varer – da dette er den
typiske situation, man belyser med empiriske undersøgelser inden for
samfundsvidenskab. I modsætning til de naturvidenskabelige discipli­
ner har man inden for samfundsvidenskab som oftest ikke mulighed for
at lave laboratorieforsøg, hvor man kan undersøge, hvad der sker med
den ene størrelse (forbruget), når man laver en kontrolleret ændring i
den anden (indkomsten). De statistiske metoder er derfor nødt til at tage
højde for, at begge størrelser er stokastiske. Derfor lægger vi vægt på at
forklare begreber som betinget sandsynlighed og betinget forventning
samt metoder til at teste sammenhænge mellem stokastiske variabler.
Denne tilgang anvender vi også i forbindelse med den lineære re­
gression i kapitel 17-18 – modsat mange andre lærebøger, som anta-
ger, at de forklarende variable ikke er stokastiske. Selvom dette måske
umiddelbart ser ud til at give en lidt mere besværlig notation, så er
fortolkningen til gengæld helt på linje med de øvrige fortolkninger i
bogen. Det er desuden en mere realistisk tilgang til de situationer, man
støder på i praksis inden for samfundsvidenskab.
Forfatterne vil gerne takke Viggo Høst og Lars Skipper for kom­
mentarer. I særdeleshed vil forfatterne takke redaktør Torben Bystrup
Jacobsen for grundig gennemgang a f manuskriptet til den forrige udga­
ve a f bogen, ligesom vi gerne vil rette en kæmpe tak til Hans Reitzels
Forlags redaktør Martin Laurberg for hans indsats og tålmodighed i
forbindelse med nærværende udgave.
Nikolaj Malchow-Møller og Allan H. Würtz
Juli 2014
1
Statistik og erkendelse
Er det tilfældighedernes spil, eller eksisterer der en underliggende sy­
stematik? Dette spørgsmål gennemsyrer hele denne bog. Statistik giver
os mulighed for at besvare spørgsmålet, fordi statistik er en metode til
at opnå erkendelse i situationer med usikkerhed.
Man kan således anvende statistik til at undersøge sammenhænge og
komme med forudsigelser. Ofte indgår der elementer af begge dele i en
statistisk analyse. For at kunne forudsige efterspørgslen efter bærbare
computere er det fx væsentligt at have kendskab til forbrugernes ind­
komst samt sammenhængen mellem indkomst og forbrug.
Statistiske analyser hjælper os med at forbinde vores idéer (teorier)
med den virkelige verden gennem observationer fra denne. I tilfældet
med bærbare computere har man måske en teori om sammenhængen
mellem indkomst og efterspørgsel efter computere. Med observationer
af forbrugeres indkomst og køb af computere kan statistikken hjælpe os
med at kvantificere sammenhængen, eller for den sags skyld afvise, at
der er en sammenhæng. Sådanne analyser må nødvendigvis tage hensyn
til mange former for usikkerhed. For eksempel er der usikkerhed, fordi
man kun observerer nogle af forbrugerne. Men der er også usikkerhed,
fordi andre forhold, som man ikke nødvendigvis observerer, også på­
virker efterspørgslen efter computere, fx forbrugernes socioøkonomi­
ske baggrund og livsstil. Derfor er det nødvendigt med redskaber til at
håndtere usikkerhed. Sandsynlighedsteorien giver os disse.
Denne bog handler derfor både om sandsynlighedsteori og statistik.
I afsnit 1.1 ser vi på en række konkrete problemstillinger, som vi vil
udvikle redskaber til at analysere. Metoderne til erkendelse ved brug af
statistik sætter vi i et mere filosofisk (videnskabsteoretisk) lys i afsnit
1.2, mens vi i afsnit 1.3 giver en kort overordnet gennemgang af bogens
indhold.
1.1
Eksempler på problemstillinger
Ovenfor havde vi et eksempel, hvor man ønskede at forudsige efter­
spørgslen efter bærbare computere ved at bestemme en sammenhæng
mellem indkomst og efterspørgsel. Dette afsnit rummer en række andre
eksempler på problemstillinger, hvor statistiske analyser kan hjælpe os
med at give svar.
Eksempel 1.1 : En lottotrækning
Til brug ved en lottotrækning er der 36 kugler nummereret fra 1 til 36 i en
stor bowle. A f bowlen udtrækkes syv kugler. Det koster 4 kr. at spille en
række lotto, dvs. gætte på syv tal. Jens Spillemand er meget interesseret i
at vide, hvad sandsynligheden er for, at han vinder den helt store præmie
på fem millioner, hvis han køber to lottokuponer. Han er også nysgerrig
efter at finde ud af, hvor meget han kan „forvente“ at vinde.
■
Eksempel 1.2: Pakning af skruer
En virksomhed producerer 35 mm skruer på et nyindkøbt produktions­
anlæg. Skruerne pakkes automatisk i pakker med 500 stk. Det viser
sig, at selvom pakkemaskinen indstilles til 500 skruer, så rummer pak­
kerne ikke altid 500 stk. Det resulterer i klager fra kunderne. Ledelsen
kræver derfor, at maksimalt 1 % af pakkerne må indeholde mindre end
500 skruer. Pakkemaskinen skal indstilles til at overholde dette krav.
Spørgsmålet er derfor, hvor mange skruer pakkemaskinen skal indstil­
les til at putte i hver pakke.
■
Eksempel 1.3: Defekte biler
På en bilfabrik ved man af erfaring, at 0,8 % af de færdigproducerede
biler har alvorlige fejl. Fabrikken står i øjeblikket over for en ordre på
1000 biler til en førende autoforhandler. Ledelsen af fabrikken er bange
for, at forhandleren vil opsige samarbejdet, hvis for stor en del af de le­
verede biler har alvorlige fejl. Den ønsker således at kende risikoen for,
at mere end 10 af bilerne har alvorlige fejl. Fabrikken har også netop
sat en ny produktionslinje i gang for deres seneste model. For at kunne
iværksætte eventuelle forbedringer af produktionen vil ledelsen derfor
gerne vide, hvor stor en del af de producerede biler på denne linje der
viser sig at være defekte. Mere præcist vil ledelsen gerne vide, om der
er samme fejlprocent som på den eksisterende produktionslinje.
■
Eksempel 1.4: En markedsundersøgelse
En isproducent overvejer at gå ind på det svenske marked og har der­
for sat strategiafdelingen til at analysere mulighederne. Denne har brug
for at kende efterspørgslen efter is i Sverige for at kunne vurdere, om
det vil være rentabelt at starte salg og markedsføring. Derfor vil den
iværksætte en markedsundersøgelse for at bestemme den svenske efter­
spørgsel. Den er dog i tvivl om, hvor mange personer den skal inkludere
i undersøgelsen, og hvordan den skal udvælge disse, så omkostningerne
ikke bliver for store, og der alligevel opnås en tilfredsstillende grad af
præcision. Fra et omkostningsmæssigt synspunkt vil det være billigst at
interviewe folk på gaden i Malmø, men strategiafdelingen er i tvivl om
brugbarheden af det resultat, den derved opnår.
■
Eksempel 1.5: En meningsmåling
Danmark står over for endnu en EU-afstemning, og der er stor offent­
lig interesse om udfaldet af afstemningen. Et analyseinstitut foretager
en prognose for udfaldet. Analyseinstituttet har valgt at spørge 1000
personer og ønsker i den forbindelse at vide, hvor stor en usikkerhed
der er på resultatet, både på procentdelene af nej- og ja-stemmer og på
det samlede udfald af afstemningen. Analyseinstituttet vil også gerne
vide, hvor mange personer det skal spørge for at kende resultatet med 1
procentpoints nøjagtighed.
■
Problemstillingerne i disse eksempler involverer alle en form for usik­
kerhed. I eksempel 1.1 er det usikkert, hvordan lottotrækningen vil fal­
de ud, og i eksempel 1.5 er det usikkert, hvor stor en del af danskerne
der stemmer ja. I begge situationer kan statistiske metoder hjælpe os
med at håndtere denne usikkerhed. De to typer af analyser, der skal an­
vendes for at besvare spørgsmålene i henholdsvis eksempel 1.1 og 1.5,
er dog forskellige. Det næste afsnit uddyber denne metodiske forskel og
forklarer den overordnede opbygning af denne bog.
1.2
Deduktion og induktion
Det grundlæggende set-up er fælles for alle problemstillinger og ana­
lyser i denne bog: Der er en population af elementer. Fra denne popu­
lation udtrækkes en stikprøve. Populationen kan fx være de stemme­
berettigede i Danmark. Ved at foretage en meningsmåling udtager vi
en stikprøve fra populationen af stemmeberettigede. Populationen kan
også være de 36 kugler i en lottomaskine, hvor stikprøven er de 7 kug­
ler, der udtrækkes.
Figur 1.1:
Det grundlæ g­
gende set-up
I et sådant set-up kan man lave to overordnede typer af analyser: Induk­
tive og deduktive.
Deduktion anvendes i det tilfælde, hvor vi kender populationen og
ønsker at vide noget om stikprøven. Et eksempel på en analyse af denne
type er lottotrækningen i eksempel 1.1. Her kender vi populationen ned
til mindste detalje. Vi ved, at den består af 36 lige store kugler, og vi
ved, hvad der står på hver enkelt af dem. Imidlertid ved vi ikke, hvor­
dan stikprøven kommer til at se ud. Spørgsmålet er derfor, hvordan vi
kan bruge vores viden om populationen og udtrækningsmetoden til at
forudsige noget om stikprøven, dvs. de syv bolde, der udtrækkes. Hvad
er fx sandsynligheden for at udtrække de 7 bolde med numrene 1, 2, 3,
4, 5, 6 og 7?
Induktion anvendes i det tilfælde, hvor man ønsker at lære noget
om populationen ved hjælp af en stikprøve. Et eksempel på dette er
meningsmålingen i eksempel 1.5. Her kender man ikke andelene af nejog ja-sigere blandt de stemmeberettigede. For at få denne viden foreta­
ger man en meningsmåling: Man udtrækker en stikprøve blandt alle de
stemmeberettede (populationen) og observerer indholdet af denne. Man
bruger dernæst ja-andelen i stikprøven til at skønne over ja-andelen i
populationen, dvs. ja-andelen blandt alle de stemmeberettigede.
Med andre ord: Ved deduktion udnytter vi vores viden om det ge­
nerelle (populationen) til at lære om det specifikke (stikprøven). Ved
induktion bruger vi derimod vores viden om det specifikke (stikprøven)
til at lære om det generelle (populationen).
Figur 1.2:
Deduktion og
induktion
Alle problemstillinger i denne bog falder ind under én af disse katego­
rier. Når vi laver deduktion, anvender vi sandsynlighedsteori, fx hvis vi
skal sige noget om sandsynligheden for at slå en treer med en terning
eller at vinde i lotto. Ved induktion anvender vi statistik, som når vi skal
bestemme andelen af ja-stemmer blandt de stemmeberettigede ud fra en
stikprøve. Som vi skal se, er der en meget tæt sammenhæng mellem de
to typer af analyser, men det er vigtigt at holde fast i den begrebsmæs­
sige forskel.
Forskellen på induktive og deduktive analyser har dog forvirret selv
den induktive analyses mester: „I have a turn both fo r observation and
deduction“
, siger Sherlock Holmes på et tidspunkt til Dr. Watson.1Det­
te må man nødvendigvis undre sig lidt over, idet detektivarbejde er et
oplagt eksempel på induktion og ikke deduktion. Sherlock Holmes bru­
ger jo de få spor, han finder (stikprøven), til at slutte sig til det bagved­
liggende (forbrydelsen).
Samspillet mellem de to typer af analyser opstår, fordi de statistiske
metoder bygger på sandsynlighedsteorien. Vi bruger stikprøven til at
udtale os om populationen, men for at kunne dette må vi vide noget
om, hvordan og med hvilken sandsynlighed stikprøven er fremkommet.
Til dette skal vi bruge sandsynlighedsteorien. Derfor er vi nødt til først
at lære om sandsynlighedsteorien, før vi kan tage fat på de statistiske
metoder.
Kapitel 2 til 7 omhandler de redskaber fra sandsynlighedsteorien,
som vi bruger i deduktive analyser. Udstyret med disse redskaber ven­
1 „A study in Scarlett”, kapitel 2, i: Arthur Conan Doyle: “The Penguin Complete Sherlock Holmes”,
Penguin Books Ltd, London, 198 1. Kapitlet, hvor ovenstående citat stammer fra, hedder ironisk nok „The
Science o f Deduction“.
der vi os mod situationer, som man ofte møder i praksis, hvor vi mang­
ler viden om populationen og forsøger at opnå denne ved at udtrække
en stikprøve. Kapitel 8 til 18 omhandler derfor de statistiske metoder,
vi bruger til sådanne induktive analyser.
1.3
Et kort overblik over kapitlerne
Kapitel 2 giver en uddybende introduktion til populationsbegrebet, her­
under en introduktion til, hvordan man beskriver en population og dens
elementer. Kapitel 3 viser, hvordan man kan formalisere usikkerhed
i forbindelse med populationer og stikprøver. For at muliggøre mere
komplicerede analyser af usikkerhed viser vi i kapitel 4, hvordan man
modellerer usikkerhed ved hjælp af såkaldte stokastiske variabler og
deres sandsynlighedsfordelinger. Ved at modellere usikkerhed på denne
måde kan man faktisk analysere komplicerede problemer med usikker­
hed ved hjælp af velkendte og simple matematiske teknikker som addi­
tion og multiplikation. Indholdet i kapitel 3 og 4 er absolut nødvendigt
for at forstå de øvrige kapitler i bogen.
Usikkerhed repræsenterer man med en sandsynlighedsfordeling.
Men ligesom et meget detaljeret landkort ikke giver et godt overblik
over de vigtigste store veje, kan en sandsynlighedsfordeling være for­
virrende, når man skal have et overblik over de vigtigste aspekter af
usikkerheden. I kapitel 5 introducerer vi derfor beskrivende mål for
sandsynlighedsfordelinger, som med enkelte tal giver et overblik over
usikkerheden. I kapitel 6 beskriver vi forskellige udvalgte sandsynlig­
hedsfordelinger, som har vist sig at være meget anvendelige til at løse
praktiske problemer. I kapitel 7 går vi et skridt videre og introducerer
såkaldte stokastiske processer, som er nyttige i mange praktiske pro­
blemstillinger, der strækker sig over tid. Kapitlet er mere teknisk end de
øvrige og kan springes over, uden at sammenhængen mellem de øvrige
kapitler ødelægges.
Kapitel 8 er en introduktion til den induktive analyse, som de reste­
rende kapitler omhandler. I den induktive analyse er formålet at lære
om en given populations egenskaber. Det første vigtige skridt i denne
proces er indsamlingen af en stikprøve. I kapitel 9 diskuterer vi derfor
forskellige måder at udtrække stikprøver på.
Kapitlerne 10-14 omhandler induktiv analyse i det tilfælde, hvor vi
ønsker at lære noget om et enkelt karakteristikum i populationen. Vi
viser, hvordan man konstruerer en estimator, som er et skøn på et be­
skrivende mål udregnet på baggrund af en stikprøve. Konstruktionen af
en estimator afhænger af den måde, hvorpå stikprøven er udtrukket. I
kapitel 10 ser vi på en estimator for en middelværdi, når stikprøven er
udtrukket „simpelt tilfældigt“, mens vi i kapitel 11 ser på tilfælde, hvor
stikprøven er udtrukket på andre, ofte mere omkostningsbesparende
måder. I kapitel 12 behandler vi estimatorer for andre beskrivende mål
end middelværdien.
I kapitel 13 viser vi, hvordan man kan opstille et konfidensinterval
for en ukendt populationsstørrelse. Konfidensintervaller er en måde,
hvorpå man kan beskrive den usikkerhed, der knytter sig til en estima­
tor, eftersom denne er baseret på en stikprøve.
Før man udarbejder en statistisk analyse, har man ofte en (mere eller
mindre konkret) teori om populationen. For at teste en sådan teori kan
man opstille hypoteser, som man kan teste ved hjælp af en stikprøve.
Dette gennemgås i kapitel 14.
Fra kapitel 15 og fremefter fokuserer vi på metoder til at undersøge
sammenhænge mellem karakteristika i en population. I samfundsviden­
skaberne er man ofte interesseret i at analysere sådanne sammenhænge,
fx mellem indkomst og forbrug eller hvordan en persons adfærd relate­
rer sig til hans/hendes erfaringer. I kapitlerne 15 og 16 introducerer vi
metoder til at teste hypoteser om sammenhænge, både med kvantitative
data (kapitel 15) og kvalitative data (kapitel 16).
I kapitlerne 17-18 går vi skridtet videre og formulerer specifikke
sammenhænge. I kapitel 17 kigger vi på den mest almindelige brug­
te specifikation af en sådan sammenhæng: Den simple lineære regres­
sionsmodel. I kapitel 18 udvides dette til den multiple lineære regres­
sionsmodel.
2
Populationer
I en statistisk sammenhæng er en population en samling a f elementer,
fx personer, virksomheder, lande, kunder eller mere abstrakte objekter.
Fra en population kan man udtage en stikprøve. Forståelsen a f sam­
spillet mellem en population og udtrækningen af en stikprøve er helt
afgørende i statistiske analyser og derfor et centralt element i denne
bog. Inden vi undersøger dette samspil nærmere i de følgende kapitler,
vil vi bruge dette kapitel til at kaste et første blik på nogle populationer
og deres elementer.
I dette kapitel vil vi udelukkende beskæftige os med virkelige po­
pulationer. I afsnit 2.1 forklarer vi, hvad vi mere præcist forstår ved
en sådan population og dens elementer. I det efterfølgende afsnit viser
vi, hvordan man kan repræsentere og sammenligne både kvalitative og
kvantitative karakteristika ved de enkelte elementer i en population.
Fordi en population kan indeholde mange elementer, kan det ofte
være nyttigt at kunne sammenfatte elementerne på en overskuelig
måde. I afsnit 2.3 viser vi, hvordan dette kan gøres ved hjælp a f grafi­
ske redskaber som fx et histogram eller med enkle talstørrelser som fx
en middelværdi. Mens vi i afsnit 2.3 vil koncentrere os om at sammen­
fatte et enkelt karakteristikum ved elementerne i en population, som fx
elementernes alder eller deres indkomst, ser vi i afsnit 2.4 på, hvordan
man kan beskrive sammenhænge mellem sådanne karakteristika i en
population.
2.1
Virkelige populationer
En population er en samling a f elementer, hvor hvert element kan have
en række karakteristika. En population kan fx bestå a f alle danskere,
hvor hver person har karakteristika som fx alder, køn, uddannelse, bo­
pæl, beskæftigelse og indkomst. Selvom elementerne i en population
kan have mange forskellige karakteristika, fokuserer vi typisk kun på
det eller de karakteristika, som er a f interesse i en given undersøgelse,
fx personernes alder og/eller deres indkomst.
Når både elementerne i en population og deres karakteristika eksi­
sterer, kalder vi populationen for en virkelig population. En virkelig
population kan således i princippet observeres. I de næste kapitler vil vi
argumentere for nytten a f også at definere såkaldte superpopulationer,
der er mere abstrakte populationer.
2.2
Måleskalaer
For at lave statistiske analyser er det nødvendigt, at man kan måle ele­
menternes karakteristika. Målinger opgøres på forskellige typer a f ska­
laer. Typen a f skala har konsekvenser for, hvilke analysemetoder der
efterfølgende kan anvendes. I dette afsnit kigger vi derfor nærmere på
forskellige måleskalaer.
Vi arbejder i denne bog udelukkende med karakteristika, som man
kan repræsentere med en talværdi. Dette er ikke så restriktivt, som det
lyder. Tænk fx på en person, hvor det relevante karakteristikum er, om
hun er for eller imod et lovforslag. Dette lugter ikke umiddelbart a f tal,
men vi kan alligevel sagtens repræsentere „for“ med talværdien 0 og
„imod“ med talværdien 1.
Man måler forskellige karakteristika på forskellige skalaer. En per­
sons ægteskabelige status (enlig, gift, skilt, enke) er fx målt på en anden
skala end en persons vægt i kilo. Fordi typen af skala har stor betydning
for valg af analysemetode, opdeler vi målinger i kvalitative og kvantita­
tive målinger. Når det ikke er meningsfuldt at anvende de to basale reg­
nearter (addition, subtraktion) på værdierne fra en måling, er målingen
kvalitativ. Hvis det derimod er meningsfuldt at bruge de fire regnearter,
siges målingen at være kvantitativ.
Man skelner desuden mellem to typer a f måleskalaer for en kvali­
tativ måling: Nominale og ordinale. Ligeledes skelner man mellem to
slags måleskalaer i forbindelse med en kvantitativ måling: Intervalska­
laer og ratioskalaer. Opdelingen er illustreret i tabel 2.1 sammen med
de matematiske operatorer, der er meningsfulde at anvende i forbindel­
se med hver a f de fire måleskalaer. De fire skalaer uddybes yderligere i
de følgende afsnit.
Tabel 2.1:
Målinger,
Måling
Måleskala
Meningsfulde matematiske operatorer
Kvalitativ
N o m in al
=,
Ordinal
=, ≠ , >, <
Interval
= , ≠ , >, <, +, –
Ratio
=, ≠ , >, <, +, – , ·, /
måleskalaer og
matematiske
operatorer
2.2.1
Kvantitativ
≠
Nominal skala
Et eksempel på en nominal måleskala er en persons hårfarve. Antag for
eksemplets skyld, at hårfarven kun kan være hvid, sort eller rød, og at
hvid repræsenteres med værdien 1, sort med værdien 2 og rød med vær­
dien 3. Det giver ingen mening at bruge de fire regnearter her, fx ved at
gange hvid med rød. Det giver heller ikke mening at tale om, at rød er
større end sort, selvom rød er repræsenteret ved talværdien 3, mens sort
„kun“ har talværdien 2. Faktisk kan man i dette eksempel kun sige, om
en persons hårfarve er lig med eller forskellig fra en anden persons hår­
farve. Det vil sige, at man kan skelne de forskellige værdier på skalaen:
1 = hvid, 2 = sort og 3 = rød. Dette karakteriserer en nominal måleskala:
Der er ingen struktur eller sammenhæng mellem værdierne på skalaen.
2.2.2
Ordinal skala
Modsat en nominal skala giver det på en ordinal skala mening at tale
om, at nogle værdier er større eller mindre end andre værdier. Hvis man
fx skal måle de studerendes opfattelser a f kaffens kvalitet i kantinen og
angiver tre svarmuligheder: „tilfreds“, „meget tilfreds“ eller „super til­
freds“ på spørgeskemaet, så kan disse repræsenteres med talværdierne
1, 2 og 3. Her giver det mening at tale om, at „tilfreds“ (= 1) er mindre
end „meget tilfreds“ (= 2), som igen er mindre end „super tilfreds" (=
3). En ordinal skala er således karakteriseret ved, at værdierne på skala­
en er rangordnede. På en ordinal skala giver det imidlertid ikke mening
at vurdere størrelsen a f forskellen mellem to værdier. For eksempel kan
man ikke konkludere, at forskellen mellem „meget tilfreds“ og „super
tilfreds“ er den samme som mellem „tilfreds“ og „meget tilfreds“. Man
kan altså ikke trække talværdierne fra hinanden på en meningsfuld
måde.
2 .2.3
Intervalskala
På en intervalskala giver det mening at tale om forskellen mellem to
værdier. For eksempel er forskellen i kropstemperatur mellem to per­
soner med temperaturer på henholdsvis +37 grader Celsius og +38 gra­
der Celsius lig med 1 grad Celsius, hvilket er det samme som forskel­
len mellem to personer med henholdsvis +38 og +39 grader Celsius i
kropstemperatur. Det giver derimod ikke mening at tale om et relativt
forhold mellem to temperaturer målt i Celsius. Selvom det umiddelbart
kunne virke meningsfuldt at sige, at +40 grader Celsius er dobbelt så
varmt som +20 grader Celsius, kan man se det problematiske i dette
ved på samme måde at forsøge at sammenligne +30 grader Celsius med
–10 grader Celsius. For at give relative sammenligninger mening er det
nødvendigt med et naturligt nulpunkt. Et sådant nulpunkt er defineret
ved, at intet a f det givne karakteristikum er til stede. Når temperaturen
er 0 grader Celsius, betyder det imidlertid ikke, at temperaturen ikke er
til stede.
2.2.4
Ratioskala
En ratioskala er en intervalskala med et naturligt nulpunkt. Vægten af
en person har fx et naturligt nulpunkt, som er der, hvor han ikke vejer
noget (og dermed ikke er til stede). Her giver det derfor mening at tale
om det relative forhold mellem to værdier. Fx vejer en mand på 210,40
kg dobbelt så meget som en mand på 105,20 kg. Værdierne på en ratio­
skala kan også være heltal som for eksempel antallet a f ægteskaber, en
person har bag sig. Antallet a f ægteskaber har det naturlige nulpunkt 0,
som er fraværet a f tidligere ægteskaber.
2.2.5
Valg af skala
Det er værd at bemærke, at man ofte kan måle det samme karakteristi­
kum på forskellige skalaer. Nogle gange vil måleskalaen være dikteret
af de fysiske rammer for det, man måler. Der er dog ofte også et element
a f subjektivitet i valget a f måleskala. Fx tilhører måling a f temperaturer
i Celsius en intervalskala, hvorimod måling a f temperaturer i Kelvin
tilhører en ratioskala.
I samfundsvidenskaberne er det ikke usædvanligt, at det, man vil
måle, ikke er præcist defineret fysisk. Et eksempel på dette er en per­
sons intelligens eller en persons holdning til kaffens kvalitet i kantinen.
Dermed er det ikke altid oplagt, hvordan måleskalaen skal udformes
og fortolkes. Der opstår således et tæt samspil mellem målingen a f et
karakteristikum og den analytiker, som står for målingen.
2.3
Overblik over et enkelt karakteristikum
For at kunne skabe sig overblik over interessante aspekter ved en po­
pulation er det nyttigt at have metoder til at sammenfatte karakteristika
ved populationen. Dette er specielt vigtigt, når der er mange elementer
i populationen. Men selv med blot 50 personer i en population kan det
være svært at danne sig et overblik over fx deres indkomster eller alder
blot ved at betragte de 50 forskellige værdier for disse. I dette afsnit
vil vi derfor gennemgå en række grafiske og numeriske metoder til at
sammenfatte og illustrere udvalgte karakteristika ved elementerne i en
virkelig population.
Til dette formål er det praktisk at indføre lidt notation. Lad derfor
N po være antallet af elementer i populationen, lad a. være det j ’te ele­
ments værdi a f karakteristikum a (fx indkomst) og lad bj være det j ’te
elements værdi af et andet karakteristikum benævnt b (fx forbrug), hvor
j er et heltal mellem
p
o
gNp 1
Eksempel 2.1 : Indkomst og forbrug – del 1
I en population bestående a f fem individer, N = 5, har hvert individ
en månedlig indkomst (karakteristikum a) og et månedligt dagligvare­
forbrug (karakteristikum b). Værdierne for disse karakteristika er vist i
tabellen nedenfor:
Tabel 2.2:
elementer
bj
(individ)
aj
(indkomst i tusinde kr.)
(forbrug i tusinde kr.)
1
36
9
2
28
5
3
25
6
4
32
8
5
28
6
j
Populationens
Indkomsten for individ nummer 3 er således a3 = 25 (tusinde kr.). Indi­
vid nummer 2 og 5 har samme indkomst, så her er a2 = a5 = 28 (tusinde
kr.). Forbruget for individ nummer 5 er b5 = 6 (tusinde kr.).
■
2.3.1
Frekvenser og histogrammer
En måde at sammenfatte en egenskab for en population på er ved at
udregne andelen af elementer i populationen, som har en bestemt værdi
af et karakteristikum. Fordi vi ofte er interesserede i denne størrelse,
definerer vi en funktion, kaldet andelsf unktionen, som giver os disse
andele. Lad z være en værdi a f et karakteristikum. Andelsfunktionen,
g ( z ), er da defineret som i følgende boks:
Andelsfunktionen, g (z ) , for et karakteristikum i en virkelig po­
pulation er defineret ved:
Antallet a f elementer i populationen er lig med N pop. Tælleren i den
ovenstående brøk kaldes også for frekvensen, og g(z) kaldes også for
den relative frekvens a f elementer med værdien z. Hvis man ønsker et
visuelt billede a f andelsfunktionen, kan man afbilde den i et søjledia­
gram som vist i det følgende eksempel.
Eksempel 2.2: Indkomst og forbrug – del 2
I eksempel 2.1 er andelen a f elementer med en indkomst på 28 lig med
2/5 = 0,4. Andelsfunktionen udregnet for alle de forskellige værdier af
indkomst i populationen er:
For alle andre værdier a f z er g ( z ) = 0. Man siger også, at den relative
frekvens af indkomsten 28 er 0,4. I søjlediagrammet i figur 2.1 er de
relative frekvenser repræsenteret ved højden a f de forskellige søjler.
Figur 2.1: Et
søjlediagram
■
Når man skal illustrere mange forskellige værdier a f et karakteristikum,
bliver et søjlediagram hurtigt uoverskueligt. I stedet er det ofte nyttigt
at lave et histogram. Et histogram minder om et søjlediagram, men ad­
skiller sig ved, at det slår værdier, der ligger tæt på hinanden, sammen
i grupper. Derfor er et histogram specielt nyttigt ved kvantitative må­
linger. Hvor det i et søjlediagram er højden af en pind (eller søjle), der
angiver den relative frekvens a f en given værdi, er det i et histogram
arealet a f en søjle, der angiver den relative frekvens af en gruppe.
Man kan konstruere et histogram på følgende måde: Inddel værdi­
erne a f et karakteristikum i grupper eller intervaller. Hvis fx værdierne
ligger mellem 0 og 100, kan man lave 10 intervaller med bredden 10,
hvor det første interval indeholder alle værdier større end (eller lig med)
0 og mindre end eller lig med 10. Det andet interval indeholder værdier,
der er større end 10 og mindre end eller lig med 20, osv. Læg mærke til,
at en værdi skal tilhøre én, og kun én, gruppe. Man kalder da det første
interval for 5-gruppen, fordi 5 er midtpunktet i intervallet.
Det næste skridt er at konstruere en søjle, hvis areal svarer til den
relative frekvens a f elementer i gruppen. Hvis en gruppe således inde­
holder 25 % a f elementerne og har bredden 10, så skal højden på søjlen
være: 0,25/10 = 0,025 (eller 2,5 hvis man regner i procent). Det næste
eksempel illustrerer forskellen på et søjlediagram og et histogram.
Eksempel 2.3: Et fodboldhold
I en mindre fodboldklub er målene gennem sæsonen blevet scoret af
12 forskellige spillere. Disse spillere danner derfor en population, hvor
elementerne har følgende værdier: 1, 2, 3, 4, 5, 6, 7, 8, 13, 13, 13, 17,
som er antallet a f mål scoret a f hver spiller. Et søjlediagram med de
relative frekvenser er vist i figur 2.2:
Figur 2.2: Et
søjlediagram
Det ses af søjlediagrammet, at værdien 13 udgør 25 % a f værdierne.
Man kan nu konstruere et histogram for værdierne ved at inddele dem
i grupper (intervaller) a f bredden 5. Første gruppe er da værdierne 0 til
og med 5, kaldet 2,5-gruppen, næste gruppe er værdierne fra 5 til og
med 10, kaldet 7,5-gruppen, tredje gruppe er værdierne fra 10 til og
med 15, kaldet 12,5-gruppen, og endelig er sidste gruppe værdierne fra
15 til og med 20, kaldet 17,5-gruppen. Figur 2.3 viser histogrammet.
Figur 2.3: Et
histogram –
version 1
Da hver gruppe har bredden 5, og eftersom 12,5-gruppen indeholder
25 % a f elementerne i populationen (3 ud af 12), så er højden a f denne
søjle lig med 0,25/5 = 0,05. Tilsvarende inkluderer 2,5-gruppen i alt 5
elementer, hvorfor højden a f denne søjle er (5/12)/5 = 0,083.
Når man laver et histogram, behøver alle grupper ikke have samme
bredde. Man kunne fx slå de to sidste grupper sammen til én gruppe,
som da vil gå fra 10 til og med 20. Dermed får denne gruppe bredden
10, og da den rummer 4 ud a f 12 elementer, vil dens søjle have højden
(4/12)/10 = 0,033, som vist i figur 2.4.
Figur 2.4: Et
histogram –
version 2
■
En anden type af diagram, som illustrerer andelsfunktionen, er et lagka­
gediagram. I et lagkagediagram repræsenterer lagkagen hele populati­
onen, og de forskellige stykker repræsenterer forskellige værdier (eller
grupper a f værdier) i populationen. Et stykkes andel a f lagkagen svarer
da til dets værdis relative frekvens i populationen. Er arealet af hele
lagkagen lig med én, er arealet a f et lagkagestykke derfor givet ved an­
delsfunktionen. Lagkagediagrammet er nyttigt i forbindelse med både
kvalitative og kvantitative målinger.
Eksempel 2.4: Indkomst og forbrug - del 3
Et lagkagediagram for indkomsterne i populationen fra eksempel 2.1 er
vist i figur 2.5.
Figur 2.5: Et
lagkagedia­
gram
■
Nogle gange kan det være interessant at kende den andel a f popula­
tionen, der har en indkomst mindre end eller lig med en given værdi.
Fx andelen a f personer, der lever under fattigdomsgrænsen. Sådanne
andele kaldes også for kumulative andele eller kumulative relative fre­
kvenser. Formelt kan man definere en kumulativ andelsfunktion, G(z ),
på følgende måde:
Den kumulative andelsfunktion, G (z ), for et karakteristikum i
en virkelig population er defineret ved:
Eksempel 2.5: Indkomst og forbrug – del 4
Frekvenser, relative frekvenser og kumulative relative frekvenser for
indkomsten i populationen fra eksempel 2.1 er udregnet i nedenstående
tabel:
Tabel 2.3:
Frekvens
Værdier
Kumulative
relative
25
1
Relativ
frekvens
Kumulativ
relativ frekvens
0,2
0,2
frekvenser
28
2
0,4
0,6
32
1
0,2
0,8
36
1
0,2
1,0
Den kumulative andelsfunktion for denne population er da:
Man kan aflæse direkte a f den kumulative andelsfunktion, at andelen af
populationen med en indkomst på højst 28 er G(28) = 0,6. Bemærk, at
man også kan aflæse den kumulative andelsfunktion for en indkomst­
værdi, som ikke findes i populationen. For eksempel er andelen a f po­
pulationen med en indkomst på højst 33 lig med 0,8, idet G(33) = 0,8.
■
2.3.2
Median og fraktiler
Ofte er det nyttigt at kunne beskrive en population med nogle få nøgle­
tal. Et sådant nøgletal er medianen. En median er en værdi, som deler
elementerne i populationen i to lige store grupper, hvor den ene gruppe
har værdier større end medianen, og den anden gruppe har værdier min­
dre end medianen. Det giver primært mening at udregne medianen ved
en kvantitativ måling.
En måde, hvorpå man kan finde medianen, er ved at rangordne alle
værdierne fra den mindste til den største. Man betegner da den mindste
værdi med a(1), hvor parentesen om fodtegnet angiver, at der er tale
om en rangordnet værdi. Det er altså ikke nødvendigvis tilfældet, at
a(1) = a1 hvor a(1) er værdien a f det første element. Kun hvis det første
element også er det mindste element, er a(l) = a1 Den næstmindste
værdi i populationen betegner man da a(2) og den største værdi
Medianen er den midterste rangordnede værdi. Hvis der fx er 25
elementer i populationen, så er medianen værdien a f det 13. mindste
element, a(13), da der så er 12 værdier, a(14),..., a(25), der er mindst lige
så store som a(13), og 12 værdier, a(1),...,a(12), der er mindst lige så små
som a(1).
Er der et lige antal elementer i populationen, findes der ikke ét ele­
ment, der deler populationen i to lige store dele. Hvis fx populationen
har 10 elementer, tager man i stedet gennemsnittet a f det 5. og 6. mind­
ste element, nemlig: 0,5 · (μ + a 6)).
Ud fra dette kan man opskrive en generel regel til brug ved udreg­
ningen af medianen i en virkelig population:
Medianen a f et karakteristikum a i en virkelig population er gi­
vet ved:
hvor Npop er antallet a f elementer i populationen, og a(j) er det j ’te
mindste rangordnede element i populationen.
Eksempel 2.6: Indkomst og forbrug – del 5
Tabel 2.4 viser de rangordnede indkomstværdier for elementerne i po­
pulationen fra eksempel 2.1 :
Tabel 2.4:
Rangordnede
Rangordning, j
1
Rangordnet værdi a(j)
25
værdier
2
28
3
28
4
32
5
36
Da Npop
er et ulige tal
i dette eksempel,
så er medianen
a(0,5·5+0,5) = a(3) = 28.
■
Medianen er et eksempel på en fraktil. Generelt er en p-fraktil en værdi,
hvorom det gælder, at andelen p a f elementerne i populationen har en
værdi mindre end p -fraktilen. Derfor er p altid et tal mellem 0 og 1.
Hvis man fx undersøger alderen for personerne i en population, så er
0,1-fraktilen lig med den alder, hvorom det gælder, at 10 % er yngre og
90 % er ældre. Medianen er derfor en 0,5-fraktil.
Som for medianen kan man opstille en regneregel for udregningen
a f en p -fraktil i en virkelig population. Til dette formål er det praktisk
at definere ,,[x ]“ til at betyde heltalsværdien a f et tal, x. For eksempel
er [5.5] = 5 og [831.97] = 831. Så kan man udregne p -fraktilen på føl­
gende vis:
p-fraktilen a f et karakteristikum a i en virkelig population er givet ved:
hvor N po er antallet a f elementer i populationen, a(j ) er det ƒ te mindste rangord­
nede element i populationen, og „[ ]“ angiver heltalsværdien a f et tal.
Eksempel 2.7: Indkomst og forbrug – del 6
I populationen fra eksempel 2.1 kan man finde 0,75-fraktilen som:
a([0,75·5+1]) = a([4,75]) = a(4) = 32 , idet 0,75 · N pop = 0,75 · 5 = 3,75
ikke er et heltal.
■
Man betragter ofte 0,1-, 0,25-, 0,75- og 0,9-fraktilerne, når man vil
sammenfatte en population ved hjælp a f fraktiler. Sammen med media­
nen giver disse størrelser et godt billede af, hvordan værdierne i popu­
lationen fordeler sig.
Eksempel 2.8: Den danske befolkning
Der er godt 5 millioner personer i Danmark. Nedenstående tabel er ba­
seret på tal fra Danmarks Statistik for januar 2008 og viser udvalgte
fraktiler for henholdsvis danske kvinder og mænds alder målt i år.
Tabel 2.5:
Fraktiler for
Fraktiler
0,1
0,25
0,5
0,75
0,9
Kvinder
8
20
40
58
72
Mænd
7
19
38
56
68
kvinders og
mænds alder i
Danmark
Det ses af tabellen, at der er en større andel a f mænd, som er unge, sam­
menlignet med kvinder. Således er fx halvdelen a f mændene 38 år eller
derunder, mens halvdelen a f kvinderne er 40 år eller derover.
■
2.3.3
Box plot
I et box plot (også kaldet et „box-and-whisker plot“) afsætter man den
mindste værdi, 0,25-fraktilen, medianen, 0,75-fraktilen og den største
værdi i populationen som vist i figur 2.6. Grafisk forbinder man den
mindste værdi og 0,25-fraktilen med en streg, og ligeledes forbinder
man 0,75-fraktilen og den største værdi med en streg. Man tegner der­
næst et rektangel med 0,25-fraktilen og 0,75-fraktilen som de to ende­
stykker. Endelig markerer man medianen med en lodret streg gennem
rektanglet. Et box plot er nyttigt, når man fx vil sammenligne forskel­
lige populationer.
Figur 2.6:
Et box plot
2.3.4
Middelværdi og varians
Ved kvantitative målinger har man mulighed for at udregne nogle flere
nøgletal, som beskriver centrale egenskaber ved populationen. Et så­
dant nøgletal er middelværdien. Middelværdien a f et karakteristikum a
i en virkelig population er defineret på følgende måde:
Middelværdien a f et karakteristikum a i en virkelig population
er givet ved:
hvor Npop er antallet a f elementer i populationen, og
a1,a 2,...,a N
pop er de forskellige værdier a f karakteristikum a
i populationen.
betyder, at man skal summere alle værdierne a f a
Sumtegnet,
i populationen. Middelværdien er således den gennemsnitlige værdi af
et karakteristikum i populationen. Det er den værdi, man får, hvis man
ligeligt ud på alle elementer i
deler summen i populationen,
populationen, så hvert element får en N pop’te del a f summen.
Eksempel 2.9: Indkomst og forbrug – del 7
I populationen fra eksempel 2.1 er middelværdien af indkomsten lig
med:
Bemærk, at ingen af individerne rent faktisk har en indkomst lig med
middelværdien. Tilsvarende kan man vise, at middelværdien a f forbru­
get i populationen er μ forbrug = 6 ,8 (tusinde kr.).
■
To populationer kan have samme middelværdi, men alligevel være me­
get forskellige. Hvis den ene population rummer to elementer med vær­
dierne 15 og 13, så er middelværdien 14. Men middelværdien er også
14 i en population med to elementer, hvor det ene element har værdien
26, og det andet har værdien 2. I den sidste population er værdierne
imidlertid spredt mere ud end i den første population. Middelværdien
er altså ikke en fuldstændig beskrivelse a f en population.
En nøgletal, der giver overblik over spredningen i en population,
er variansen. Variansen giver et indtryk af, hvordan værdierne i popu­
lationen er spredt omkring middelværdien. Variansen for en virkelig
population er defineret i følgende boks:
Variansen af et karakteristikum a i en virkelig population er gi­
vet ved:
hvor Npop er antallet a f elementer i populationen, a1, a2,..., aNpop
er de forskellige værdier a f karakteristikum a i populationen, og
μa er middelværdien a f karakteristikum a.
I det ekstreme tilfælde, hvor alle elementer i populationen har samme
værdi, a1 = a2 = ... = aNpop, er variansen 0. I alle andre tilfælde er vari­
ansen større end 0. Man udregner ofte også kvadratroden a f variansen,
fordi denne har samme måleenhed som værdierne selv. Denne kaldes
standardafvigelsen og er defineret som:
Standardafvigelsen af et karakteristikum a i en virkelig popu­
lation er givet ved:
hvor
er variansen a f karakteristikum a i populationen.
Standardafvigelsen er et mål for den gennemsnitlige afvigelse fra mid­
delværdien i populationen.
Eksempel 2.10: Indkomst og forbrug – del 8
I populationen fra eksempel 2.1 er variansen a f indkomsten lig med:
+ (32 – 29,8)2 + (28 – 29,8)2) = 14,56
Variansen måles i dette tilfælde i (tusinde kr.)2. Standardafvigelsen er
derimod σ income = 3,82 tusinde kr
■
Variansen eller standardafvigelsen kan man bruge til at sammenligne
to populationer, fx indkomster i Danmark og indkomster i USA. Umid­
delbart vil vi forvente, at variansen er noget højere i det sidste tilfælde.
I kapitel 5 vender vi tilbage til fortolkningen af både middelværdi og
varians.
2.4
Overblik over flere karakteristika
Inden for samfundsvidenskab er man ofte interesseret i at undersøge,
hvordan forskellige karakteristika samvarierer. For eksempel er der
mange, der har undersøgt, om der er sammenhæng mellem køn og ind­
komst, således at fx mænd har en tendens til at tjene mere end kvinder.
I dette afsnit skal vi derfor se på en række metoder, grafiske såvel som
numeriske, til at sammenfatte og illustrere sammenhænge mellem to
(eller flere) karakteristika i en virkelig population.
2.4.1
Krydstabel og punktdiagram
Til at beskrive sammenhænge mellem to karakteristika i en population
kan man opstille en krydstabel. En krydstabel tabulerer frekvenserne
eller de relative frekvenser a f de forskellige kombinationer a f de to ka­
rakteristika i populationen.
Eksempel 2.11: Køn og sportsgrene
Betragt følgende population med 12 elementer, hvor hvert element er en
person med to karakteristika: ( 1) personens køn: kvinde eller mand; og
(2) personens foretrukne sportsgren ud af tre mulige: fodbold, håndbold
eller isdans. De 12 elementer i populationen ser ud som følger: (mand,
isdans), (kvinde, håndbold), (kvinde, isdans), (kvinde, isdans), (mand,
fodbold), (kvinde, håndbold), (mand, fodbold), (kvinde, håndbold),
(mand, fodbold), (mand, håndbold), (kvinde, håndbold) og (kvinde,
fodbold).
Et mere overskueligt billede a f denne population får man ved at lave
en krydstabel med frekvensen a f hver mulig kombination a f de to ka­
rakteristika som vist i tabel 2.6.
Tabel 2.6:
En krydstabel
med frekven­
ser
Fodbold
Håndbold
Isdans
Kvinde
1
4
2
Mand
3
1
1
Man kan også lave en krydstabel med relative frekvenser som vist i
tabel 2.7.
Tabel 2.7:
En krydstabel
Fodbold
Håndbold
Isdans
Kvinde
1/12
4/12
2/12
Mand
3/12
1/12
1/12
med relative
frekvenser
Forskellene mellem mænd og kvinder skyldes både forskelle i fore­
trukne sportsgrene samt et forskelligt antal mænd og kvinder i popu­
lationen. Hvis man vil vurdere forskellen mellem mænds og kvinders
foretrukne sportsgren, kan det være mere nyttigt at udregne de relative
frekvenser for hvert køn for sig. Dette er gjort i tabel 2.8. Det ses da, at
andelen a f kvinder, som foretrækker håndbold, er betydelig større end
andelen a f mænd, som foretrækker håndbold.
Tabel 2.8:
En krydstabel
med relative
frekvenser for
Fodbold
Håndbold
Isdans
Kvinde
1/7
4/7
2/7
Mand
3/5
1/5
1/5
hvert køn
■
Til at få et godt visuelt billede a f samvariationen mellem to karakteri­
stika kan man tegne et punktdiagram. I et punktdiagram angiver man
for hvert element værdierne a f de to karakteristika med en prik i et
todimensionelt koordinatsystem.
Eksempel 2.12: Indkomst og forbrug – del 9
I figur 2.7 er værdierne a f de to karakteristika (indkomst og forbrug)
afbildet for de fem elementer i populationen fra eksempel 2.1. Værdien
a f indkomsten (karakteristikum a) er vist på den vandrette akse, mens
værdien af forbruget (karakteristikum b) fremgår af den lodrette akse.
Således repræsenterer prikken længst til højre det første element i po­
pulationen, som har indkomst lig med 36 (tusinde kr.) og forbrug på
9 (tusinde kr.), jf. tabel 2.2. A f figuren ser der ud til at være en positiv
sammenhæng mellem indkomst og forbrug i populationen.
Figur 2.7: Et
punktdiagram
2.4.2
Kovarians og korrelation
Sammenhænge mellem karakteristika i en population kan også opsum­
meres i simple nøgletal. Lad som ovenfor a j være det j’ te elements vær­
di a f et karakteristikum a, mens bj er det j ’te elements værdi af karakte­
ristikum b. Kovariansen, σ α,b, mellem de to karakteristika i en virkelig
population er defineret i følgende boks:
K ovariansen mellem to karakteristika, a og b, i en virkelig po­
pulation, er:
hvor a1 a2
, ...,aNpop og b1, b2,..., bN
pop er værdierne a f de to ka­
rakteristika for de Npop elementer i populationen, og μ a og μ a er
middelværdierne af de to karakteristika i populationen.
En positiv kovarians betyder, at der er en tendens til, at et element med
en høj værdi a f det ene karakteristikum også har en høj værdi af det
andet karakteristikum. Er kovariansen negativ, betyder det, at der er en
tendens til, at et element med en høj værdi a f det ene karakteristikum
har en lav værdi a f det andet karakteristikum. „Høje“ og „lave“ værdier
er her set i forhold til middelværdierne a f de pågældende karakteristika.
Dette kan også ses fra definitionen a f kovariansen i boksen ovenfor.
Hvis a1og begge er større (eller begge er mindre) end deres middel­
værdier, μ a og μ b, så vil udtrykket (a1 – μ a) · (b1 – μ b) blive et positivt
tal, og det første element i summen vil derfor bidrage positivt til kova­
riansen. Hvis derimod a1 > μ a og b1 < μ b, så vil (a1 – μ a) · (b1 – μ b)
blive et negativt tal, og det første element i summen vil derfor trække
kovariansen i en negativ retning.
Det er ofte mere informativt at se på korrelationskoefficienten, ρa,b
som altid er et tal mellem –1 og 1:
Korrelationskoefficienten mellem to karakteristika, a og b, i en
virkelig population, er:
hvor σa,b er kovariansen mellem de to karakteristika, og σa og
σb er standardafvigelserne a f de to karakteristika i populationen.
Korrelationskoefficienten har samme fortegn som kovariansen. Hvis
korrelationskoefficienten er positiv, siger man, at der er positiv korre­
lation mellem de to karakteristika. Er korrelationskoefficienten negativ,
siger man, at der er negativ korrelation mellem de to karakteristika.
Eksempel 2.13: Indkomst og forbrug – del 10
I populationen fra eksempel 2.1 er kovariansen mellem indkomst og
forbrug:
σindkomst,farbrug = ⅕ ’ ((36 – 29,8) · (9 – 6,8) + (28 – 29,8) · (5 – 6,8)
+(25 – 29,8) · (6 – 6,8) +6 (32 – 29,8) · (8 – 6,8)
+ (2 8 – 29,8) – ( 6 – 6,8)) = 4 ,96
Korrelationskoefficienten er:
Der er positiv korrelation mellem indkomst og forbrug. Dermed er der
tendens til, at individer med et relativt højt forbrug også har en relativt
høj indkomst. Dette passer fint med det indtryk, man få r af at se på
punktdiagrammet i figur 2.7.
■
Bemærk, at man ikke kan konkludere noget om en årsagssammenhæng
alene baseret på korrelationen. I eksempel 2.13 er der en positiv korre­
lation mellem indkomst og forbrug. Det kan fx skyldes, at man kan for­
bruge mere med en høj indkomst, og dermed at indkomsten er årsagen
til det højere forbrug. Det kan dog også skyldes, at en person ønsker at
have et højt forbrug, hvilket nødvendiggør en høj indkomst. Dermed
bliver forbruget årsagen til den højere indkomst. Endelig kan det være
helt andre faktorer som fx livsstilsvalg eller sociale tilhørsforhold, der
bestemmer både ens forbrug og ens indkomst. Vi vender tilbage til dette
senere i bogen.
2.5
Opgaver
1 . Repetitionsspørgsmål
a) Hvad er en virkelig population?
b) Gør kort rede for de fire typer a f måleskalaer.
c) Forklar hvad andelsfunktionen og den kumulative andelsfunkti­
on viser.
d) Forklar forskellen på et søjlediagram og et histogram.
e) Hvordan finder man medianen og en p -fraktil i en virkelig popu­
lation?
f) Forklar hvordan man udregner middelværdien, variansen og
standardafvigelsen i en virkelig population.
g) Hvad viser en krydstabel og et punktdiagram?
h) Forklar hvordan man udregner en kovarians og en korrelations­
koefficient, og hvordan man fortolker disse.
2. Efter en rustur på universitetet opgjorde man henholdsvis alderen
og antallet a f indtagede genstande for de deltagende studerende.
Populationens størrelse var på 22 personer, som havde følgende
karakteristika (alder, antal genstande):
(18, 5), (22, 0), (18, 21), (22, 7), (24, 2), (20, 10), (20, 7), (27, 0),
(19, 32), (20, 5), (20, 10), (22, 12), (24, 2), (24, 4), (22, 10), (20,
14), (24, 6), (27, 0), (22, 0), (20, 10), (20, 21) og (24, 2).
a) Opstil andelsfunktionen og den kumulative andelsfunktion for
„antal genstande“ i populationen.
b) Tegn et søjlediagram med de relative frekvenser a f „antal gen­
stande“.
c) Tegn et histogram for „antal genstande“ med intervalbredden 5.
d) Konstruér et lagkagediagram for „antal genstande“.
e) Find medianen a f „antal genstande“ samt 0,25- og 0,75-frakti­
lerne.
f) Tegn et box plot for „antal genstande“.
g) Beregn middelværdi, varians og standardafvigelse a f „antal gen­
stande“ i populationen.
3. Betragt populationen fra opgave 2.
a) Konstruér en krydstabel for de relative frekvenser af „alder“ og
„antal genstande“.
b) Tegn et punktdiagram for „alder" og „antal genstande“
c) Udregn kovariansen mellem „alder“ og „antal genstande“. Hvad
fortæller den dig?
d) Udregn også korrelationskoefficienten.
Usikkerhed og
sandsynligheder
3
De fleste samfundsvidenskabelige problemstillinger involverer usik­
kerhed. For at kunne analysere disse er det nødvendigt med en dybere
forståelse a f begrebet usikkerhed samt redskaber til at håndtere usikker­
heden. Redskaberne består især a f matematiske modeller, som kvantifi­
cerer usikkerheden. I dette kapitel diskuterer vi først, hvad man forstår
ved usikkerhed. Dernæst ser vi i afsnit 3.2 nærmere på, hvordan udtræk­
ningen af en stikprøve fra en population er forbundet med usikkerhed.
Sandsynlighedsmodellen, som vi introducerer i afsnit 3.3, formaliserer
denne usikkerhed, så vi kan tilskrive forskellige hændelser sandsyn­
ligheder. I afsnit 3.4 skal vi lære at regne med disse sandsynligheder,
mens vi i afsnit 3.5 går et skridt videre og kigger på begrebet betinget
sandsynlighed, som er sandsynligheden for en hændelse, givet at en an­
den hændelse allerede er indtruffet. Endelig ser vi i afsnit 3.6 på, hvad
vi forstår ved uafhængighed og afhængighed mellem to hændelser, og
hvordan afhængighed ofte forveksles med en kausal sammenhæng.
3.1
Usikkerhed
Vi opfatter en situation som usikker, når vi ikke ved, hvad der vil ske.
Ofte kender vi godt de mulige begivenheder, vi ved blot ikke, hvilken
a f dem der vil indtræffe.
Eksempel 3.1 : Vejret i morgen
Det er juni måned, og vi ved ikke, hvordan vejret vil blive i morgen.
Vi ved dog, at morgendagen vil byde på enten solskin, regn, sne eller
blandingsvejr. Andre muligheder er der ikke.
■
Eksempel 3.2: Obligationskurser
Kursen i morgen kl. 12.00 på en 30-årig byggeobligation er relevant
for mange virksomheder i den finansielle sektor, og ikke mindst for de
boligejere, som overvejer at omlægge deres realkreditlån. I princippet
kan kursen i morgen være en hvilken som helst værdi mellem 0 og uen­
delig, selvom vi nok på forhånd kan udelukke en del a f disse værdier
som værende helt usandsynlige, fx kursen 3,21 milliarder.
■
Eksempel 3.3: Efterspørgsel efter cykler
Cykelproducenterne er interesserede i at vide, hvor mange cykler dan­
skerne vil efterspørge (forbruge) i det kommende år. På forhånd ved de
kun med sikkerhed, at efterspørgslen bliver et heltal, som er større end
eller lig med nul.
■
Alle de tre ovenstående eksempler involverer usikkerhed. Usikkerhed
kan imidlertid opstå a f forskellige årsager. I eksempel 3.3 kan årsagen
til usikkerheden være, at folk faktisk ikke ved, hvor mange cykler de
vil købe det kommende år, fordi de ikke kender næste års indtægter og
udgifter. Årsagen kan imidlertid også være, at selvom den enkelte for­
bruger ved præcis, hvor mange cykler han eller hun vil efterspørge i det
kommende år, så er denne information ukendt for cykelproducenterne.
I begge tilfælde er der tale om usikkerhed set fra cykelproducenternes
synspunkt.
Uanset årsagen til usikkerheden er vi interesserede i at kunne kvan­
tificere den og lave beregninger på den. Cykelproducenterne fra eksem­
pel 3.3 ønsker måske at beregne sandsynligheden for, at efterspørgslen
bliver mindre end 300.000 cykler i det kommende år. Måske vil de også
gerne vide, hvordan denne sandsynlighed påvirkes a f benzinprisen. Til­
svarende kunne man som boligejer i eksempel 3.2 ønske at kende sand­
synligheden for, at kursen er mindre end 100, idet man kun kan optage
lån i den pågældende serie, så længe kursen er under denne værdi.
For at håndtere usikkerheden og lave sådanne beregninger kan vi
opbygge en matematisk sandsynlighedsmodel. Inden vi kan opstille
denne, skal vi kigge lidt nærmere på begreberne population, udvælgel­
sesmekanisme og stikprøve, som danner rammen for en basal forståelse
af begrebet usikkerhed.
3.2
Fra population til stikprøve
I dette afsnit ser vi på sammenhængen mellem en population og en stik­
prøve. Som nævnt i kapitel 2 er en population den statistiske betegnelse
for en samling af individer, genstande eller mere abstrakte objekter. Det
kunne fx være alle personer i Danmark, hvis vi ønsker at undersøge
danskernes indkomst eller alder. Hvis vi i stedet undersøger terning­
kast, så er det de seks sider på terningen, der udgør den relevante popu­
lation. En stikprøve er en samling a f værdier fra populationen. Det kan
fx være 1000 indkomster eller en række kast med en terning.
Stikprøven er resultatet a f en udvælgelsesmekanisme, som skaber
stikprøven fra populationen. Hvis fx en terning kastes tre gange, så
kunne udvælgelsesmekanismen beskrives som følger: „Læg terningen i
raflebægeret, ryst raflebægeret, kast terningen og aflæs resultatet. Gen­
tag dette, indtil tre terningkast foreligger.“ Resultatet a f de tre kast er
da vores stikprøve. En stikprøve er forbundet med usikkerhed. Usik­
kerheden opstår, fordi raflebægeret rystes, og man derfor ikke kender
udfaldet på forhånd.
Udvælgelsesmekanismen til at opnå en stikprøve på fx 1000 ind­
komster fra populationen a f personer i Danmark er anderledes. Denne
udvælgelsesmekanisme kunne være: „Skriv alle personnumre ned på
sedler og put dem i en (meget) høj hat. Ryst hatten grundigt og udtræk
med lukkede øjne en seddel. Undersøg indkomsten for personen med
det udtrukne personnummer og skriv resultatet. Gentag dette 1000 gan­
ge.“ På denne måde opnås en stikprøve på 1000 indkomster. Usikker­
heden opstår her, fordi den høje hat rystes, og udtrækningen sker med
lukkede øjne. I praksis ville den høje hat være erstattet af en computer,
som i princippet ville gøre det samme som at ryste hatten og udtrække
med lukkede øjne. Udvælgelsesmekanismen beskriver både, hvordan
usikkerheden opstår, og hvor mange elementer fra populationen der
skal undersøges.
Overordnet kalder man en population, en udvælgelsesmekanisme og
en stikprøve for et eksperiment. Selvom ordet eksperiment kan lede
tankerne hen på et laboratorieforsøg, dækker begrebet meget bredere
i statistikkens verden. Eksemplet med en stikprøve af danskernes ind­
komster er således et eksperiment i statistisk forstand. Figur 3.1 illustre­
rer de tre elementer i et eksperiment.
Figur 3.1: Et
eksperiment
Vi er interesserede i stikprøver a f to årsager. For det første er stikprøver
små billeder a f populationen. De kan derfor bruges til at lære noget om
denne. Stikprøven a f indkomster er et eksempel på dette. Vi kan her
bruge stikprøven til at få et skøn over danskernes (populationens) ind­
komster. For det andet kan stikprøver være interessante i sig selv. Det er
fx tilfældet, hvis man har indgået et væddemål om, hvilken side ternin­
gen lander på. Uanset hvilken interesse man har i stikprøven, opstår der
usikkerhed, fordi man ikke kender udfaldet a f stikprøven på forhånd.
Alle problemstillinger i denne bog kan opstilles som eksperimen­
tet illustreret i figur 3.1, hvis vi udvider vores fortolkning af, hvad en
population er. I det følgende vil vi derfor forklare, hvad vi forstår ved
populationer, og i den forbindelse skelne mellem to typer: Virkelige p o ­
pulationer og superpopulationer.
3.2.1
Virkelige populationer
Vi har allerede set på virkelige populationer i kapitel 2. En virkelig
population er en population, der eksisterer i virkeligheden. Den har et
endeligt antal elementer, og man kan således tælle antallet a f elementer
og definere en andelsfunktion, som vi gjorde i kapitel 2. Udvælgelses­
mekanismen fra en virkelig population har typisk også en fysisk beskri­
velse. Når vi udtrækker en person eller kaster en terning, foretager vi
en handling. Vi har altså en vis kontrol over udvælgelsesmekanismen.
Som vi skal se i afsnit 3.3, har udvælgelsesmekanismen direkte konse­
kvenser for, hvordan sandsynligheder beregnes. I kapitel 9 diskuterer
vi forskellige udvælgelsesmekanismer og fejlkilder, som kan opstå i
praksis, når man udtager en stikprøve fra en virkelig population.
3.2.2
Superpopulationer
Det viser sig, at det er praktisk også at arbejde med abstrakte, ikke-ek­
sisterende populationer, når man skal beskrive usikkerhed. De følgende
eksempler illustrerer dette:
Eksempel 3.4: En superpopulation af obligationskurser
Kursen i morgen klokken 12.00 på en 30-årig byggeobligation er usik­
ker. I morgen klokken 12.00 kender vi kursen, men hvor kommer den
fra? Kursen kan i princippet være enhver værdi mellem nul og uendelig,
men kun én a f disse værdier bliver realiseret. Man kan forestille sig alle
de mulige værdier a f kursen i morgen klokken 1 2 . 0 0 som en population
a f kurser. Det er dog en population, man ikke kan finde i virkeligheden.
Men ved alligevel at forestille sig denne ikke-eksisterende population
af mulige kurser kan man sige, at kursen i morgen klokken 1 2 . 0 0 er en
stikprøve fra denne population.
■
Eksempel 3.5: En superpopulation af regnskabsresultater
En virksomheds resultat i næste regnskabsår er usikkert. Men når man
få r opgjort regnskabet efter næste år, så står der ét og kun ét tal på bund­
linjen. For at kunne formalisere usikkerheden i dag omkring resultatet
næste år er det igen nyttigt at tænke på en population bestående a f alle
mulige resultater for næste år. Et a f disse mulige resultater vil ende med
at blive virksomhedens faktiske resultat. I dette eksperiment er stikprø­
ven altså lig med virksomhedens realiserede resultat.
■
Eksempel 3.6: En superpopulation af vejrlig
I eksempel 3.1 omkring morgendagens vejr kan vi forestille os dette
som trukket ud af en population bestående af: sol, regn, sne og blan­
dingsvejr.
■
Eksemplerne ovenfor illustrerer, hvordan vi kan overføre tankegangen
fra eksperimenter med virkelige populationer til eksperimenter med ik­
ke-eksisterende populationer. For at skelne mellem en virkelig og en
ikke-eksisterende population kalder vi sidstnævnte for en superpopu-
lation. I modsætning til en virkelig population kan en superpopulation
have uendeligt mange elementer.
I et eksperiment med en superpopulation er udvælgelsesmekanis­
men abstrakt. Vi kan ikke umiddelbart forestille os kursen på en ob­
ligation, en virksomheds resultat eller vejret i morgen som noget, der
trækkes op a f en høj hat, eftersom superpopulationen ikke eksisterer i
virkeligheden. Derfor giver det heller ikke mening at tale om andels­
funktioner i forbindelse med superpopulationer.
3.2.3
Udvælgelsesmekanisme og stikprøve
Når man skal analysere egenskaber for en population baseret på en stik­
prøve, det vi i kapitel 1 benævnte induktion, så er viden om udvælgel­
sesmekanismen essentiel.
Det følgende kan lyde paradoksalt, men er ikke desto mindre kor­
rekt: Jo mere „tilfældigt“ udvælgelsesmekanismen udvælger elementer
fra populationen, desto nemmere er det at foretage troværdig induktion.
Det følgende eksempel illustrerer dette:
Eksempel 3.7: En usædvanlig terning
Forestil dig, at en a f dine „venner“ har skrevet nogle nye tal på de seks
sider a f en terning. Du kender endnu ikke disse tal, men skal forsøge at
finde ud af, hvilke tal det drejer sig om, ved at observere ham slå med
terningen (din stikprøve). De seks tal på terningens sider er derfor de
ukendte værdier i populationen.
Betragt først den sædvanlige udvælgelsesmekanisme i forbindelse
med et terningspil, nemlig at han putter terningen i et raflebæger og
ryster det mange gange, inden han vender det, og den øverste side af
terningen afsløres. Hvis han fortsætter således tilpas længe, og du der­
med får en stor stikprøve, så er der meget stor chance for, at du vil
kunne slutte dig til, hvilke seks tal der står på terningens sider. Ud­
vælgelsesmekanismen er her karakteriseret ved at være tilfældig, fordi
raflebægeret rystes.
Betragt nu følgende udvælgelsesmekanisme: Din ven snyder og
lægger hver gang terningen således, at den samme side vender opad.
Baseret på en sådan stikprøve må man konkludere, at der står det sam­
me tal på alle seks sider a f terningen, eller at der er bly i den ene ende af
terningen. Udvælgelsesmekanismen er her fuldstændig deterministisk
og indeholder intet tilfældigt.
■
I ovenstående eksempel er den tilfældige udvælgelsesmekanisme altså
bedre end den deterministiske, fordi den tilfældige udvælgelsesmeka­
nisme altid vil afsløre mindst lige så meget om terningens sider som den
deterministiske, der kun fortæller os om én a f siderne.
Man kalder en udvælgelse, der er baseret på tilfældigheder, som er
klart beskrevne (som fx det at man ryster raflebægeret mange gange),
for statistisk udtagning. Det modsatte a f en statistisk udtagning kaldes
en ikke-statistisk udtagning eller systematisk udvælgelse. Disse begre­
ber er beskrevet i detaljer i afsnit 9.4.
Eksemplet ovenfor er en smule karikeret. Man kan således med rette
hævde, at en systematisk udvælgelsesmekanisme, der viser os de seks
sider på terningen efter tur, i dette tilfælde ville være at foretrække.
Imidlertid vil en statistisk udtagning, der viser os de seks sider i til­
fældig orden, være lige så god. Og i de situationer, hvor populationen
er meget større end den udtrukne stikprøve, vil en statistisk udtagning
være klart at foretrække, som vi skal se senere i denne bog. En vigtig
ingrediens i en god empirisk undersøgelse er derfor en udvælgelsesme­
kanisme, som indeholder en tilfældighedsmekanisme i forbindelse med
udvælgelsen a f elementer fra en population.
I næste afsnit introducerer vi sandsynlighedsmodellen, som man
bruger til at formalisere og regne på „tilfældighederne“.
3.3
Sandsynlighedsmodellen
Når vi lægger to tal sammen, er vi ikke nervøse for, om vi får et tal som
resultat. Men burde vi egentlig ikke være nervøse? Tal vokser ikke i
naturen, de er abstrakte konstruktioner. Børn opdager ikke tal, fordi de
kommer til at grave dem op a f sandkassen. Der er dog ingen tvivl om
nytten a f at have tal og a f at kunne lægge dem sammen og trække dem
fra hinanden. Grunden til, at vi ikke er nervøse for at lave sådanne be­
regninger med tal, er, at de har et matematisk fundament, som garante­
rer, at vi kan lægge to tal sammen, uden at vi behøver at ligge søvnløse
over, om resultatet a f denne øvelse nu også bliver et tal.
Når vi skal arbejde med usikkerhed, står vi over for en lignende si­
tuation. Vi skal have formaliseret usikkerheden således, at vi kan regne
på den, som fx sandsynligheden for, at det hverken vil regne eller sne
i morgen, eller at kursen på en obligation kommer til at ligge mellem
kurs 100 og kurs 105. Et matematisk fundament, som sikrer, at vi kan
gøre dette, er sandsynlighedsmodellen.
Sandsynlighedsmodellen indeholder den matematiske fortolkning af
eksperimentet i figur 3.1, og den giver os mulighed for at regne på den
involverede usikkerhed. I det følgende gennemgår vi de tre elementer,
som sandsynlighedsmodellen er opbygget af: Udfaldsrum, hændelses­
algebra og sandsynlighedsmål. Udfaldsrummet er den direkte matema­
tiske oversættelse a f eksperimentet. Hændelsesalgebraen består a f de
aspekter ved eksperimentet, som vi ønsker at udregne sandsynligheder
for. Sandsynlighederne er beskrevet a f den tredje del a f modellen, sand­
synlighedsmålet.
3.3.1
Udfaldsrum
Som beskrevet ovenfor giver et eksperiment anledning til en stikprøve.
Et udfald er en værdi a f en stikprøve. I eksperimentet „at kaste med en
terning“ er et muligt udfald en „treer“. Stikprøven kan altså antage vær­
dien „treer“. Til at holde styr på alle udfald definerer man et udfaldsrum:
Udfaldsrummet, Ω, for et eksperiment er samlingen a f alle mu­
lige udfald a f eksperimentet (værdier a f stikprøven).
Vi bruger det græske symbol Ω (Omega) til at betegne udfaldsrummet.
I eksperimentet „at kaste med en terning" er udfaldsrummet: Ω = {ener,
toer, treer, firer, femmer, sekser}. Tuborgklammerne bruges til at indi­
kere en samling a f elementer (udfald), også kaldet en mængde. Resul­
tatet a f et eksperiment er ét, og kun ét, a f disse elementer, fx en treer.
Eksempel 3.8: Plat og krone
Eksperimentet „at kaste en mønt og observere den øverste side“ kan
resultere i to mulige udfald: „plat“ og „krone“. Udfaldsrummet er der­
for Ω = {P, K } , hvor P er „plat“, og K er „krone“. Et mere kompliceret
eksperiment kunne være „at kaste en mønt to gange og observere de
øverste sider“. Et udfald i dette eksperiment består a f resultatet for beg­
ge kast. Hvis det første kast giver plat og det andet krone, så kan udfal­
det skrives (P , K). Bemærk, at selvom eksperimentet er sammensat a f to
kast, så regnes (P, K) som ét udfald, ikke som to. Parentesen omkring P
og K markerer, at der er tale om ét sammensat udfald. Udfaldsrummet
for dette eksperiment er: Ω = {(P , P ) , ( P , K ) , ( K , P ) , ( K , K )}. Enten
viser begge kast plat, (P, P), eller den første viser plat og den anden
krone, (P, K), osv.
■
Et udfaldsrum består a f udfald, der er kombinationer af elementerne i
en population. I eksempel 3.8, hvor man kaster en mønt to gange, er
populationen {P , K }, og et udfald er en kombination af disse to popula­
tionselementer, fx (P,P) eller (K , P ).
Selvom det er fornøjeligt at kaste med mønter og rafle med ternin­
ger, er den usikkerhed, vi i dagligdagen er udsat for, a f mere kompleks
karakter. Den kan imidlertid beskrives med de samme teknikker som
mønt- og temingeksperimenterne.
Eksempel 3.9: Salg af paraplyer – del 1
En paraplybutik er interesseret i, hvor mange paraplyer kunderne køber.
Den næste kunde, der kommer ind i butikken, kan ende med enten at
købe eller ikke købe en paraply. Måske køber han endda to paraplyer,
hvis han også vil have en i reserve. Udfaldsrummet for dette eksperi­
ment er derfor: Ω = {o paraplyer, 1 paraply, 2 paraplyer}. Med dette
valg a f udfaldsrum er det på forhånd udelukket, at nogen køber mere
end to paraplyer. Hvis det faktisk er et muligt udfald af eksperimentet,
skal udfaldsrummet udvides.
■
Eksempel 3.10: Sala af paraplyer – del 2
Det kan tænkes, at butikken fra eksempel 3.9 er interesseret i sammen­
hængen mellem regnvejr og kunders køb a f paraplyer. Dette kan også
formaliseres som et eksperiment: „at observere om det regner på det
tidspunkt, kunden går ind i butikken, samt det antal paraplyer, kunden
køber“. Udfaldsrummet for dette eksperiment er:
Ω = {(regn, 0 paraplyer), (regn, 1 paraply), (regn, 2 paraplyer),
(tørvejr, 0 paraplyer), (tørvejr, 1 paraply), (tørvejr, 2 paraplyer)}
Dette er et udfaldsrum, fordi alle mulige udfald af eksperimentet er
indeholdt i Ω , og kun ét af dem kan blive resultatet a f eksperimentet.
■
3.3.2
Hændelsesalgebra
Når man analyserer et eksperiment, er man ofte interesseret i en sam­
ling a f udfald snarere end de enkelte udfald. I eksempel 3.9 kunne man
fx være interesseret i, om en kunde køber eller ikke køber paraplyer.
Her er det altså udfaldet „0 paraplyer“ over for udfaldene „1 paraply“
og „2 paraplyer“, som er den interessante problemstilling. Man kalder
en samling a f udfald for en hændelse:
En hændelse er en samling a f udfald. En hændelse siges at ind­
træffe, hvis ét a f dens udfald indtræffer.
Formelt er en hændelse, A, en delmængde a f udfaldsrummet, Ω.
Vi skriver dette som: A c Ω.
I figur 3.2 er sammenhængen mellem udfaldsrum, udfald og hændel­
ser illustreret. Udfaldsrummet er „firkanten", som består a f de enkelte
udfald, boldene. En hændelse er da en mængde a f bolde, illustreret ved
„ovalerne“ i figuren.
Figur 3.2:
Udfaldsrum,
udfald og
hændelser
(A og B)
Eksempel 3.11: Et terningkast
I eksperimentet „at kaste med en terning“ kan vi definere en hændelse,
A, som: „terningen viser et ulige antal øjne“. Denne hændelse indtræf­
fer, hvis terningen lander på en ener, en treer eller en femmer. Det kan
man formelt skrive som: A = {ener, treer, femmer}.
■
I den første kolonne i tabel 3.1 er udfaldsrummet for paraplyeksperimen­
tet i eksempel 3.9 angivet. I den anden kolonne er vist en række hændel­
ser for dette eksperiment. Bemærk, at tuborgklammerne bruges, da der
er tale om mængder a f udfald. Den tredje hændelse i tabellen er således
„højst købe én paraply“. Denne hændelse består af udfaldene „0 paraply­
er“ og „1 paraply“. Samlingen a f hændelser kaldes en hændelsesalgebra.2
Mange hændelser kan man give en naturlig fortolkning, som fx
„køb“-hændelsen i tabel 3.1. Andre hændelser har knapt så naturlig en
fortolkning, som fx hændelsen, der består a f udfaldene „ 0 paraplyer“
og „2 paraplyer“. Denne hændelse kan fx kaldes „ikke købe én pa­
raply“-hændelsen. Bemærk, at de enkelte udfald også er hændelser i
hændelsesalgebraen. Fx består hændelsen „ingen køb“ a f udfaldet „0
paraplyer“.
Tabel 3.1:
Udfaldsrum og
U dfaldsrum, Ω
Hændelsesalgebra
0 paraplyer
{0 paraplyer}, dvs. „ingen køb”
1 paraply
{1 paraply, 2 paraplyer}, dvs. „køb”
2 paraplyer
{0 paraplyer, 1 paraply}, dvs. „højst købe én paraply”
hændelses­
algebra
{2 paraplyer}, dvs. „købe to paraplyer”
{1 paraply}, dvs. „købe én paraply”
{0 paraplyer, 2 paraplyer}, dvs. „ikke købe én paraply”
{0 paraplyer, 1 paraply, 2 paraplyer}, dvs. „den sikre
hændelse”
Ø , dvs. „den umulige hændelse”
Blandt hændelserne i tabel 3.1 findes to bemærkelsesværdige mængde
Den første er mængden af alle udfald, som i tilfældet med paraplyer er:
{0 paraplyer, 1 paraply, 2 paraplyer}. Ligegyldigt hvilket udfald der ind­
træffer, så indtræffer denne hændelse altid. Derfor kaldes den også for
den sikre hændelse. Vi anvender symbolet Ω om den sikre hændelse, fordi den indeholder alle udfald i udfaldsrummet. Det modsatte af den sikr
hændelse er den umulige hændelse. Den er karakteriseret ved, at ingen
udfald tilfredsstiller den. Den betegnes med det specielle symbol Ø .
For at kunne beskrive om to hændelser indtræffer samtidig, eller om
mindst én af to hændelser indtræffer, definerer man såkaldte fæ lleshæ n­
delser og foreningshændelser. De er defineret i nedenstående boks o
illustreret i eksempel 3.12.
2 Samlingen af hændelser skal formelt set opfylde nogle særlige betingelser, for at man kan bruge beteg­
nelsen hændelsesalgebra (også kaldet en sigma-algebra). Det er imidlertid for omfangsrigt at komme ind
på detaljerne i disse betingelser her.
Fælleshændelser og foreningshændelser:
Lad A og B være to hændelser.
A ∩ B kaldes fælleshændelsen og består a f de udfald, som ind­
går i både A og B.
A ∪ B kaldes foreningshændelsen og består a f de udfald, som
indgår i enten A eller B (eller begge).
Eksempel 3.12: Salg af paraplyer – del 3
Betragt hændelserne „køb“ og „højst købe én paraply“ i paraplyekspe­
rimentet fra tabel 3.1. Fælleshændelsen for disse to hændelser består
af udfaldet „ 1 paraply“, da det er det eneste udfald, som findes i begge
mængder i tabel 3.1 :
„køb“ ∩ „højst købe én paraply“={l paraply}
Foreningshændelsen for de to hændelser er derimod givet ved:
„køb“ ∩ „højst købe én paraply“
= { 0 paraplyer, 1 paraply, 2 paraplyer}
og findes ved at tage alle de udfald, der findes i de to hændelser. Be­
mærk, at udfaldet „ 1 paraply“ findes i begge hændelser. Det indgår dog
kun én gang i foreningshændelsen.
■
Forskellige hændelser kan altså indtræffe samtidig, hvis de har udfald
til fælles, hvorimod to hændelser er gensidigt udelukkende: De kan ikke
begge indtræffe samtidig, hvis de ingen udfald har til fælles. Figuren i
boksen kaldes i øvrigt et Venn-diagram.
Til enhver hændelse er der en modsat hændelse. Den modsatte hæn­
delse a f hændelsen A er defineret som mængden af alle de udfald, som
ikke er i A. Den modsatte hændelse kaldes også den komplementære
hændelse og betegnes her med toptegnet c (for „complementary“). Den
modsatte hændelse a f A betegnes derfor Ac. De to hændelser er ikke
blot gensidigt udelukkende, man ved også, at enten indtræffer den ene
hændelse, eller også indtræffer den anden. Formelt gælder derfor:
A ∩ A c = Ø og A ∪ A c = Ω
3.3.3
Sandsynlighedsmål
For at kunne måle usikkerhed kan man tilskrive sandsynligheder til de
forskellige hændelser. Sandsynligheden angiver chancen for, at hæn­
delsen vil indtræffe. I det følgende ser vi på nogle forskellige fortolk­
ninger a f begrebet sandsynlighed samt måder, hvorpå man kan tilskrive
sandsynligheder til hændelser.
En måde at fortolke sandsynlighed på er som den andel a f gange,
en hændelse vil indtræffe, hvis man gentager eksperimentet uendeligt
mange gange. Dette er naturligvis en abstraktion, da man jo ikke kan
gentage et eksperiment uendeligt mange gange, medmindre man er me­
get optimistisk med hensyn til sin levealder. Men abstraktionen virker
alligevel. Tag eksperimentet „at kaste en mønt“. Hvis vi kaster mønten
mange gange, vil vi forvente, at den cirka halvdelen af gangene viser
plat. Hvorfor? Prøv at vende argumentet om: Hvorfor ikke? Det er svært
at argumentere for, at den ikke skulle vise plat cirka halvdelen a f gange­
ne. I så fald må der være et eller andet, som får mønten til at vise fx plat
oftere end krone. Mønten kunne være bøjet, man kaster ikke mønten
højt nok og med tilstrækkeligt spind, eller indgraveringen a f Dronning
Margrethe giver mere luftmodstand end indgraveringen på den anden
side a f mønten. Men hvis vi kan tilbagevise disse forhold som værende
irrelevante for eksperimentets udfald, så står vi tilbage uden argumenter
for, at vi ikke skulle få plat cirka halvdelen af gangene.
Nøglen til denne konklusion er symmetri: Alt andet lige har alle
udfald samme chance for at indtræffe. Derfor tilskriver vi sandsyn­
ligheden „ 1 divideret med antallet a f mulige udfald“ til hvert udfald.
Denne simple nøgle kan løse mange komplekse problemer omkring
tilskrivning a f sandsynligheder til hændelser. Den er opsummeret i ne­
denstående boks. Bemærk, at bogstavet P (for „probability“) bruges til
at angive sandsynlighed.
Tilskrivning a f sandsynlighed ved hjælp a f symmetri:
Hvis et udfaldsrum består a f K udfald, Ω = {ω 1 , ..., ωk }, som
alle har lige stor chance for udvælgelse, så er sandsynligheden
for enhver hændelse med kun ét udfald lig med
Sandsynligheden for en hændelse, A, der består a f k udfald, er da:
Dette symmetriargument kan man udvide en smule, når eksperimentet
involverer en virkelig population. Forestil dig, at vi har en virkelig po­
pulation bestående a f N po elementer, hvoraf k elementer alle har værdi­
en z a f et karakteristikum. Dette kunne fx være populationen a f danske­
re, hvor der er ca. 2,5 millioner elementer, der har værdien, z = „mand“,
dvs. k = 2,5 millioner og N po = 5,0 millioner. De k elementer med vær­
dien z udgør andelen k/Npop a f populationen. Andelsfunktionen er derfor
lig med k/Npop i punktet z : g (z ) = k/N pop. Hvis alle elementer i populatio­
nen har samme chance for udvælgelse, og udfaldet a f eksperimentet er
givet ved værdien a f det udtrukne element, så er sandsynligheden for,
at eksperimentet resulterer i udfaldet z, lig med andelen k/Npop. Dvs. der
er sandsynlighed 2,5 mill./5,0 mill. = 0,5 for at udvælge en mand fra
populationen a f danskere. Dette princip er opsummeret i følgende boks.
Tilskrivning a f sandsynlighed ved hjælp a f andelsfunktionen:
Eksperiment: Udtrækning for et element fra en virkelig popu­
lation med Npop elementer. Udfaldet a f eksperimentet er lig med
værdien a f det udtrukne element.
Hvis alle elementer i populationen har lige stor chance for ud­
vælgelse, så er sandsynligheden for udfaldet z lig med værdien
a f andelsfunktionen evalueret i z:
Bemærk forskellen på de to ovenstående bokse. Den første boks er rele­
vant i en situation, hvor alle K udfald a f eksperimentet er lige sandsyn­
lige. Dette udnytter man til at tilskrive hvert udfald sandsynligheden
Dette er fx tilfældet med et terningkast, hvor hver a f de seks sider har
sandsynligheden ⅙. I den anden boks behøver de forskellige udfald af
eksperimentet ikke at være lige sandsynlige. Her går vi i stedet helt til­
bage til populationen og siger, at hvis alle elementer i populationen har
lige stor chance for udvælgelse, så kan vi bruge andelen af elementer
med værdien z som sandsynligheden for udfaldet z Hvis vi fx udtræk­
ker én person i en population bestående a f 1000 mænd og 500 kvinder,
for, at vi får en mand, hvis alle perso­
så er sandsynligheden
ner har samme chance for at blive udtrukket.
Chancen for, at det regner i morgen, er 50 %. Her kan vi ikke appel­
lere til symmetri eller gentage eksperimentet „vejret i morgen“ uende­
ligt mange gange, ja ikke engang to gange. Men erfaring kan hjælpe os
i dette tilfælde. Der har tidligere været dage med cirka samme tempe­
ratur, vindretning, luftfugtighed og skydække, hvor det dagen efter reg­
nede omkring halvdelen af gangene. Vi kan også bruge viden fra forsøg
i et laboratorium til at forudsige chancen for skydannelse og dermed
regn. Denne viden er ofte samlet i matematiske modeller, som man fx
kan bruge til at simulere vejrudviklingen på computere. I kapitlerne om
regressionsanalyse senere i bogen gennemgår vi matematiske modeller,
som kan være yderst nyttige til forudsigelser. Idéen er, at fortidige ob­
servationer bruges i videnskabelige modeller til at forudsige fremtidige
situationer og sandsynligheder.
Erfaring kan også bruges til forudsigelser, som ikke er baseret på
klare matematiske modeller, som eksempel 3.13 viser.
Eksempel 3.13: Salg af paraplyer – del 4
I paraplybutikken ved man a f erfaring, at andelen a f kunder, som ikke
køber, er ¼ mens halvdelen af kunderne køber én paraply, og en fjer­
dedel a f dem køber to paraplyer. Hvis vi observerer en tilfældig kunde,
der kommer ind i butikken, så kan vi bruge den erfarede andel som mål
for sandsynligheden for, at kunden ikke vil købe en paraply. Sandsyn­
ligheden for, at kunden ikke køber noget, er således
Tilsvarende er
¼
sandsynligheden for, at kunden køber 1 paraply, lig med ½ og sandsyn­
ligheden for, at han køber 2 paraplyer, er lig med
■
¼
Hvad er chancen for, at hesten Ibrahim vinder på søndag? For nogle vil
jockeyens stjernetegn og sangstemme indgå i chancevurderingen. Ma­
tematisk er der ikke noget problem i, at man tilskriver sandsynligheder
efter forgodtbefindende. Ofte kan man kun støtte sig til sin intuition,
uden at man skal være blind for, at intuitionen delvist er et resultat a f
ens erfaringer. I alle disse tilfælde siger man, at sandsynlighederne er
fremkommet subjektivt.
Formelt er sandsynlighedsmålet en funktion a f en hændelse. Dette
gælder, uanset om man tilskriver sandsynlighed vha. symmetriargu­
menter, ud fra erfaring eller subjektivt.
Tilskrivningen a f sandsynligheder til alle hændelserne i hændelses­
algebraen skal opfylde nogle få krav, for at dette matematiske system
kan virke. Disse krav er som følger:
Et sandsynlighedsmål, P( ), skal opfylde følgende krav
(i) 0 ≤ P ( A ) ≤ 1 hvor A er en hændelse.
(ii) P
(iii)
(Ω ) = 1 hvor Ω er den sikre hændelse.
P ( A u B ) = P ( Å ) + P ( B ) , hvis hændelserneAogB
ikke har udfald til fælles, dvs. A ∩ B = Ø .
Disse tre krav medvirker til, at systemet a f sandsynligheder er konsi­
stent, dvs. ikke indeholder selvmodsigelser.3 For det første må udfald
ikke have negative sandsynligheder eller sandsynligheder større end 1.
For det andet er sandsynligheden for den sikre hændelse lig med 1,
fordi denne hændelse altid indtræffer, idet den består a f alle udfald i
udfaldsrummet, Ω. Endelig er det således, at hvis to hændelser ikke
har nogen udfald til fælles, så er sandsynligheden for foreningshæn­
delsen lig med summen a f sandsynlighederne for de to hændelser. At A
og B ikke har udfald til fælles betyder, at fællesmængden, A ∩ B , er
tom. Som illustreret i det følgende eksempel tilfredsstiller de tilskrevne
sandsynligheder i tabel 3.2 de ovenstående tre betingelser.
3 Formelt set kræves det også, at P(A1 ∪ A2 ∪ A3 ∪ ...) = P(A1) + P(A2) + P(A3) + ... , hvis in­
gen a f hændelserne, A1,A2,A3 .. . , har nogen udfald til fælles. Dette vil dog typisk være opfyldt, hvis (i)
– (iii) fra boksen er opfyldt.
Eksempel 3.14: Salg af paraplyer – del 5
I eksempel 3.13 var sandsynlighederne for køb af 0, 1 og 2 paraply­
er henholdsvis
¼
,½og¼ Disse sandsynligheder kan vi nu bruge til
at udregne sandsynlighederne for de resterende hændelser. Fx består
hændelsen „køb“ af de to udfald: „ 1 paraply“ og „2 paraplyer“, som har
sandsynlighederne ½ og
Sandsynligheden for hændelsen „køb“ kan
¼
da udregnes som summen a f disse sandsynligheder: ½ + ¼ = ¾. Tabel
3.2 viser de tilskrevne sandsynligheder for de øvrige hændelser i para­
plyeksperimentet.
■
Tabel 3.2:
Hændelsesalgebra
Udfaldsrum, Ω
Sandsyn­
lighedsmål
Udfaldsrum,
hændelses­
0 paraplyer
{0 paraplyer}, dvs. „ingen køb”
1 paraply
{1 paraply, 2 paraplyer}, dvs. „køb”
1
algebra og
sandsynlig­
3
4
hedsmål
2 paraplyer
{0 paraplyer, 1 paraply}, dvs. „højst købe én
3
paraply”
4
1
{2 paraplyer}, dvs. „købe to paraplyer”
4
1
{1 paraply}, dvs. „købe én paraply”
2
{0 paraplyer, 2 paraplyer}, dvs. „ikke købe én
1
paraply”
2
{0 paraplyer, 1 paraply, 2 paraplyer}, dvs. „den
sikre hændelse”
1
Ø , dvs. „den umulige hændelse”
3.4
0
Regneregler for sandsynligheder
4
En implikation a f de tre egenskaber ved sandsynligheder i ovenståen­
de boks er additionssætningen, som angiver sammenhængen mellem
sandsynlighederne for foreningshændelsen og fælleshændelsen:
Additionssætningen for sandsynligheder:
For hændelser A og B gælder:
P ( A ∪ B ) = P ( A ) + P ( B ) – P ( A ∪ B)
Additionssætningen fortæller os, at sandsynligheden for en forenings­
hændelse er lig med summen a f sandsynlighederne for de to involvere­
de hændelser fratrukket sandsynligheden for deres fælleshændelse. År­
sagen til, at denne skal fratrækkes, er, at sandsynlighederne for udfald,
der indgår i både A og 5 er medtaget i både P(A) og P(B). For ikke at
tælle sandsynlighederne for disse udfald med to gange trækker vi dem
fra via P ( A ∪ B ).
Eksempel 3.15: Salg af paraplyer – del 6
Hændelserne „køb“ og „højst købe én paraply“ i paraplyeksperimentet
fra tabel 3.2 har begge sandsynligheden
For at finde sandsynlighe­
⅓
den for deres foreningshændelse, „køb“ ∪ „højst købe én paraply“,
skal vi lægge deres individuelle sandsynligheder sammen og trække
sandsynligheden for fælleshændelsen fra. Fælleshændelsen består af
udfaldet „ 1 paraply“, som har sandsynligheden ½ Sandsynligheden
for foreningshændelsen „køb“ ∪ „højst købe én paraply“ er derfor:
⅓ + ¾ – ½ = 1. Dette passer også fint, idet vi fra eksempel 3.12 ved, at:
„køb“ ∪ „højst købe én paraply“
= {0 paraplyer, 1 paraply, 2 paraplyer}
som er hele udfaldsrummet, Ω, og P(Ω ) er jo netop 1.
■
For en hændelse, A, og dens modsatte hændelse, A c, gælder, at sand­
synligheden for, at én af dem indtræffer, er lig med 1. Dette skyldes,
at foreningshændelsen mellem de to hændelser er den sikre hændelse.
Formelt er:
P ( A ∪ Ac) = P (∪ ) = 1
Desuden er A og Ac gensidigt udelukkende, så:
P ( A ∪ Ac) = P( Ø ) = 0
Som en konsekvens a f dette får man ved hjælp a f additionssætningen
for sandsynligheder:
p ( a ) = 1– p ( a c )
Man kan desuden finde sandsynligheden for en hændelse, A, hvis man
kender sandsynligheden for fælleshændelsen a f Α og B (hvor B er en
hvilken som helst hændelse) samt sandsynligheden for fælleshændelsen
a f Α og Bc. Da har man nemlig:
P ( A ) = P ( A ∪ B ) + p ( A ∪ B c)
Eksempel 3.16: Salg af paraplyer – del 7
Lad A være hændelsen, at en kunde køber én paraply, og lad B være
hændelsen, at det regner i eksperimentet fra eksempel 3.10. Antag, at
sandsynligheden for, at en kunde køber én paraply, er P ( A ) = 0,15,
og at sandsynligheden for, at det regner, er P ( B ) = 0 ,25 . Så kan vi
finde sandsynlighederne for de modsatte hændelser, A c og Bc. Hvis vi
også ved, at sandsynligheden for, at en kunde køber én paraply, og det
samtidig regner, er P ( A ∪ B) = 0,1, da kan vi også finde sandsynlig­
hederne for de øvrige fælleshændelser, der involverer A og B samt A c og
Bc. Dette er gjort i nedenstående tabel:
For eksempel er sandsynligheden for, at kunden køber én paraply og
det ikke regner, givet ved:
P ( A ∪ B c) = P ( A ) – P ( A ∪ B) = 0,15 – 0,1 = 0,05
Hændelser
B:
Bc:
(regn)
(ikke regn)
A:
(1 paraply)
P ( A ∪ B) = 0,1
P ( A ∪ B c) = 0,05
Ac:
(ikke 1 paraply)
P ( A c ∪ B ) = 0,15 P ( A c ∪ Bc) = 0,7 P ( a c) = 0,85
Hændelser,
modsatte
hændelser,
fælleshændel­
ser og sand­
synligheder
P ( B ) = 0,25
P ( B c) = 0,75
P
(A
)
=
0,15
Tabel 3.3:
Ρ (Ω ) = 1
3.5
Betinget sandsynlighed
I mange situationer kan vi anvende information om en hændelse, der
er indtruffet, til bedre at kunne forudsige, hvorvidt en anden hændelse
indtræffer. Hvis vi fx bruger information om, hvor meget det har regnet
i løbet af året, kan vi bedre forudsige høstudbyttet, end hvis vi ikke bru­
ger denne information. Et andet eksempel er risikoen for at få en arvelig
sygdom. Hvis vi kender sygdomshistorien for en given persons foræl­
dre, kan denne bruges til bedre at forudsige personens egen risiko for
at få en arvelig sygdom. Teorien om betingede sandsynligheder handler
om, hvordan man kan bruge information om én hændelse til at vurdere
sandsynligheden for en anden hændelse.
I nogle tilfælde vil information om, hvorvidt én hændelse indtræffer,
helt fjerne usikkerheden omkring, hvorvidt en anden hændelse indtræf­
fer. Dette er tilfældet, når to hændelser, A og B, ikke har nogen fælles
udfald (A og B er gensidigt udelukkende). Hvis vi ved, at hændelse B er
indtruffet, dvs. ét af udfaldene i B er indtruffet, så er sandsynligheden
for, at hændelse A indtræffer, lig med nul.
Vi kalder sandsynligheden for, at hændelsen A indtræffer, givet at
vi ved, at hændelsen B indtræffer (eller er indtruffet), for den betingede
sandsynlighed f o r hændelse A givet hændelse B. Denne sandsynlighed
symboliseres med P ( A │B), hvor den lodrette streg betyder „givet“ eller
„betinget af“.
Den betingede sandsynlighed, P (A│B ), udregnes på følgende måde.
Når hændelsen B indtræffer, så betyder det, at vi kan koncentrere os om
de udfald, som indgår i hændelsen. A f disse udfald er nogle i A, mens
andre ikke er i A. Til at udregne den betingede sandsynlighed skal vi
derfor bruge sandsynligheden for de udfald, som indgår i både A og
B . Denne sandsynlighed er P (A ∪ B). Da vi ved, at hændelsen B ind­
træffer (eller allerede er indtruffet), så skal sandsynligheden P ( A ∪ B)
ses i forhold til sandsynligheden for hændelsen B, dvs. P ( B ). Dette er
intuitionen bag definitionen a f den betingede sandsynlighed, som præ­
senteres i den følgende boks:
Den betingede sandsynlighed for hændelsen A givet hændelsen
B er defineret som:
forudsat at sandsynligheden for hændelsen B er strengt større
end 0, dvs. P (B) > 0.
Når man ved, at hændelsen B er indtruffet, kan man tænke på udfaldene
i B som et udfaldsrum. Inden for dette udfaldsrum skal man finde sand­
synligheden for de udfald, som også tilhører A.
Eksempel 3.17: Salg af paraplyer – del 8
I eksempel 3.16 var sandsynligheden for hændelsen Α (at en kunde
køber én paraply) givet ved P ( A ) = 0,15, mens sandsynligheden for
hændelsen B (at det regner), var P ( B ) = 0,25. Endelig var sandsynlig­
heden for fælleshændelsen (at en kunde køber én paraply og det regner)
givet ved P ( A ∪ B ) = 0,1. Sandsynligheden for, at en kunde køber én
paraply, givet at det regner, er da:
Her ses værdien a f informationen om hændelsen B. Hvis vi ikke ved,
om det regner, så er vores bedste bud på sandsynligheden for, at en kun­
de køber én paraply, lig med 0,15. Hvis det derimod regner (hændelsen
B er indtruffet), så er sandsynligheden for køb faktisk betydeligt højere,
nemlig 0,4.
■
Man kan udvide begrebet betinget sandsynlighed til en situation, hvor
man har viden om flere hændelser. Her definerer man blot den betinge­
de sandsynlighed som sandsynligheden for en hændelse, givet at flere
andre hændelser indtræffer (eller er indtruffet). P (A│B , C ) er således
sandsynligheden for hændelsen A, givet at både hændelsen B og hæn­
delsen C indtræffer. Denne sandsynlighed er formelt set givet ved:
P ( A │B , C) = p ( a │(B ∪ C ))
dvs. som sandsynligheden for hændelsen A givet fælleshændelsen mel­
lem B og C. Hvis vi tænker på denne fælleshændelse som en ny hæn­
delse, D, hvor D = B ∪ C , så er P (A│B , C ) = P (A│D ), hvilket er en
sandsynlighed betinget af kun én hændelse ligesom i den oprindelige
definition a f betinget sandsynlighed. Derfor kan P (A│B , C ) udregnes
som:
3.6
Uafhængighed og spuriøse sammenhænge
En a f de største empiriske udfordringer inden for samfundsvidenskab
er at undersøge sammenhænge mellem forskellige størrelser og afgøre,
om sammenhængene er kausale. En kausal sammenhæng mellem to
størrelser betyder, at den ene størrelse forårsager den anden størrelse.
En forståelse af, om en sammenhæng er kausal eller ej, er essentiel, hvis
man fx vil bruge resultaterne a f en undersøgelse til at formulere en ny
politik på området. Hvis man fx vil undgå, at unge mennesker bliver
kriminelle, så er det vigtigt at forstå, hvad der forårsager kriminalitet.
Det er værd at gøre opmærksom på, at kausalitet er et begreb, som
ikke er præcist og entydigt defineret. Begrebet har været genstand for
diskussion blandt filosoffer i hvert fald de seneste 2500 år. Vi vil derfor
afholde os fra at give en præcis definition af kausalitet i denne bog. Løst
sagt har vi i tankerne, at en hændelse A forårsager en hændelse B, hvis
A indtræffer først og påvirker sandsynligheden for, at B indtræffer. Et
væsentligt element i kausalitet er typisk, at den forårsagende hændelse
tidsmæssigt skal forekomme før den hændelse, som forårsages.
Vi vil nu vise, hvordan vi kan bruge redskaberne fra de første afsnit
i dette kapitel til at opbygge en ramme, inden for hvilken vi kan under­
søge sammenhænge mellem forskellige størrelser under usikkerhed. I
dette afsnit definerer vi således, hvad vi statistisk set forstår ved hen­
holdsvis uafhængige og afhængige hændelser. Vi viser desuden, hvorfor
afhængighed mellem to hændelser ikke nødvendigvis er det samme som
en kausal sammenhæng mellem de to hændelser. Dermed kommer vi
tættere på at kunne afgøre, om en given sammenhæng er kausal eller ej.
3.6.1
Uafhængighed
Det centrale statistiske begreb, når man skal se på sammenhænge mel­
lem to eller flere hændelser, er uafhængighed. Hvis information om, at
en hændelse, B, er indtruffet, ikke ændrer sandsynligheden for, at en
anden hændelse, A, indtræffer, så siger vi, at de to hændelser er uafhæn­
gige. Formelt svarer dette til, at: P ( a │B ) = P ( A ) . Sandsynligheden
for hændelse A er således den samme, uanset om vi medtager informa­
tion om, hvorvidt B er indtruffet, Ρ ( Α │Β ) , eller vi ikke medtager denne
information, P( A ).
Den formelle (og en anelse mere generelle) definition a f uafhængig­
hed er, at sandsynligheden for fælleshændelsen mellem to hændelser, A
og B, er givet ved produktet a f sandsynlighederne for de to individuelle
hændelser:
P ( A ∪ B ) = P ( A │b ) · P ( B ) = P ( A ) · P ( B )
Vi kan se, hvordan denne definition medfører P ( a │B ) = P (A ) ved at
dividere med P(B) på begge sider a f lighedstegnet (under antagelse
om, at P(B ) > 0) og derefter udnytte definitionen a f betinget sandsyn­
lighed fra boksen i sektion 3.5. Bemærk, at hvis P (B) = 0, så er de to
hændelser altid uafhængige – hvilket følger a f den generelle definition
af uafhængighed ovenfor. I dette tilfælde er den betingede sandsynlig­
hed, P (A │B ), imidlertid ikke defineret. Vi opsummerer definitionen af
uafhængighed i følgende boks:
Uafhæ ngighed: To hændelser, A og B, er uafhængige, hvis og
kun hvis:
P(A ∪ B) P(A) · P (B)
hvilket medfører:
P ( A│B) = P ( A ) hvis P ( B ) > 0
og
P ( B│A) = P (B) hvis P ( A) > 0
Hvis betingelserne ovenfor ikke er opfyldt, så siges hændelserne at være
afhængige. Fordi to hændelser er statistisk afhængige, så betyder det
imidlertid ikke, at de to hændelser direkte har noget med hinanden at
gøre. I flere lande har det fx vist sig, at der er en statistisk afhængighed
mellem antallet af observerede storke og antallet af børnefødsler. Det
betyder dog ikke, at det er storken, der kommer med børnene. Hvis to
hændelser omvendt er uafhængige, kan man dog som regel med sindsro
konkludere, at de to hændelser ikke har noget med hinanden at gøre.
Når to hændelser ikke har noget med hinanden at gøre, men alligevel
statistisk set er afhængige, så skyldes det andre hændelser, som ikke er
medtaget i analysen. Fx skyldes sammenhængen mellem storke og bør­
nefødsler den generelle samfundsudvikling med overgangen fra land­
brugssamfund til industri- og servicesamfund, som både har ødelagt
en del a f storkenes oprindelige omgivelser og samtidig har mindsket
antallet af børnefødsler. Med andre ord: Hvis man tager højde for sam­
fundsudviklingen, forsvinder sammenhængen mellem antallet a f storke
og antallet a f børnefødsler.
Til at betegne, at en tredje hændelse, C, kan forklare en tilsynela­
dende sammenhæng mellem to hændelser, A og B, bruger man begrebet
betinget uafhængighed.
Betinget uafhæ ngighed: Hændelserne A og B er uafhængige be­
tinget a f hændelsen C (hvor P(C) > 0), hvis og kun hvis:
P ( A ∪ B │C ) = P (A│C) · P ( B │ A ) hvilket medfører:
P ( A │B, C) = P ( A │C) hvis P( B) > 0
og
P ( B │A,C) = P ( B │C) hvis P ( A ) > 0
Betinget uafhængighed mellem A og B betyder, at sandsynligheden for
hændelsen A ikke påvirkes af, om hændelsen B indtræffer, hvis man
allerede ved, om hændelsen C er indtruffet eller ej.
3.6.2
Direkte, indirekte og spuriøse sammenhænge
Der findes utallige empiriske undersøgelser, der konkluderer, at der stati­
stisk set er en sammenhæng mellem to størrelser. Vi skal senere i denne
bog se, hvordan man kan lave sådanne undersøgelser. Når man hører,
at der er en sammenhæng mellem to størrelser, bør man imidlertid altid
overveje, om undersøgelsen har korrigeret for andre størrelser, som kan
tænkes at udgøre den bagvedliggende årsag til den fundne sammenhæng.
Der er grundlæggende tre situationer, hvor hændelserne A og B sta­
tistisk set udviser afhængighed. De tre situationer er:
1 . A og B af hænger direkte af hinanden: A → B eller B → A .
2. A og B afhænger indirekte a f hinanden gennem en hændelse C :
A → C → B eller B → C → A .
3. A og B afhænger ikke af hinanden, men begge afhænger a f en tredje
hændelse C: A ← C → B .
I alle tre situationer er P (A│B) ≠
P
(A
)Når man siger, at A og B af­
hænger a f hinanden, så er det typisk underforstået, at det er situation 1,
man mener, gør sig gældende. Det er også typisk underforstået, at en af
hændelserne forårsager den anden hændelse. Men baseret på statistisk
afhængighed mellem A og B kan det lige så godt være situation 3, som
er gældende. I så fald er der reelt ingen afhængighed mellem A og B i
den forstand, at en af dem forårsager den anden. Man kalder en sådan
tilsyneladende sammenhæng for en spuriøs sammenhæng.
Man kan afsløre, om man befinder sig i situation 1 eller i en a f de to
andre situationer, ved at undersøge, om der findes en hændelse, C, hvor­
om det gælder, at A og B er uafhængige betinget af, at C er indtruffet:
p ( A│B, C ) = p (A│C). I så fald er det en af de to sidste situationer, der
gør sig gældende. For at kunne afgøre, om dette er tilfældet, skal man
imidlertid have et godt bud på, hvad C kan være.
I praksis fremgår det typisk a f en undersøgelses formål, hvad hæn­
delserne A og B repræsenterer. Hændelsen C er derimod mindre oplagt.
Det er her, man skal bruge sit kendskab til en undersøgelses problem­
stilling samt sin sunde fornuft til at vurdere, hvad hændelsen C kan
være. Det følgende eksempel illustrerer dette.
Eksempel 3.18: Kvalitet af skoler
Forestil dig et eksperiment, hvor man udvælger en skole tilfældigt og
observerer, om den er privatejet (Β ) eller ej (Bc), og om karaktergennem­
snittet på skolen er højt (A ) eller ej (Ac). Det viser sig, at P (A│B) = 0,7,
mens P(A│Bc) = 0,4. Dermed kan man konkludere, at hændelserne A
og Β ikke er uafhængige statistisk set. Man kan dernæst spørge sig selv,
hvad årsagen til denne sammenhæng er. Skyldes den forskellig kvalitet
af undervisningen på de to typer a f skoler?
Forskning tyder på, at en elevs præstation i skolen afhænger af, hvor
meget fx forældrene har haft tid til at stimulere eleven sprogligt de første
seks leveår. Lad hændelsen C betegne, om skolens elever har modtaget
tilstrækkelig sproglig stimulering de første seks leveår. Sandsynlighe­
den for, at karaktergennemsnittet i en skole bliver højt, givet at eleverne
har modtaget sproglig stimulering, antages at være: P(A│C ) = 0,8.
Man kan dernæst finde sandsynligheden for, at karaktergennemsnit­
tet er højt betinget både a f typen a f skole og mængden a f stimulering.
Hvis man her finder, at P (A│B , C ) = 0,8, så er P ( A│B, C ) = P ( A│C),
og A og B er da uafhængige betinget på C. Det betyder, at der ikke er
en direkte sammenhæng mellem A og B. I stedet kan sammenhængen
mellem typen a f skole og karaktergennemsnittet være spuriøs. Det kan
fx skyldes, at velstimulerede børn i højere grad sendes på privatskole,
hvilket igen kan hænge sammen med, at velstimulerede børn kommer
fra familier med relativt høje indkomster.
■
Som eksemplet viser, kan man nogle gange vise, at en tilsyneladende
afhængighed mellem to hændelser, A og B, ikke holder, hvis man tager
højde for en tredje hændelse, C. Ofte kan det dog være svært at vide,
hvad denne tredje hændelse skal være, og man kan da forsøge sig med
forskellige bud på C. Og selvom man ikke finder en tredje hændelse,
der kan forklare sammenhængen mellem A og B , så er det jo ikke det
samme som, at en sådan hændelse ikke findes.
Hvis man finder, at C kan forklare sammenhængen mellem A og B,
kan man derfor heller ikke umiddelbart konkludere, at der er en direkte
afhængighed mellem C og A og mellem C og B. Det kan være, at en helt
fjerde hændelse, D, kan forklare begge sammenhænge. Som nævnt i ek­
semplet kan det være familiens socioøkonomiske status, der bestemmer
den sproglige stimulering, valget a f skole samt karaktergennemsnittet.
Dette illustrerer også, hvor vanskeligt det kan være at afdække direkte
afhængighed og i sidste ende kausale sammenhænge inden for sam­
fundsvidenskaberne.
3.7
Opgaver
1. Repetitionsspørgsmål:
a) Hvad består et eksperiment af?
b) Giv eksempler på virkelige populationer og superpopulationer.
c) Forklar kort de tre elementer i sandsynlighedsmodellen: Ud­
faldsrum, hændelsesalgebra og sandsynlighedsmål.
d) Gør rede for sammenhængen mellem udfaldsrum og stikprøve.
e) Forklar kort om de forskellige måder at tilskrive sandsynligheder
på.
f) Hvilke tre egenskaber skal sandsynligheder opfylde?
g) Gør rede for additionssætningen for sandsynligheder.
h) Forklar hvad man forstår ved betinget sandsynlighed.
i) Hvad betyder det, at to hændelser er henholdsvis uafhængige og
betinget uafhængige?
2. En håndboldanalytiker vurderer, at hjemmeholdet til en forestående
kamp har 40 % chance for at vinde og 70 % chance for ikke at tabe.
a) Hvad er populationen, stikprøven og udfaldsrummet i dette eks­
periment?
b) Forklar ud fra egenskaberne ved sandsynligheder, hvad sandsyn­
ligheden er for et uafgjort resultat.
c) Hvad er sandsynligheden for, at et a f holdene vinder?
3. I en aftenskoleklasse for orgelspil er tre kursister under 40 år, fire
er mellem 40 og 65 år, og to er over 65 år. Der skal trækkes lod om
en fribillet til en Ole Erling-koncert. Alle navnene på de ni personer
lægges i en spand, som rystes, og ét navn udvælges tilfældigt.
a) Hvad er populationen og den tilhørende andelsfunktion?
b) Hvad er sandsynligheden for hændelsen, at en kursist mellem 40
og 65 år udvælges?
c) Hvad er sandsynligheden for hændelsen, at en kursist over 40 år
udvælges?
4. Foulum Fodbold Uniteds (FFU) første og eneste hold deltager i Vi­
borg-mesterskaberne. Der spilles tre kampe i den indledende runde.
Sandsynligheden for, at Foulum taber en kamp, er 0,9, og resultater­
ne af de tre kampe er uafhængige.
a) Hvad er sandsynligheden for, at FFU ikke taber deres anden
kamp?
b) Hvad er sandsynligheden for, at FFU taber alle tre kampe?
c) Hvad er sandsynligheden for, at FFU taber to kampe?
d) Hvad er sandsynligheden for, at FFU ikke har tabt anden kamp,
givet at man kun ved, at FFU har tabt to kampe i den indledende
runde? Sammenlign svaret med dit svar til spørgsmål a).
4
Stokastiske variabler
I kapitel 3 viste vi, hvordan man kan tilskrive sandsynligheder til for­
skellige hændelser, der knytter sig til et eksperiment. I praksis vil et
eksperiment ofte involvere mange forskellige hændelser, som vi øn­
sker at tilskrive sandsynligheder. Selv i det relativt simple eksperiment
fra tabel 3.1 var der således otte forskellige hændelser, som alle fik
forskellige betegnelser. Det gør derfor hurtigt notationen besværlig og
omfangsrig, hvis man skal finde på navne og symboler til alle de for­
skellige hændelser, der knytter sig til et eksperiment.
Det er heldigvis muligt at definere en funktion, der kaldes en stoka­
stisk variabel, som gør det meget nemmere at arbejde med hændelser og
deres sandsynligheder. Hvor vi i kapitel 3 skulle bruge et symbol til hver
hændelse, kan en stokastisk variabel med et enkelt symbol repræsentere
mange forskellige hændelser. Stokastiske variabler bygger på sandsyn­
lighedsmodellen fra kapitel 3, og de er særdeles anvendelige, når vi i
praksis skal undersøge sammenhænge, der involverer usikkerhed.
I afsnit 4.1 definerer vi en stokastisk variabel. Man skelner i den­
ne forbindelse mellem diskrete og kontinuerte stokastiske variabler. Vi
starter med at behandle de diskrete stokastiske variabler i afsnit 4.2, og
i afsnit 4.3 kigger vi på sammenhænge mellem diskrete stokastiske va­
riabler. Tilsvarende ser vi i afsnit 4.4 og 4.5 på kontinuerte stokastiske
variabler og sammenhænge mellem disse.
4.1
Definition af en stokastisk variabel
En stokastisk variabel er en funktion, som til ethvert udfald a f et ekspe­
riment forbinder en talværdi:
X ( udfald) = tal
Eksempel 4.1: Et terningkast
I eksperimentet „at kaste en terning“ er udfaldsrummet:
Ω = {ener, toer, treer, firer, femmer, sekser}. Her kan man definere en
stokastisk variabel, X, som tæller antallet a f øjne:
X (ener) = l , X (toer) = 2, X (treer) = 3,
X (firer) = 4, X (femmer) = 5, X (sekser) = 6
Hvis udfaldet af eksperimentet bliver en ener, så antager den stokasti­
ske variabel, X, værdien 1. På samme måde antager den værdien 6, hvis
man slår en sekser.
–––––––––––––––––––––––––––––––––––––––––––––––––––––––––– ■
Eksempel 4.2: Salg af paraplyer – del 1
I eksemplet fra kapitel 3 med paraplybutikken kan man definere en sto­
kastisk variabel, X, der antager en værdi svarende til antallet a f paraply­
er, som en kunde køber. Dvs:
X (0 paraplyer) = 0, X (1 paraply) = 1, X ( 2 paraplyer) = 2
■
Bemærk, at vi bruger store bogstaver som X og Y til at betegne en sto­
kastisk variabel. Små bogstaver, x og y, bruger vi derimod til at angive
specifikke værdier, som den stokastiske variabel antager. Kaster man fx en
terning, som i eksempel 4.1, så vil det resultere i, at den stokastiske varia­
bel, X, antager en bestemt værdi, x, som kan være enten 1,2 ,3 ,4 ,5 eller 6.
Ofte giver definitionen a f en stokastisk variabel sig selv, som tilfæl­
det er i de ovenstående eksempler. Hvis udfaldene a f eksperimentet er
målt kvalitativt, kan det imidlertid være knapt så indlysende, hvordan
den stokastiske variabel skal defineres. I disse tilfælde laver man en
„kodning“ a f udfaldene som i det følgende eksempel.
Eksempel 4.3: Plat og krone
I eksperimentet „at kaste en mønt“ er der to mulige udfald: Plat og kro­
ne. Man kan her definere en stokastisk variabel, X, ved at kode plat til 0
og krone til 1. Dermed er den stokastiske variabel, X, givet ved:
X (plat) = 0, X (krone) = 1
■
Det står én helt frit for at vælge talværdierne, som den stokastiske va­
riabel skal antage. I eksempel 4.3 kunne man derfor lige så godt have
defineret X til at antage værdien 4 i tilfælde a f plat og værdien 13,2 i
tilfælde a f krone. Hvis man efterfølgende skal have gavn af at have ind­
ført en stokastisk variabel, skal værdierne dog vælges med en vis omhu,
således at de passer til den problemstilling, man vil studere.
Til et givet eksperiment kan man definere mange forskellige stoka­
stiske variabler, som hver repræsenterer et aspekt a f eller karakteristi­
kum ved udfaldet a f eksperimentet. Dette er illustreret i eksempel 4.4.
Eksempel 4.4: To stokastiske variabler
Et eksperiment består i at udvælge en person tilfældigt fra den danske
befolkning og dernæst observere vedkommendes køn og alder. Et mu­
ligt udfald a f dette eksperiment er således: (mand, 43 år). Her kan man
definere en stokastisk variabel, X, der antager værdien 0, hvis den ud­
trukne person er en mand, og værdien 1, hvis det er en kvinde. Tilsva­
rende kan man definere en stokastisk variabel, Y, som antager en værdi
svarende til alderen (målt i år) på den udtrukne person. Udtrækker man
derfor en mand på 43 år, er X = 0 og Y = 43.
■
I eksempel 4.4 er der knyttet to forskellige stokastiske variabler til et­
hvert udfald a f eksperimentet: Alderen og kønnet. Ofte er det denne
type a f eksperimenter, som er interessante inden for samfundsviden­
skab. Fx kunne eksperimentet bestå i at udtrække en person tilfældigt
og observere vedkommendes indtægt og forbrug af en given vare. Så­
danne eksperimenter kan bruges til at bestemme efterspørgslen efter
varen. Det skal vi se nærmere på senere i bogen.
4.1.1
To typer af stokastiske variabler
Stokastiske variabler kan være enten diskrete eller kontinuerte, og det har
betydning for den måde, hvorpå man tilskriver sandsynligheder til deres
værdier. Det, der afgør, om en stokastisk variabel er diskret eller kontinu­
ert, er, hvorvidt der er et tælleligt eller et utælleligt antal mulige udfald.
Den stokastiske variabel, X, i eksempel 4.3, som angav udfaldene
plat og krone med henholdsvis værdien 0 og værdien 1, er en diskret
stokastisk variabel. Det er den, fordi den kun kan antage et tælleligt
antal værdier (0 og 1). Når der er et endeligt antal udfald a f et eksperi­
ment, så er de stokastiske variabler, der er defineret ud fra eksperimen­
tet, altid diskrete.
En stokastisk variabel, Z , der angiver vandhøjden i en havn på et
givet tidspunkt, er en kontinuert stokastisk variabel. Antag, at vand­
højden kan ligge mellem 0 og 12 meter. Den kan fx være 10,344211...
meter. Den præcise vandhøjde har uendeligt mange decimaler (selv­
om man i praksis ikke kan måle den så præcist). Man kan derfor ikke
udelukke nogen vandhøjde mellem 0 og 12 meter på forhånd – alle de
uendeligt mange værdier mellem 0 og 12 meter er i princippet mulige
udfald. Faktisk er der så mange tal mellem 0 og 12, at de ikke engang
kan tælles. Derfor siges den stokastiske variabel at være kontinuert i
dette tilfælde.4
Det samme eksperiment kan sagtens lede til både en diskret og en
kontinuert stokastisk variabel. I eksempel 4.4 er Y en diskret stokastisk
variabel, fordi den angiver alderen på en person målt i hele antal år.
Hvis man i stedet måler alderen uendeligt fint (nanosekunder eller fi­
nere) og definerer en stokastisk variabel, Z , for denne måling, er Z en
kontinuert stokastisk variabel. Om man i en given situation vælger at
bruge den ene eller den anden variabel, hvis man overhovedet har et
valg, vil bl.a. afhænge af den præcision, man ønsker eller har mulighed
for at benytte i sin måling, samt a f de metoder, man efterfølgende øn­
sker at anvende til at analysere den givne problemstilling. Som det vil
fremgå a f resten a f bogen, er der forskel på, hvilke metoder man har til
rådighed ved henholdsvis diskrete og kontinuerte stokastiske variabler.
Sandsynligheden for en kontinuert stokastisk variabel er vanskeli­
gere at beskrive end sandsynligheden for en diskret stokastisk variabel.
Derfor opdeler vi den følgende diskussion i to dele. Først behandler vi
de mere håndgribelige diskrete stokastiske variabler i afsnit 4.2 og 4.3,
og dernæst udvider vi til de kontinuerte stokastiske variabler i afsnit 4.4
og 4.5.
4.2
Diskret stokastisk variabel
En a f fordelene ved stokastiske variabler er, at deres værdier svarer
til hændelser i sandsynlighedsmodellen. Vi kan derfor bruge sandsyn­
lighedsmålet for hændelser i kapitel 3 til at tilskrive en sandsynlighed
til enhver værdi a f en stokastisk variabel. I dette afsnit gøres det for
diskrete stokastiske variabler.
4 Bemærk, at der er en forskel på „uendelig“ og „utællelig“. En stokastisk variabel kan godt antage uendeligt
mange værdier, uden at disse af den grund er utællelige. Hvis fx den stokastiske variabel, X, kan antage vær­
dierne 1,2,3, osv., så er der uendeligt mange værdier, den kan antage. Imidlertid kan disse tælles systematisk,
startende fra fx 1. Derfor er X en diskret stokastisk variabel. En stokastisk variabel, der angiver vanddybden,
har derimod utælleligt mange værdier, idet disse ikke kan opstilles og tælles på en systematisk måde.
Eksempel 4.5: Salg af paraplyer – del 2
For den stokastiske variabel, X, der angiver antallet a f købte paraplyer
i eksempel 4.2, kan man finde sandsynlighederne for dens værdier di­
rekte fra sandsynlighedsmålet i kolonne 3 i tabel 3.2. Således er sand­
synligheden 1/4 for, a t X er lig med 0. Dette skrives: P (X = 0 ) =¼
.
Tilsvarende er P ( X = 1) = ½ og P ( X = 2) = ¼. Bemærk, at den
stokastiske variabel, X, i dette eksempel kun kan antage tre værdi­
er, nemlig 0, 1 og 2. Den samlede sandsynlighed for disse udfald er
P ( X = 0) + P (X = 1) + P (X = 2) = ¼ + ½ + ¼ = 1. Sandsyn­
lighederne summerer til én, da værdierne 0, 1 og 2 udgør alle de mulige
værdier a f X .
––––––––––––––––––––––––––––––––––––––––––––––––––––––■
Det er værd at understrege, at værdierne a f en stokastisk variabel svarer
til hændelser i et eksperiment. Når vi kender sandsynlighederne for de
forskellige værdier, som en stokastisk variabel kan antage, behøver vi
ikke længere bekymre os om sandsynlighederne for de hændelser, der
leder til en bestemt værdi a f den stokastiske variabel. Eksperimentet og
dermed sandsynlighedsmodellen er trådt i baggrunden for den stokasti­
ske variabel og dens fordeling.
4.2.1
Sandsynlighedsfunktionen
Sandsynlighederne for de forskellige værdier, som en diskret stokastisk
variabel kan antage, er opsummeret i dens sandsynlighedsfunktion:
Sandsynlighedsfunktionen, f (x ), for en diskret stokastisk vari­
abel, X, er defineret som:
f (x ) = P (X = x )
Arbejder man med flere stokastiske variabler, kan det være en fordel
at sætte fodtegn på sandsynlighedsfunktionen, så man ved, hvilken
sandsynlighedsfunktion der hører til hvilken stokastisk variabel. Fx kan
f Y(y ) være sandsynlighedsfunktionen for den stokastiske variabel, Y.
Eksempel 4.6: Salg af paraplyer – del 3
Den stokastiske variabel, X, fra eksempel 4 .5 har følgende sandsynlig­
hedsfunktion:
f X ( 0) = ¼, fX(1) = ½, fX( 2 ) = ¼ o g fX( x ) = 0 for x ≠ 0,1,2
–––––––––––––––––––––––––––––––––––––––––––––––––––––■
En sandsynlighedsfunktion, f, har følgende egenskaber: For det første
antager den kun værdier mellem 0 og 1. Vi kan ikke have hverken ne­
gative sandsynligheder eller sandsynligheder, der overstiger 1. For det
andet skal summen a f sandsynlighederne for alle værdier a f den stoka­
stiske variabel være lig med 1:
Egenskaber ved sandsynlighedsfunktionen, f (x ), for en di­
skret stokastisk variabel, X :
i)
0 ≤ f(x ) ≤ 1
ii)
h v o r x1, x 2,. . . xN er de N forskellige værdier, som X kan antage.
Sumtegnet,
betyder, at man skal
over alle de mulige værdier a f x i. Derfor er
summere f (x i)
lig med
ƒ ( x1) + ƒ(x 2 ) + ... + ƒ(x N ), hvor x1, x2,..., xN e r d e N forskellige
værdier, som X kan antage.5
Med sandsynlighedsfunktionen kan man finde sandsynligheden for
forskellige sammensatte hændelser. Det er blot et spørgsmål om at læg­
ge sandsynlighederne sammen for de værdier a f X, som svarer til den
hændelse, man er interesseret i.
Eksempel 4.7: Salg af paraplyer – del 4
Lad X være defineret som i eksempel 4.5 og 4.6. Ved hjælp a f sandsyn­
lighedsfunktionen for X kan vi finde sandsynlighederne for de forskel­
lige hændelser fra paraplyeksemplet fra kapitel 3:
5
Hvis X kan antage uendeligt mange (tællelige) værdier, skriver vi N = ∞ .
P („købe én paraply“ ) = ƒ ( 1) = ½
P („købe to paraplyer“ ) = ƒ ( 2 ) = ¼
P („ingen køb“ ) = ƒ ( 0 ) = ¼
P („køb“ ) = ƒ (1) + ƒ (2) = ½ + ¼ = ¾
P („højst købe én paraply“ ) = ƒ ( 0 ) + ƒ (1) = ¼ + ½ = ¾
hvor fx sandsynligheden for den sidste hændelse er fundet ved at lægge
sandsynlighederne fo r X = 0 og X = 1 sammen, da disse værdier svarer
til hændelsen „højst købe én paraply“.
■
4.2.2
Den kumulative sandsynlighedsfunktion
Sandsynligheden for, at den stokastiske variabel antager en værdi, som
er mindre end eller lig med en bestemt værdi, x, er kendt som den ku­
mulative sandsynlighed. Den kumulative sandsynlighedsfunktion, som
også kaldes fordelingsfunktionen, betegnes ofte med et stort bogstav,
f x F (x ):
Den kumulative sandsynlighedsfunktion, F (x ), for en diskret
stokastisk variabel, X, er defineret som:
Den kumulative sandsynlighed findes, ved at man summerer sandsyn­
lighedsfunktionen, f ( x ), over alle de værdier, xi, som er mindre end
angiver.
eller lig med x. Det er præcis dette, som sumtegnet
Lad os tage et eksempel:
Eksempel 4.8: Salg af paraplyer – del 5
For
den
stokastiske
variabel, X,
i eksempel
4.6
er
F ( 1) = f ( 0) + f ( 1 ) = ¼ + ½ = ¾ Sandsynligheden for, at X anta­
ger en værdi mindre end eller lig med 1, er lig med sandsynligheden
for X = 1 plus sandsynligheden for X = 0. Vi har tegnet grafen for den
kumulative sandsynlighedsfunktion for X i figur 4 .1.
Det ses, at F er lig med 0 for værdier a f x mindre end 0, da X i
dette eksempel ikke kan antage negative værdier. I punktet x = 0 sprin­
ger F til værdien ¼, fordi man i dette punkt lægger sandsynligheden
P (X = 0) til den kumulative sandsynlighed. Sandsynligheden for at få
en værdi mindre end eller lig med nul er altså Tilsvarende springer F
fra ¼ til ¾ i punktet x = 1, fordi man her lægger P ( X = 1) = ½ til den
kumulative sandsynlighed. Mellem 0 og 1 sker der ingen stigninger i
den kumulative sandsynlighed, fordi sandsynligheden for, at X antager
en værdi i dette interval, er nul.
Figur 4.1:
Den kumulati­
ve sandsynlig­
hedsfunktion
fo r X
■
Som eksemplet viser, er den kumulative sandsynlighedsfunktion, F (x ),
en „trappefunktion“ for en diskret stokastisk variabel. Afstanden mel­
lem to trin er lig med værdien a f sandsynlighedsfunktionen, f (x ), i
punktet mellem de to trin.
Den kumulative sandsynlighedsfunktion kan også bruges til at finde
sandsynligheden for, at X antager en værdi i et givet interval, fx mellem
a og b. Denne sandsynlighed er givet ved:
P ( a < X ≤ b ) = F (b ) – F ( a )
Sandsynligheden for, a t X er større end a, men mindre end eller lig med
b, er lig med sandsynligheden for, at X er mindre end eller lig med b,
som er F(b), fratrukket sandsynligheden for, at X er mindre end eller
lig med a, som er F (a). Dette er illustreret i figur 4.2. Når vi kommer
til kontinuerte stokastiske variabler, viser det sig, at denne formel er
særdeles anvendelig til at beregne sandsynligheder.
Figur 4.2:
Intervalsandsyn­
ligheden,
P(a < X ≤ b)
I formlen ovenfor er sandsynligheden for X = a ikke inkluderet. Hvis
man i stedet vil udregne sandsynligheden P ( a ≤ X ≤ b), så er denne
givet ved:
P (a ≤ X ≤ b) = F (b ) – F ( a ) + f (a )
4.2.3
Sandsynlighedsfunktioner og andelsfunktioner
I kapitel 3 argumenterede vi for, at man i nogle situationer kan bruge
andelsfunktionen til at tilskrive sandsynligheder til udfald a f et eks­
periment. Dette er tilfældet, når eksperimentet består i at udtrække et
element fra en virkelig population med Npop elementer, og hvor udfaldet
a f eksperimentet er lig med værdien a f et givet karakteristikum for det
udtrukne element. Hvis alle elementer i populationen har lige stor chan­
ce for udvælgelse, så er sandsynligheden for udfaldet z givet ved ande­
len a f elementer i populationen med værdien z af dette karakteristikum.
Sandsynligheden er derfor lig med g (z ) , hvor g er andelsfunktionen.
Dette kan uden videre overføres til stokastiske variabler. Lad Z være
en stokastisk variabel, hvis værdi er givet ved værdien a f karakteristi­
kum for det element, der udtrækkes. Hvis udvælgelsesmekanismen er
således, at alle elementer i populationen har samme chance for at blive
udvalgt, så er sandsynlighedsfunktionen for Z lig med andelsfunktionen
for populationen, dvs. ƒ (z ) = g (z ). Vi opsummerer denne egenskab
i boksen nedenfor:
Forbindelse mellem andelsfunktion og sandsynlighedsfunk­
tion:
Lad en virkelig population have andelsfunktionen g(z), hvor
egenskaben z er en talværdi.
Lad Z være en diskret stokastisk variabel, hvis værdi er givet ved
værdien a f det element, der udtrækkes.
Hvis alle elementer i populationen har samme chance for udvæl­
gelse, så er sandsynlighedsfunktionen, f(z ), givet ved:
f ( z ) = g (z )
og den kumulative sandsynlighedsfunktion, F (z ), er givet ved:
f (z ) = G (z )
hvor G(z ) er den kumulative andelsfunktion.
Eksempel 4.9: Mænd og kvinder
I eksempel 4.4 udtrak vi en person fra en population, hvor en andel a f
denne var mænd, og en andel var kvinder. Den stokastiske variabel,
X, antog værdien 0, hvis resultatet a f udtrækningen blev en mand, og
værdien 1, hvis det blev en kvinde. Hvis populationen består a f 49 %
mænd og 51 % kvinder, så er andelsfunktionen for denne population
givet ved:
g (0 ) = 0,49
g (1) = 0 ,5 1
Hvis alle personer har lige stor chance for at blive udtrukket, er der
49 % sandsynlighed for, at udtrækningen resulterer i en mand, dvs. for
at X antager værdien 0. Derfor bliver sandsynlighedsfunktionen for X :
f ( 0) = 0,49
f ( 1 ) = 0 ,51
Altså nøjagtig den samme som andelsfunktionen.
■
Sammenhængen mellem sandsynlighedsfunktioner og andelsfunktio­
ner er en stor hjælp, når vi skal specificere en sandsynlighedsfunktion
for en stokastisk variabel, som repræsenterer de mulige værdier i en
virkelig population. Det gør også, at vi ofte taler om andelsfunktionen,
som var den en sandsynlighedsfunktion. Ofte taler vi også om sand­
synlighedsfunktionen, som var den en andelsfunktion. Det gør vi, når
den stokastiske variabel (jf. eksemplet ovenfor) er defineret ud fra en
virkelig population, således at dens værdi er lig med værdien a f det
element, der udvælges, og udvælgelsesmekanismen indebærer samme
chance for udvælgelse for alle elementerne i populationen.
4.3
Sammenhænge mellem diskrete stokastiske variabler
Vi er ofte interesserede i at undersøge sammenhænge, fx mellem et
bams opvækstvilkår og dets uddannelsesvalg eller mellem pris og for­
brug af en vare. Med stokastiske variabler kan vi nemmere håndtere
mere omfattende problemstillinger end dem, vi behandlede i kapitel 3.
For at finde og beskrive sammenhænge under usikkerhed bruger
man to eller flere stokastiske variabler. I det følgende præsenterer vi
nogle vigtige redskaber til at karakterisere sammenhænge mellem sto­
kastiske variabler.
4.3.1
Simultan sandsynlighed
Lad os forestille os en situation, hvor en bank skal vurdere en virk­
somheds kreditværdighed. For at gøre eksemplet så simpelt som muligt
antager vi, at der i vurderingen indgår to aspekter: i) risikoen for fallit
og ii) markedsudviklingen. Begge disse forhold er forbundet med usik­
kerhed. Vi har altså et statistisk eksperiment, som kan modelleres med
to stokastiske variabler: X, som vil antage værdien 0, hvis virksomhe­
den går fallit, og værdien 1, hvis den ikke gør det, og Y, som er lig 1,
hvis markedsudviklingen viser sig at blive gunstig, og 0 i modsat fald.
Banken ved a f erfaring med tilsvarende virksomheder, at sandsynlighe­
derne for de forskellige udfald er som i tabel 4 .1 :
Tabel 4.1:
X=0
(fallit)
X=1
(ej fallit)
Y = 0 (ugunstigt marked)
0,2
0,2
Y = 1 (gunstigt marked)
0,1
0,5
Simultane
sandsynlig­
heder
Sandsynligheden i det nederste højre hjørne i tabel 4.1 er sandsynlig­
heden for, at både markedsudviklingen bliver gunstig, og at virksom­
heden ikke går fallit. Dette kaldes en simultan sandsynlighed, fordi det
er en „både ... og“-sandsynlighed. Sandsynlighedsfunktionen, som gi­
ver sandsynligheden for bestemte kombinationer a f værdier a f X og Y,
kalder man den simultane sandsynlighedsfunktion. Den er defineret i
følgende boks:
Den simultane sandsynlighedsfunktion, f (x ,y ), for to diskrete
stokastiske variabler, X og Y, er defineret som:
f ( x , y ) = P ( X = x and Y = y )
Sandsynligheden for en ugunstig markedsudvikling og en fallit er således
ƒ ( 0 ,0 ) = 0,2. Vi bemærker, at de fire simultane sandsynligheder i ta­
bel 4 .1 summerer til 1, fordi der i alt er 4 mulige udfald, og summen
a f sandsynlighederne skal, som i tilfældet med én stokastisk variabel,
være lig med 1.
Generelt gælder det, at når man summerer den simultane sandsyn­
lighedsfunktion over alle værdier a f de involverede stokastiske varia­
bler, skal resultatet være lig med 1.
Egenskaber ved den simultane sandsynlighedsfunktion,
f ( ,x y ), for to diskrete stokastiske variabler, X og Y:
i)
0 ≤ f(x ,y ) ≤1
ii)
hvor
4.3.2
er de N Ymulige værdier, som Y kan antage, og
er de Ν Xmulige værdier, som X kan antage.
Marginal sandsynlighed
Hvis man er interesseret i sandsynligheden for, at virksomheden ikke
går fallit, uanset hvordan markedet udvikler sig, kan man udregne den­
ne sandsynlighed ved at summere sandsynlighederne for alle de ud­
fald i tabel 4 .1, hvor virksomheden ikke går fallit. Virksomheden kan
undgå fallit, både når markedet er gunstigt, og når det er ugunstigt.
Dermed er den samlede sandsynlighed for at undgå fallit givet ved
ƒ ( 1 ,0) + ƒ ( 1, 1) = 0,2 + 0,5 = 0 ,7 . Rent mekanisk findes dette tal
ved at summere sandsynlighederne i kolonnen med overskriften „ej fal­
lit“. Dette er gjort i tabel 4.2.
Når der som i bankeksemplet er mere end én stokastisk variabel,
så kaldes sandsynlighederne for hver a f de stokastiske variabler for de
marginale sandsynligheder. Den marginale sandsynlighedsfunktion for
X benævnes f X (x ) og er defineret i nedenstående boks:
Den marginale sandsynlighedsfunktion, f X(x ), for en diskret
stokastisk variabel, X , er defineret ved:
er de Ν Ymulige værdier, som Y kan antage.
Populært sagt finder vi den marginale sandsynlighed ved at summere
den simultane sandsynlighed over alle mulige y -værdier for en bestemt
værdi a f x , præcis som vi gjorde ovenfor, da vi skulle finde den mar­
ginale sandsynlighed for at undgå fallit. Tilsvarende er den marginale
sandsynlighedsfunktion for Y defineret ved at summere over alle vær­
dier a f x :
I tabel 4.2 findes den marginale sandsynlighed for Y ved at sum­
mere horisontalt. For eksempel er sandsynligheden for et ugun­
stigt marked (uanset om virksomheden går fallit eller ej)
givet ved: f Y(0) = ƒ (1 ,0 ) + ƒ ( 0 ,0 ) = 0,2 + 0,2 = 0,4. Tilsva­
rende er den marginale sandsynlighed for et gunstigt marked lig med
f Y(1) = ƒ ( 1,1) + ƒ (0 ,1 ) = 0,5 + 0,1 = 0,6. De marginale sandsyn­
ligheder summerer også til 1. De er nemlig lig med de sandsynligheder,
man ville have i en situation med blot en enkelt stokastisk variabel.
Man kan altså sige, at man splitter de marginale sandsynligheder op i
mindre „bidder“ (de simultane sandsynligheder), når man inddrager en
anden stokastisk variabel i analysen.
Tabel 4.2: Simultane og marginale sandsynligheder
X =0
(fallit)
X =1
(ej fallit)
Marginal
sandsynlighed for
Y: f Y(y )
Y =0 (ugunstigt marked)
0,2
0,2
0,4
Y = 1 (gunstigt marked)
0,1
0,5
0,6
Marginal sandsynlighed for X : f X(x)
0,3
0,7
4.3.3
Betinget sandsynlighed
Man kan direkte overføre definitionen a f betinget sandsynlighed mel­
lem to hændelser fra afsnit 3.5 til stokastiske variabler. Som vi skal
se, er den grundlæggende idé og fortolkning fuldstændig den samme.
Forskellen er, at vi med stokastiske variabler lettere kan håndtere mere
komplicerede situationer, som man ofte støder på i praksis.
I eksemplet fra afsnit 4.3.2 kan man tænke sig den situation, at ban­
ken a f en eller anden grund ved (eller tror), at markedet bliver gunstigt.
Spørgsmålet er da, hvordan den kan bruge denne information til bedre
at forudsige sandsynligheden for, at virksomheden ikke går fallit. Da
banken ved, at markedet er gunstigt (Y = 1), så er der kun usikkerhed
om udfaldet a f X tilbage. A f tabel 4.2 ses det, at den simultane sand­
synlighed for et „gunstigt marked“ og „ej fallit“ er 0,5, hvorimod den
simultane sandsynlighed for et „gunstigt marked“ og „fallit“ er 0,1. Der
er altså 5 gange så stor sandsynlighed for ikke at gå fallit som for at gå
fallit i et gunstigt marked.
Man kan bevare forholdet mellem disse sandsynligheder og samti­
dig justere dem, så de summerer til 1, ved at dividere dem med den mar­
ginale sandsynlighed for et gunstigt marked. Man kalder disse justerede
sandsynligheder (som her skyldes, at man ved, at markedet bliver gun­
stigt) for betingede sandsynligheder:
hvor den lodrette streg „|“ ligesom i kapitel 3 læses som „givet“ el­
ler „betinget a f “. De to betingede sandsynligheder summerer til 1, og
forholdet mellem dem er stadig en faktor 5. Sagt på en anden måde:
Sandsynligheden for, at virksomheden får succes, givet at vi ved, at
markedet er gunstigt, er 0,833. Dermed har vores viden om, at markedet
er gunstigt, ændret vores vurdering a f sandsynligheden for, at virksom­
heden får succes. Uden informationen om, at Y er lig med 1, ville vi
have anvendt den marginale sandsynlighed fo r X = 1, som ifølge tabel
4.2 er 0 ,7 . I dette eksempel er det altså mere sandsynligt, at virksomhe­
den undgår en fallit, når vi ved, at markedsudviklingen er gunstig. Dette
må formodes også at være tilfældet i virkeligheden!
En anden måde, man kan motivere formlen for betinget sandsynlig­
hed på, er ved at sige, at vores kendskab til Y gør, at vi ikke længere skal
anvende hele den simultane fordeling for X og Y. Nogle a f udfaldene i
den simultane fordeling er blevet elimineret, nemlig dem, hvor Y = 0.
Tilbage er kun de udfald, hvor Y = 1, og det er disse udfalds indbyrdes
sandsynligheder, som nu er relevante. Derfor dividerer vi dem med de­
res sum, således at de kommer til at summere til 1. Det var også den
måde, vi motiverede betingede sandsynligheder på i kapitel 3.
Formelt er den betingede sandsynlighedsfunktion for X, givet at
Y = y , defineret i følgende boks:
Den betingede sandsynlighedsfunktion, f X|Y(x |y ), for en di­
skret stokastisk variabel, X, givet at Y = y, er defineret som:
Bemærk, at den betingede sandsynlighed fo r X givet Y = y kun er defi­
neret for værdier a f y med en positiv marginal sandsynlighed. I oven­
stående eksempel kan Y kun antage værdierne 0 og 1. Det giver derfor
ingen mening at tale om den betingede sandsynlighed for X givet Y = 3,
da dette er en umulig situation.
I modsætning til definitionen a f betinget sandsynlighed for to hæn­
delser i afsnit 3.5, holder definitionen a f betinget sandsynlighed for to
stokastiske variabler for mange forskellige hændelser, fordi hver sto­
kastisk variabel kan antage mange værdier, og til hver værdi svarer en
hændelse. Fortolkningen a f betinget sandsynlighed er dog nøjagtig den
samme som i afsnit 3.5.
4.3.4
Bayes’ formel
I praksis hænder det, at man kender den betingede sandsynlighed for Y
givet X , men at man gerne vil kende den betingede sandsynlighed fo r X
givet Y. Populært sagt skal man have „vendt“ betingelsen.
Et eksempel er et nyt varslingssystem ved stormflod. Man kan i et
laboratorium finde ud a f sandsynligheden for, at varslingssystemet vir­
ker, når man simulerer en stormflod, og ligeledes om varslingssystemet
virker, når man simulerer, at der ikke er en stormflod. Man kan altså
beregne sandsynlighederne for varsling givet stormflodssituationen. I
praksis er vi derimod interesserede i, om vi får våde fødder. Udtrykt i
sandsynligheder vil vi altså gerne vide, hvad sandsynligheden er for en
stormflod, givet at der udsendes et varsel, men også hvad sandsynlighe­
den er for stormflod, givet at der ikke udsendes et varsel. Vi skal derfor
have „vendt“ de sandsynligheder, man finder i laboratoriet.
Man kan bruge følgende regneregler til at vende en betinget sand­
synlighed:
Regneregler for betingede sandsynligheder:
og:
(Bayes’ formel)
En kort teknisk forklaring på formlerne: Den første formel følger af, at
den simultane sandsynlighed, ƒ ( x , y ), er lig med både f Y|X(y|x ) · f X ( x )
og f X|Y(x |y ) · f Y(y ), hvilket vi har fra definitionen a f den betin­
gede sandsynlighed i afsnit 4.3.3. Sætter vi f Y|X(y |x ) · f x (x ) lig
med f x |Y( x |y ) · f Y(y ) og dividerer med f Y(y ) på begge sider af
lighedstegnet, så får vi den første formel i boksen ovenfor. Den anden
formel (Bayes’ formel) følger af, at den marginale sandsynlighed for Y,
f Y(y ), kan findes ved at summere de simultane sandsynligheder over
alle de mulige værdier a f x for en given værdi a f y, dvs.:
er de værdier, so m X kan antage.
Eksempel 4.10: Et varslingssystem
Lad den stokastiske variabel, X , angive, om der opstår stormflod, dvs.
X = 1, hvis der gør, og X = 0, hvis der ikke gør. Lad tilsvarende den sto­
kastiske variabel, 7, angive, om varslingssystemet udsender et varsel,
dvs. Y = 1, hvis det gør, og Y = 0, hvis det ikke gør. Antag, at man i la­
boratoriet har fundet ud af, at der udsendes varsel i 90 % a f de tilfælde,
hvor der opstår stormflod. Tilsvarende udsendes der (falske) varsler i
2 % af de tilfælde, hvor der ikke er stormflod. De betingede sandsyn­
ligheder er altså:
fY|X,( 1|1) = 0,90, fY|X(0|1) = 0,10,
fY|X(1|0) = 0,02 , fY|X(0|0) = 0,98
Endelig ved man fra historiske erfaringer med stormfloder, at der er 5 %
risiko for stormflod. Den marginale sandsynlighed for en stormflod er
altså:
f X (1) = 0,05, f X (0) = 0,95
Den betingede sandsynlighed for, at der kommer en stormflod, givet at
der udsendes et varsel, kan nu udregnes ved blot at indsætte i Bayes’
formel:
Der er således ca. 70 % sandsynlighed for, at der kommer en stormflod,
hvis systemet udsender et varsel. Tilsvarende er sandsynligheden for en
stormflod, når der ikke udsendes et varsel:
Hvis man er nervøs for, at en stormflod kommer uden varsel, så er sand­
synligheden for dette altså meget lille med et sådant varslingssystem.
Prisen er, at der er ca. 30 % risiko for et falsk varsel.
■
Bemærk, at den betingede sandsynlighed for X givet Y kun i særlige
tilfælde er lig den betingede sandsynlighed for Y givet X.
4.3.5
Uafhængighed
I afsnit 3.6 diskuterede vi statistisk uafhængighed mellem to hændelser.
Nu vil vi udvide dette til statistisk uafhængighed mellem mange hæn­
delser. Dette gøres relativt let ved hjælp a f stokastiske variabler.
I eksemplet ovenfor om banken kan man sammenligne den margi­
nale sandsynlighed for X, f X (x ), med den betingede sandsynlighed for
X, f X|Y(x |y ) , når man ved, at Y antager en bestemt værdi,y. Hvis de to
sandsynligheder er forskellige, så har informationen om Y ændret vores
viden om X. Dog ikke således, at vi kender udfaldet a f X , men på den
måde, at nogle værdier a f X er blevet mere eller mindre sandsynlige,
end da vi ikke kendte udfaldet a f Y. Vores forudsigelser om X ændrer
sig altså, fordi vi nu kender udfaldet a f Y.
Hvis information om Y ikke ændrer fordelingen af X , så siges X og Y
at være uafhængige. Formelt kan dette skrives som:
Uafhængighed:
To diskrete stokastiske variabler, X og Y, er uafhængige, hvis og
kun hvis:
f (x ,y ) = f X (x ) · f Y(y ) for alle værdier a f x og y.
hvilket medfører:
f X (x ) = f X|Y(x |y ) for alle værdier a f x og y, hvor f Y(y ) > 0,
og
f Y( y ) =f Y|X (y| x ) for alle værdier af y og x , hvor fX(x ) > 0.
N å r X og Y er uafhængige, er den marginale fordeling for X , f X (x ) , lig
med den betingede fordeling fo r X givet Y, f X|Y(x |y ). Det vil sige, at
informationen om Y ikke ændrer vores opfattelse a f sandsynlighederne
for de forskellige værdier a f X. Man kan derfor ikke bruge Y til at for­
udsige noget om X.
Den formelle difi n ition a f uafhængighed mellem X og Y er, at den
simultane sandsynlighed kan skrives som produktet a f de marginale
sandsynligheder:
ƒ (x,y)=ƒX
(x ) · f Y(y ) . Hvis man indsætter dette
i definitionen a f den betingede sandsynlighedsfunktion får man f X (x )
= f X|Y(x|y ) .
Eksempel 4.11: To møntkast
Antag, at vi kaster en mønt to gange og definerer den stokastiske va­
riabel, X, som værende lig med 1, hvis det første kast viser krone, og
0, hvis det viser plat. Lad Y være defineret tilsvarende for det andet
kast. Der er fire mulige kombinationer af X ’s og Y’s værdier. Da vi
ikke kan argumentere for, at én kombination er mere sandsynlig end en
anden, så er sandsynligheden for hver kombination lig med 0,25 ifølge
symmetriargumentet fra afsnit 3.3.3. Vi kan udlede samme resultat ved
at tage udgangspunkt i, at der ingen sammenhæng er mellem X og Y.
Derfor m å X og Y være uafhængige. Sandsynlighedsfunktionen for X er
f X (0) = 0,5 og f X (1) = 0,5. Tilsvarende er sandsynlighedsfunktio­
nen for Y: f Y(0) = 0,5 og f Y(1) = 0 ,5. Da X og Y er uafhængige, så
er f (x ,y ) = f X (x ) · f Y(y ) = 0,5 · 0,5 = 0,25 f o r x = 0 eller 1 og
y = 0 eller 1.
■
I tabel 4.2 kan det tydeligt ses, at X og Y ikke er uafhængige. Tag
fx den simultane sandsynlighed for et ugunstigt marked og fallit:
ƒ (0,0) = 0 ,2 . Denne sandsynlighed er ikke lig med produktet a f de
to marginale sandsynligheder: f X ( 0) · f Y (0) = 0,3 · 0,4 = 0,12.
4.4
Kontinuert stokastisk variabel
For at behandle sandsynligheder for stokastiske variabler, som kan an­
tage utælleligt mange værdier, er det nødvendigt at bruge lidt andre ma­
tematiske redskaber end dem, vi anvendte i afsnit 4.2 og 4.3. Forskel­
len i forhold til diskrete stokastiske variabler er, at det er nødvendigt
at erstatte sandsynlighedsfunktionen med en såkaldt tæthedsfunktion.
Derefter følger begreberne om simultane og betingede sandsynligheder
nøjagtig samme recept som for de diskrete stokastiske variabler. Lad os
illustrere problematikken omkring tilskrivning af sandsynligheder til en
kontinuert stokastisk variabel med et eksempel:
Eksempel 4.12: Vareproduktion – del 1
En virksomhed skal vurdere, hvad dens vareproduktion (målt i tons) vil
være til næste år. Den har imidlertid ikke nogen specielt god informa­
tion om dette, da produktionen afhænger af vejret og priser på råvarer.
Den antager derfor, at alle mængder mellem 10 og 20 tons har lige stor
sandsynlighed for at blive produceret. Dog forudsætter den, at der vil
blive produceret mindst 10 og maksimalt 20 tons. Derfor er sandsynlig­
heden for, at den producerede mængde er mellem 10 og 20 tons, lig med
1. Men hvad er sandsynligheden for, at der vil blive produceret nøjag­
tigt 14,55325 tons? Svaret er 0. Det måske endnu mere overraskende
er, at sandsynligheden også er 0 for enhver anden mængde mellem 10
og 20 tons.
■
Sandsynligheden for, at en kontinuert stokastisk variabel antager en
specifik værdi, er nul, fordi der er utælleligt (og dermed uendeligt)
mange værdier, den kan antage. Hvis sandsynligheden for enhver af
disse værdier er større end 0, så vil den samlede sandsynlighed være
uendeligt stor. Men vi ved jo, at den samlede sandsynlighed skal være
lig med 1. Derfor er det nødvendigt at finde en ny måde at beskrive
usikkerheden på, når den stokastiske variabel er kontinuert. Det gøres
ved hjælp a f den kumulative sandsynlighedsfunktion.
4.4.1
Den kumulative sandsynlighedsfunktion
Den kumulative sandsynlighedsfunktion (fordelingsfunktionen) er defi­
neret præcis som i afsnit 4.2.2:
Den kumulative sandsynlighedsfunktion, F (x ), for en kontinu­
ert stokastisk variabel, X, er defineret som:
F (x ) = P ( X ≤ x )
Denne definition kan vi altså bruge, både når X er diskret, og når X er
kontinuert. Det næste eksempel viser, hvordan man kan ræsonnere om­
kring den kumulative sandsynlighedsfunktion.
Eksempel 4.13: Vareproduktion – del 2
I eksempel 4 .12 var X den producerede varemængde. Vi antog, at denne
var mindst 10 tons. Derfor må F (x ) = 0 for alle værdier af x mindre
end 10 tons, da der ingen sandsynlighed er for en produceret mængde
på under 10 tons. Til gengæld er F (x ) = 1 for x ≥ 20 tons, da vi også
antog, at der ikke ville blive produceret en mængde over 20 tons. Nu
har vi altså to holdepunkter: F ( 1 0 ) = 0 og F ( 2 0 ) = 1. Spørgsmålet er
så, hvilke værdier F (x ) antager, når x er mellem 10 og 20 tons.
Virksomheden antog, at alle værdier mellem 10 og 20 tons var lige
sandsynlige, men dette førte ikke til noget meningsfyldt om sandsyn­
ligheden for en bestemt værdi, da alle værdier har sandsynlighed 0 for
at forekomme. For at fange hensigten med, at alle værdier har lige stor
sandsynlighed, kan vi i stedet forsøge at udtale os om et interval af
værdier. Man kan nemlig opdele intervallet mellem 10 og 20 i et tæl­
leligt antal intervaller. Dermed kan vi bruge tilgangen fra en diskret
stokastisk variabel, hvis vi fokuserer på et interval a f værdier i stedet
for på en bestemt værdi a f den kontinuerte stokastiske variabel. Da ud­
gangspunktet er, at alle værdier er lige sandsynlige, kan dette overføres
på intervaller a f samme længde, som da også skal have samme sand­
synlighed. For eksempel skal sandsynligheden for at få en værdi i inter­
vallet 10 til 11 tons være den samme som sandsynligheden for at få en
værdi i intervallet 11 til 12 tons. Da de mulige værdier ligger mellem
10 og 20 tons, kan dette interval deles i 10 mindre intervaller, hver med
en længde på 1 ton. Da alle disse intervaller skal være lige sandsynlige,
så må sandsynligheden for en værdi i hvert interval være 0,1. Vi har
dermed, at fx P ( 10 < X ≤ 11) = 0,1. Fra afsnit 4.2.2 ved vi endvi­
dere, at denne sandsynlighed kan skrives ved hjælp af den kumulative
sandsynlighedsfunktion på følgende vis:
P (10 < X ≤ 11) = 0,1 = F ( 11) – F (10) = 0,1
Da F (1 0 ) = 0, så må F ( 1 1 ) nødvendigvis være lig med 0 ,1:
F ( 11) = P ( 10 < X ≤ 11) + F (10) = 0,1 + 0 = 0,1
På denne måde kan vi finde den kumulative sandsynlighedsfunktion,
F (x ), for dette specifikke eksempel. Den er vist i figur 4.3.
■
Grafen for en kumulativ sandsynlighedsfunktion for en kontinuert sto­
kastisk variabel kan have mange forskellige former. Fælles for dem alle
er dog, at de er kontinuerte (ubrudte).
4.4.2
Tæthedsfunktionen
I afsnit 4.2.2 viste vi, at den kumulative sandsynlighedsfunktion for en
diskret stokastisk variabel var en trappefunktion, hvor afstanden mel­
lem to trin svarede til sandsynligheden for værdien i punktet mellem
trinnene. Den kumulative sandsynlighedsfunktion, F , er derimod konti­
nuert (ubrudt) for kontinuerte stokastiske variabler. Til gengæld kan vi
bruge hældningen a f F til at sige noget om, hvor meget den kumulative
sandsynlighed ændrer sig, når x øges. Hældningen a f F (x ) betegnes
med ƒ (x ) og kaldes tæthedsfunktionen. Her er der en oplagt mulighed
for forvirring, fordi vi også brugte f (x ) til at betegne sandsynligheds­
funktionen for en diskret stokastisk variabel. Traditionen foreskriver
imidlertid denne notation, og som regel er det ikke noget problem, fordi
man i et givet tilfælde er klar over, om en stokastisk variabel er diskret
eller kontinuert, og dermed om f(x ) er en sandsynlighedsfunktion eller
en tæthedsfunktion.
Eksempel 4.14: Vareproduktion – del 3
I figur 4.3 har vi også afbildet tæthedsfunktionen for vareeksemplet. Da
tæthedsfunktionen er lig med hældningen af F (x ), og da denne er kon­
stant lig med 0 ,1, så er tæthedsfunktionen flad mellem 10 og 20. Dette
skyldes, at vi antog, at alle intervaller a f samme længde skulle være lige
sandsynlige. Bemærk, at arealet under tæthedsfunktionen er lig med
0 , 1 · 1 0 = 1. Dette er ikke tilfældigt. Arealet under en tæthedsfunktion
er altid lig med 1, nøjagtigt som summen a f sandsynligheder for en
diskret stokastisk variabel skal være 1.
Figur 4.3: Tæt­
hedsfunktion
og kumulativ
sandsynlig­
hedsfunktion
Formelt er tæthedsfunktionen den 1. afledte af den kumulative sandsyn­
lighedsfunktion:
Tæthedsfunktionen, f (x ), for en kontinuert stokastisk variabel,
X , er defineret som:
Tilsvarende kan man, hvis man kender tæthedsfunktionen, f (x ), udlede
F (x ) ved hjælp a f integration:
Den kumulative sandsynlighed, F (x 1), er altså lig med arealet under
tæthedsfunktionen, f (x ) , til venstre for x 1som illustreret i figur 4.4:
Figur 4.4:
Kumulativ
sandsynlighed
som areal un­
der tætheds­
funktionen
Eksempel 4.15: Vareproduktion – del 4
A f figur 4.3 kan man se, at den kumulative sandsynlighedsfunktion fra
vareeksemplet er givet ved:
Vi kan dermed udlede, at tæthedsfunktionen må være givet ved:
idet den afledte a f 0 ,1 · (x – 1 0 ) er 0 ,1, mens de afledte a f 0 og 1 er 0.
■
Den kontinuerte fordeling for X fra vareeksemplet er kun én ud a f (uen­
deligt) mange forskellige kontinuerte fordelinger. Det var antagelsen
om lige sandsynlighed for lige store intervaller, som var skyld i, at tæt­
hedsfunktionen blev konstant som i figur 4.3. Hvis alle intervaller af
samme længde ikke har samme sandsynlighed, bliver tæthedsfunktio­
nen og den kumulative sandsynlighedsfunktion anderledes, som vi skal
se i de følgende kapitler.
4.5
Sammenhænge mellem kontinuerte stokastiske variabler
Idéerne fra afsnit 4 .3 om sammenhænge mellem diskrete stokastiske
variabler kan direkte overføres til kontinuerte stokastiske variabler
med den forskel, at f (x ) her er en tæthedsfunktion. Den følgende boks
opsummerer formlerne for de simultane, marginale og betingede tæt­
hedsfunktioner. Hvor der før var sumtegn, er der nu integraltegn (den
kontinuerte udgave a f sumtegnet):
Den simultane tæthedsfunktion for to kontinuerte stokastiske
f(x,y)
variabler, X og Y, skrives:
Den betingede tæthedsfunktion, f X|Y(x |y ), for en kontinuert
stokastisk variabel, X , givet at Y = y , er defineret som:
Betingelsen for uafhængighed mellem to kontinuerte stokastiske varia­
bler har også samme form som ved diskrete stokastiske variabler:
Uafhængighed:
To kontinuerte stokastiske variabler, X og Y, er uafhængige, hvis
og kun hvis:
f (x , y ) = f X (x ) · f Y(y ) for alle værdier a f x o g y.
hvilket medfører:
f X (x ) = ƒ X|Y(x |y ) for alle værdier a f x og y, hvor f Y(y ) > 0,
og
f Y(y ) = f Y|X(y |x ) for alle værdier af y og x, hvor f X(x ) > 0.
Eksempel 4.16: To uafhængige stokastiske variabler
To kontinuerte stokastiske variabler, X og Y, kan antage værdier mellem
0 og 2. De marginale tæthedsfunktioner er givet ved:
Hvis vi antager, at X og Y er uafhængige, er den simultane tæthedsfunk­
tion, f (x , y ), givet ved:
idet
vet Y = y er da:
Den betingede tæthedsfunktion for X gi­
for 0 ≤ y < 2 og 0 ≤ x < 2 . På grund af uafhængighed er den betin­
gede tæthedsfunktion præcis lig med den marginale tæthedsfunktion.
■
Også regnereglerne for betingede sandsynligheder ser ud som tidligere
med sumtegnet erstattet a f et integraltegn:
Regneregler for betingede sandsynligheder:
og:
(Bayes’ formel)
4.6
Opgaver
1. Repetitionsspørgsmål:
a) Hvad er sammenhængen mellem en stokastisk variabel og et ud­
fald a f et eksperiment?
b) Forklar kort forskellen på diskrete og kontinuerte stokastiske va­
riabler.
c) Hvilke egenskaber har sandsynlighedsfunktionen for en diskret
stokastisk variabel?
d) Hvordan er den kumulative sandsynlighedsfunktion defineret?
e) Gør kort rede for, under hvilke omstændigheder andelsfunktio­
nen for en population er lig med sandsynlighedsfunktionen for
en diskret stokastisk variabel.
f) Hvordan er den simultane sandsynlighedsfunktion for to diskrete
stokastiske variabler defineret?
g) Forklar forskellen på marginale og betingede sandsynligheder.
h) Hvad er de to betingelser for uafhængighed mellem to stokasti­
ske variabler?
2. Lad X være en diskret stokastisk variabel med sandsynlighedsfunk­
tion som i tabellen.
a) Bestem følgende sandsynligheder: P ( X ≤ 3 ), P ( 1 < X ≤ 3)
og P ( X ≥ 3).
b) Find den kumulative sandsynlighedsfunktion, F (x ) .
c) Beregn sandsynlighederne i a) ved hjælp af den kumulative sand­
synl ighedsfunktion.
d) Tegn den kumulative sandsynlighedsfunktion i et diagram med
x ud a f 1. aksen.
X
1
f (x ) = P (X = x )
0 ,1 2
3
0,43
4
0,07
5
0,30
0,08
0
3. Lad Y være en diskret stokastisk variabel, der kan antage syv
forskellige værdier. Fordelingsfunktionen (den kumulative sandsyn­
lighedsfunktion) for Y er givet i tabellen.
a) Afbild fordelingsfunktionen i et diagram med y ud a f 1. aksen.
b) Bestem P ( Y < 3).
c) Bestem ƒ ( 3 ) = P ( Y = 3).
d) Bestem sandsynligheden for 2 ≤ Y < 5.
e) Find sandsynlighedsfunktionen, f, for Y.
y
F (y ) = P (Y ≤ y )
0
0,0083
1
0,0692
2
0,2553
3
0,5585
4
0,8364
5
0,9723
6
1
4. Betragt følgende eksperiment: Man vælger en person tilfældigt
blandt de beskæftigede i Danmark og lader den stokastiske variabel,
X, angive vedkommendes køn, og Y om personen har skiftet arbejde
inden for det seneste år (Y = 1) eller ikke har (Y = 0). Antag, at X
og Y har følgende simultane sandsynlighedsfunktion:
Y= 1
Y= 0
X = 1 (kvinde)
0,35
0,23
X = 0 (mand)
0,15
0,27
a) Beregn de marginale sandsynlighedsfunktioner, f X(x ) og f Y(y ) .
b) Hvad er sandsynligheden for et arbejdsskift, hvis den adspurgte
er en mand? Hvis det er en kvinde?
c) Er de to variabler uafhængige?
5. Udfyld de tomme felter i følgende sandsynlighedstabel for de to di­
skrete stokastiske variabler, X og Y:
X = 1
Y= 3
Y = 10
0,3525
0,0572
fX (x )
X =2
0,8600
f Y(y )
a) Er X og Y uafhængige?
b) Bestem de betingede sandsynlighedsfunktioner, f X|Y( x |y ) og
f Y|X(y |x) .
6. Lad X og Y være to diskrete uafhængige stokastiske variabler med
følgende marginale sandsynlighedsfunktioner:
X
f X(x)
1
0,24
2
0,47
3
0,29
y
f Y(y )
2
0,67
0
0,33
og
a) Bestem de betingede sandsynlighedsfunktioner for X og Y.
b) Find den simultane sandsynlighedsfunktion for X og Y.
7. Lad X være en kontinuert stokastisk variabel med følgende
fordelingsfunktion:
a) Tegn fordelingsfunktionen i et diagram.
b) Beregn sandsynligheden for, a t X er mindre end 2,4.
c) Beregn P (1,5 < X < 2,5) og P (X > 1,25).
d) F in d P ( X = 2).
e) Kan du finde tæthedsfunktionen, ƒ ( x)?
8. På en bilfabrik har 1,5 % a f bilerne en defekt ved indsprøjtnings­
systemet, som risikerer at ødelægge motoren efter kort tids kørsel.
Derfor testes alle bilerne, når de forlader samlebåndet. Den test, der
anvendes, er imidlertid ikke helt skudsikker. Fabrikkens ejer ved,
at hvis en bil har en fejl i indsprøjtningssystemet, så er der 90 %
chance for, at den ikke består testen. Han ved dog også, at der er 1 %
risiko for, at en fejlfri bil dumper testen.
Lad X være den stokastiske variabel, der antager værdien 1, hvis
en bil har fejlen, og værdien 0, hvis den ikke har. Lad Y være en
anden stokastisk variabel, der antager værdien 1, hvis bilen dumper
testen, og værdien 0, hvis den ikke gør det.
a) Opskriv den betingede sandsynlighedsfunktion for Y givet X. Op­
skriv også den marginale sandsynlighedsfunktion for X, f X (x ) .
b) Er X og Y uafhængige?
c) Hvad er sandsynligheden for, at en bil, der dumper testen, faktisk
har den pågældende fejl ved indsprøjtningssystemet? (Anvend
Bayes’ formel). Hvad er sandsynligheden for, at den ikke har fej­
len?
9. Lad Y være en kontinuert stokastisk variabel med følgende
tæthedsfunktion:
a) Tegn tæthedsfunktionen i et diagram med y ud a f 1. aksen.
b) Hvad er sandsynligheden for, at Y er mindre end 2? Illustrér den­
ne sandsynlighed ved hjælp a f figuren fra a).
c) Hvad er sandsynligheden for, at 1 ≤ Y ≤ 2 ,5 ? Illustrér også
denne sandsynlighed.
d) Kan du finde fordelingsfunktionen for Υ?
5
Beskrivende mål
Indkomstfordelingen i Danmark tæller godt 5 millioner indkomster.
Med en bogstavhøjde på 3 millimeter og en linjeafstand på 2 milli­
meter, hvilket svarer til en normal typografisk opsætning, vil en liste
med de godt 5 millioner indkomster være omkring 25 km lang. Selv­
om man læser meget hurtigt og har fotografisk hukommelse, får man
næppe et godt overblik over fordelingen a f indkomster i Danmark ved
at kigge på en sådan liste. For at få en begribelig idé om indkomstfor­
delingen i Danmark kan man i stedet definere nogle beskrivende mål,
som hver især afslører interessante aspekter af indkomstfordelingen.
Sådan et beskrivende mål kunne fx være middelindkomsten. Det kan
også være den indkomst, der skiller de fattigste 10 % a f befolkningen
fra den øvrige befolkning. Da ét beskrivende mål selvfølgelig ikke ale­
ne kan beskrive en hel fordeling – middelindkomsten er ét tal imod de 5
millioner tal, som indkomstfordelingen består a f – skal man imidlertid
være påpasselig med at overfortolke beskrivende mål.
I kapitel 2 introducerede vi forskellige beskrivende mål, blandt an­
det middelværdi og varians, som kunne bruges til at få et overblik over
en virkelig population. I dette kapitel udvider vi brugen a f disse be­
skrivende mål til stokastiske variabler. Dermed bliver vi i stand til at
beskrive langt flere situationer, hvor der også er usikkerhed involveret,
fx udtrækninger fra superpopulationer.
Beskrivende mål for stokastiske variabler kan inddeles i to klasser.
Den ene klasse bygger på gennemsnitsbetragtninger. Middelindkom­
sten er et eksempel, men man kan også udlede beskrivende mål for
spredningen af en fordeling, som bygger på en gennemsnitsbetragtning.
Overordnet set kaldes denne klasse a f beskrivende mål for momenter.
Den anden klasse a f beskrivende mål bygger på opdelinger af en for­
deling. Et eksempel på et sådant mål er den indkomst, der skiller de
fattigste 10 % a f befolkningen fra den øvrige befolkning. Overordnet
set kaldes denne klasse a f beskrivende mål for f raktiler.
Momenter behandles i afsnit 5.2 og fraktiler i afsnit 5 .3 .1 afsnit 5.4
diskuterer vi, hvordan man kan vælge at bruge beskrivende mål. Vi
ser på beskrivende mål for sammenhænge mellem stokastiske varia­
bler i afsnit 5.5. Igennem hele kapitlet er de beskrivende mål defineret
som beskrivende mål for en fordeling a f en stokastisk variabel i stedet
for som beskrivende mål for en virkelig population, som tilfældet var
i kapitel 2. I afsnit 5.1 vil vi forklare, hvorfor vi vælger denne mere
generelle tilgang i dette kapitel, herunder hvordan sammenhængen er
mellem beskrivende mål for en fordeling a f en stokastisk variabel og
for en virkelig population.
5.1
Beskrivende mål og stokastiske variabler
I kapitel 2 introducerede vi en række beskrivende mål for en virkelig
population. Disse mål inkluderede middelværdien, variansen og medi­
anen og beskrev aspekter ved en eksisterende virkelig population. Det
er idéen bag sådanne beskrivende mål, vi nu vil overføre til stokastiske
variabler, som kan håndtere mere generelle situationer, hvor der er usik­
kerhed involveret, og hvor populationen kan være en superpopulation.
I kapitel 2 definerede vi andelsfunktionen, g (z ), for en virkelig po­
pulation. Den fortæller os, hvordan elementerne i populationen forde­
ler sig, dvs. hvor stor en del a f elementerne i populationen der fx har
indkomsten z 1 z2 z3 osv. Middelværdien for en virkelig population kan
derfor betragtes som en summarisk beskrivelse a f andelsfunktionen.
Vi indførte stokastiske variabler i kapitel 4 for at kunne bearbejd e
komplicerede situationer med usikkerhed. Sandsynlighederne for de
forskellige værdier af en stokastisk variabel er udtrykt i dens fordeling.
Et beskrivende mål for en fordeling a f en stokastisk variabel er derfor
en summarisk beskrivelse af sandsynlighedsfunktionen (eller tætheds­
funktionen, hvis den stokastiske variabel er kontinuert).
Forbindelsen mellem en virkelig population og fordelingen a f en
stokastisk variabel forklarede vi i kapitel 4. Når værdien a f den stoka­
stiske variabel er givet ved værdien a f det element, der udtrækkes fra
en virkelig population, og når alle elementer i populationen har samme
chance for udvælgelse, så er sandsynlighedsfunktionen, f , lig med an­
delsfunktionen, g. Når dette er tilfældet, kan vi tænke på fordelingen af
den stokastiske variabel som en fordeling a f populationen. Faktisk vil
vi i sådanne tilfælde ofte omtale sandsynlighedsfordelingen for den sto­
kastiske variabel som populationsfordelingen, og de beskrivende mål
for populationsfordelingen vil blive kaldt for populationsstørrelser.
Fordelen ved at definere de beskrivende mål ud fra fordelingen af
den stokastiske variabel er, at vi så også kan bruge dem i de situatio-
ner, hvor den stokastiske variabel ikke svarer til en udtrækning fra en
virkelig population. Dette gælder fx i forbindelse med udtrækninger fra
superpopulationer, eller når der er tale om udtrækninger fra virkelige
populationer, hvor alle elementer ikke har samme chance for udvælgel­
se. Lad os illustrere denne tankegang med et par eksempler:
Eksempel 5.1: En virkelig population
I forbindelse med indkomstfordelingen fra starten a f kapitlet kan vi de­
finere følgende eksperiment: „Udvælg en person og lad den stokastiske
variabel, X, angive vedkommendes indkomst.“ Hvis alle personer har
samme chance for udvælgelse, så vil sandsynlighedsfunktionen for X
være lig med andelsfunktionen for populationen. Dermed har X samme
„fordeling“ som populationen. Hvis en andel på 0,1 af befolkningen
tjener mere end 300.000 kr., så er der tilsvarende sandsynligheden 0,1
for, at X antager en værdi større end 300.000. Om vi beskriver forde­
lingen a f populationen eller fordelingen a f X , gør derfor ingen forskel i
dette tilfælde.
■
Eksempel 5.2: En superpopulation
I eksemplet fra kapitel 3 med en 30-årig obligation er kursen i morgen
kl. 12.00 en stokastisk variabel, Y, som har en given sandsynligheds­
fordeling. Der er fx sandsynligheden 0,3 for, at kursen vil ligge under
100. Sandsynlighedsfordelingen for denne variabel kan imidlertid ikke
umiddelbart fortolkes som andele i superpopulationen a f kurser. Men
vi kan stadig beskrive sandsynlighedsfordelingen for Y ved hjælp af en
række beskrivende mål.
■
I mange a f eksemplerne i dette kapitel vil der være den i eksempel 5.1
nævnte sammenhæng mellem fordelingen a f den stokastiske variabel
og en virkelig population. Det er dog vigtigt at huske på, at de beskri­
vende mål også finder anvendelse i en lang række andre situationer,
hvor fordelingen a f den stokastiske variabel ikke svarer til fordelingen
af en underliggende virkelig population, som tilfældet fx er i eksempel
5.2.
5.2
Momenter
Det mest kendte moment for en stokastisk variabel, X, er middelværdi­
en, også kaldet den forventede værdi. Middelværdien betegnes typisk
med bogstavet μ eller E (X ), hvor E’ et står for „expectation” (forvent­
ning). Et andet ofte brugt moment er variansen, som beskriver, hvor
meget de mulige værdier a f X gennemsnitligt er spredt i forhold til mid­
delværdien. Variansen betegnes typisk med σ 2 eller V(X ).
Fortolkningen a f et moment er den samme, uanset om den stokasti­
ske variabel er diskret eller kontinuert. Beregningsteknisk er der dog en
forskel, så vi betragter de to tilfælde separat. Da intuitionen er nemmest
at opnå med en diskret stokastisk variabel, vil afsnittene om kontinuerte
stokastiske variabler primært indeholde de nødvendige formler.
5.2.1
Forventet værdi af en diskret stokastisk variabel
Idéen med en forventet værdi a f en stokastisk variabel, X, er at finde
et tal, som svarer til gennemsnittet a f alle de værdier a f X, man ville
fa, hvis man kunne gentage realiseringen a f X uendeligt mange gange.
Formelt er den forventede værdi a f en diskret stokastisk variabel defi­
neret som:
Den forventede værdi (middelværdien), E ( X ), a f en diskret
stokastisk variabel, X, med sandsynlighedsfunktion, f ( x ) , er gi­
vet ved:
= x 1 f ( x 1 ) + x2 · f(x 2 ) + ··· + xN · f (Nx)
hvor x1, x2, ..., xN er de værdier, X kan antage.
Den forventede værdi er altså en sammenvejning a f alle de mulige vær­
dier, hvor vi vægter med sandsynlighederne for at få de pågældende
værdier. Man kalder også den forventede værdi a f en stokastisk variabel,
X, for middelværdien, og man betegner den med det græske bogstav μ.
Eksempel 5.3: Et terningspil – del 1
Lad X være en stokastisk variabel, der angiver antallet af øjne, når vi
kaster med en terning. Da sandsynligheden for en ener er en sjettedel
osv., er den forventede værdi a f X givet ved:
E (X ) = l ·⅙ + 2 ·⅙ + 3 ·⅙ + 4 ·⅙ + 5 ·⅙ + 6 ·⅙ = 3,5
Middelværdien af et terningslag er således 3,5. Men det er en værdi,
man ikke kan slå med terningen. Fortolkningen af den forventede vær­
di er, at hvis vi kaster terningen mange gange, dvs. gentager eksperi­
mentet, så vil gennemsnittet a f de realiserede værdier af X nærme sig
3,5. Bemærk, hvordan dette harmonerer med fortolkningen a f begrebet
sandsynlighed fra kapitel 3 som andelen af gange, en hændelse indtræf­
fer, når man gentager et eksperiment i det uendelige.
■
Fysisk kan man fortolke middelværdien som et balancepunkt. Hvis man
forestiller sig, at en sandsynlighed er et vægtlod, og sandsynlighedsfor­
delingen er alle vægtlodderne placeret på en vippe, så er middelværdien
det sted, man skal understøtte vippen for at få den i balance. Figur 5.1
illustrerer dette for eksempel 5.3.
Figur 5.1:
Middelværdi
som balance­
punkt
Hvis en fordeling er symmetrisk omkring et punkt, symmetripunktet,
er middelværdien lig med dette symmetripunkt. I eksempel 5.3 er sand­
synlighedsfordelingen symmetrisk omkring punktet 3,5, som det ses i
figur 5.1 : Den ene side af fordelingen er en spejling a f den anden, hvis
man spejler i punktet 3,5.
Eksempel 5.3 er et eksempel på en stokastisk variabel, der antager de
samme værdier som elementerne i den virkelige population, den trækkes
fra, nemlig 1 , 2 , 3 , 4 , 5 og 6. Da alle elementer i populationen har samme
chance for udvælgelse, er sandsynlighedsfunktionen, f , lig med andels­
funktionen, g. Populationen har derfor også middelværdien μ = 3,5.
Som vi så i kapitel 2, svarer denne middelværdi af populationen til,
at vi udregner gennemsnittet for de N elementer, som den virkelige po-
pulation består af. Det sker ved at finde den totale sum og dividere med
antallet a f elementer, N pop
hvor z 1,z 2,...,z N er alle elementerne i populationen. I eksempel 5.3 er
populationsmiddelværdien:
Lad os tage et eksempel
mere:
Eksempel 5.4: En skoleklasse – del 1
Antag, at alle elever i en klasse med 10 elever har samme chance for
udvælgelse, og lad den stokastiske variabel, Y, angive den udvalgtes
højde. Højderne i cm for de 10 elever er som følger: 134, 1 2 8 , 164, 143,
144, 137, 122, 134, 140, 129. Højden 134 cm forekommer i to tilfæl­
de. Dermed udgør denne højde andelen
hvorimod de øvrige højder
i populationen hver udgør en andel på
Højden 134 cm skal derfor
tilskrives sandsynligheden
mens de øvrige 8 højder hver tilskrives
sandsynligheden
Dermed er den forventede værdi a f Y lig med:
Middelværdien a f 7 er således 137,5 cm, som også er populationens
middelværdi.
■
Vi kan også være interesserede i forventningen til en funktion a f en sto­
kastisk variabel. Hvis h ( X ) er en funktion af den stokastiske variabel,
X, så er h ( X) selv en stokastisk variabel, som man kan beregne den
forventede værdi af.
Eksempel 5.5: Et terningspil – del 2
Lad X være den stokastiske variabel fra eksempel 5.3, der angiver
antallet af øjne, når vi kaster en terning. Antag, at terningkastet indgår
i et spil, hvor man får 2 gange antallet a f øjne udbetalt i kroner. Antag
også, at det koster 5 kroner at deltage i spillet. Vi kan da definere en ny
stokastisk variabel, Y, som angiver gevinsten ved spillet. Den er givet
ved: Y = – 5 + 2 · X = h ( X ) . Hvis man slår en ener, så antager X
værdien 1, og Y antager derfor værdien – 5 + 2 · 1 = – 3. Da X kan
antage værdierne 1, 2, 3 , 4, 5 og 6, så kan Y antage værdierne – 3, – 1 , 1,
3, 5 og 7. Det vil sige, at man tjener 7 kroner, hvis man er så heldig at
slå en sekser.
■
Man kan udregne den forventede værdi a f en funktion a f X ved hjælp af
sandsynlighedsfordelingen for X:
Den forventede værdi af en funktion, h( x ) , a f en diskret stoka­
stisk variabel, X, med sandsynlighedsfunktion, ƒ (x ), er givet ved:
h(x1)·f (x1) + h(x2) f(x2)+...+ h(xN) f(xN)
hvor x1,x 2,...,x N er de værdier, X kan antage.
Den eneste forskel i forhold til udtrykket for den forventede værdi a f X
er, at h( x ) har erstattet x.
Eksempel 5.6: Et terningspil – del 3
I eksempel 5.5 kan man således udregne den forventede værdi a f Y som:
E ( Y) = E (–5 + 2 · X )
Den forventede værdi a f spillet, som det koster 5 kr. at deltage i, men
hvor man vinder 2 gange antallet a f øjne i kroner, er således 2 kr. Det
kan man fortolke som den gennemsnitlige gevinst per spil, hvis man
gentog spillet uendeligt mange gange. Et sådant spil vil Danske Spil
med garanti ikke udbyde !
■
Hvis man allerede har udregnet den forventede værdi af X, er der nog­
le særlige tilfælde, hvor man kan udregne den forventede værdi af
h ( X) uden at skulle lave lange beregninger. Disse tilfælde opstår, når
h ( X) = a + b · X , hvor a og b er konstanter. Hvis man fx vil skifte
måleenhed på en stokastisk variabel, X, vil den stokastiske variabel med
den ny måleenhed ofte kunne skrives som Y = b · X . I disse tilfælde
kan vi udtrykke den forventede værdi a f Y direkte som en funktion af
den forventede værdi af X. Præcis hvordan fremgår af følgende regne­
regler:
Regneregler for forventede værdier:
i) E( a ) = a
ii) E( b · X ) = b · E ( X )
i ii) E ( a + b · X ) = E (a) + E ( b · X ) = a + b · E ( X )
hvor X er en diskret stokastisk variabel, og a og b er konstanter.
Der gælder altså følgende: Forventningen til en sum, E (a + b · X) ,
er lig med summen af forventningerne til leddene i summen, E (a) og
E( b · X) . Desuden er forventningen til en konstant, E (a), blot lig med
konstanten selv. Forventningen til en konstant ganget med en stokastisk
variabel, E(b · X) , er lig med konstanten ganget med forventningen til
den stokastiske variabel, b · E ( X ) .
Eksempel 5.7: En skoleklasse – del 2
I eksempel 5.4 ønsker vi nu i stedet at måle elevernes højde i meter.
Dvs. vi definerer en ny stokastisk variabel, Z = 0 ,0 1 · Y , hvor 7 er
variablen fra eksempel 5.4. Hvis Y angiver højden for den udtrukne
person i cm, vil Z derfor give os højden i meter. Middelværdien a f Z er
da: E ( Z ) = 0,01·E ( 7 ) = 0,01 · 137,5 = 1,375.
■
Eksempel 5.8: Et terningspil – del 4
I eksempel 5.5 er 7 en funktion a f X, som opfylder den tred­
je regneregel i boksen ovenfor. Når vi kender middelværdien af
X, kan vi derfor springe den lidt omstændelige udregning i ek­
sempel 5.6 over og i stedet udregne middelværdien a f 7 som:
E ( Y) = E (–5 + 2 · X ) = – 5 + 2 · E ( X ) = – 5 + 2 · 3,5 = 2
■
Det er værd at understrege, at den forventede værdi a f en funktion a f X
E ( h ( X ) ) , generelt ikke er lig med funktionen a f den forventede værdi,
h ( E (X ) . Det næste eksempel illustrerer dette.
Eksempel 5.9: En ikke-lineær funktion
Den stokastiske variabel, X, kan antage værdierne 3 og 5 med sandsyn­
lighed 0,5 for hver af dem. Dermed er E ( X ) = 3 · 0.5 + 5 · 0.5 = 4.
Lad Y = X 2. Da X = 3 med sandsynlighed 0,5, så er Y = 9 med sand­
synlighed 0,5. Tilsvarende e r X = 5 med sandsynlighed 0,5, og dermed
er Y = 25 med sandsynlighed 0,5. Den forventede værdi a f Y er derfor
E ( Y ) = E ( X 2) = 9 · 0.5 + 25 · 0.5 = 17, mens ( E ( X ))2 = 42 = 16.
■
5.2.2
Forventet værdi af en kontinuert stokastisk variabel
For at beregne den forventede værdi a f en kontinuert stokastisk variabel
skal man bruge integralregning. Tænk på eksemplerne 4 .12 og 4.13 fra
sidste kapitel, hvor en virksomhed skulle forudsige næste års varepro­
duktion. Her var sandsynlighederne for de enkelte udfald nul, fordi der
var uendeligt mange udfald. Til gengæld var der en positiv sandsynlig­
hed for en produktion mellem 10 og 11 tons. Som i tilfældet med en
diskret stokastisk variabel skal vi have foretaget en sammenvejning af
sandsynligheder og værdier af udfald. Da sandsynligheden for et be­
stemt udfald er 0 for en kontinuert stokastisk variabel, viser det sig,
at vi i stedet for kan bruge tæthedsfunktionen. Sammenvejningen sker
ved at integrere tæthedsfunktionen ganget med værdierne af udfaldene.
Formelt er beregningsformlen som følger:
Den forventede værdi (middelværdien), E (X ), a f en kontinuert
stokastisk variabel, X, med tæthedsfunktion, f ( x ) , er givet ved:
Vi vil ikke anvende integralregning ret meget i denne bog. Alligevel
kan vi sagtens arbejde med forventede værdier a f kontinuerte stokasti­
ske variabler. Der gælder nemlig de samme regneregler for kontinuerte
stokastiske variabler som for diskrete stokastiske variabler. Disse reg­
neregler er gengivet her:
Regneregler for forventede værdier:
i) E ( a ) = a
ii) E ( b · X ) = b · E ( X )
iii) E ( a + b · X ) = E ( a ) + E ( b · X ) = a + b · E ( X )
hvor X er en kontinuert stokastisk variabel, og a og b er konstan­
ter.
Eksempel 5.10: Vareproduktion – del 1
Lad X være den kontinuerte stokastiske variabel fra eksempel 4 .124.14, som angav virksomhedens vareproduktion næste år. Vi antog, at
alle udfald mellem 10 og 20 tons var lige sandsynlige. Dermed er forde­
lingen symmetrisk omkring 15 tons, så middelværdien a f X er lig med
15 tons. Ved hjælp a f integralregning kan man vise, at dette er korrekt:
= 0,1 –(0 ,5 –202 – 0,5 · 102) = 15
Antag nu, at der går 250 kilo til spilde undervejs i produktionen. Lad
Y være den stokastiske variabel, der angiver nettomængden i kilo:
Y = 1000 · X – 250 , da X er målt i tons, og Y skal måles i kg. M id­
delværdien a f Y kan man finde ved at bruge regnereglerne ovenfor:
E ( Y ) = E ( 1000 · X – 250) = 1000 –E ( X ) – 250 = 1000 · 15 – 250 = 14750 kg.
■
5.2.3
Varians af en diskret stokastisk variabel
Efter at have udregnet middelværdien er man måske interesseret i at
vide, hvor meget værdierne spreder sig omkring middelværdien. An­
tag, at vi har en stokastisk variabel, X, som antager værdierne 40 og
60 med lige stor sandsynlighed. Middelværdien er da E ( X ) = 50. An­
tag, at vi har en anden stokastisk variabel, Y, som antager værdierne 0
og 100, også her med lige stor sandsynlighed. Middelværdien er igen
E ( Y ) = 50, men de to variabler har tydeligvis forskellige fordelinger.
Fordelingen for Y er spredt mere ud end fordelingen fo r X
For at få et beskrivende mål for denne spredning kan man undersø­
ge den forventede kvadrerede spredning omkring middelværdien. Dette
mål kaldes variansen og betegnes med V ( X ) eller σ 2.
Variansen, V(X), a f en stokastisk variabel, X, er defineret som:
V ( X ) = E ( [ x – E ( X )] ) = σ 2
Variansen kan også udregnes som:
V (X ) = E ( X 2) – ( E ( X ) ) 2 = E ( X 2) – μ 2
hvor μ = Ε ( X )
Denne definition gælder, uanset om den stokastiske variabel er diskret
eller kontinuert. Det er beregningen a f de forventede værdier, E ( X 2)
og E ( X ) , som adskiller diskrete og kontinuerte stokastiske variabler.
For en diskret stokastisk variabel kan variansen udregnes som følger:
Variansen af en diskret stokastisk variabel, X , med sandsyn­
lighedsfunktion, f( x ), udregnes som:
= (x1 – μ ) 2 · f (x1) + ... + (xN – μ )2 · f ( xN)
hvor μ = Ε ( Χ ) og x 1, .. . ,x N er de værdier, som X kan antage.
Udregningen a f V( X) er den samme, som hvis vi skulle udreg­
ne den forventede værdi a f den stokastiske variabel, Y, givet ved
Y = h ( X ) = ( X – E ( X ) ) 2 = ( Χ – μ ) 2. Variansen er således en sam­
menvejning a f de enkelte værdier (fratrukket middelværdien og kvadre­
ret), hvor man vægter med sandsynligheden for de pågældende værdier.
Lad os udregne variansen i nogle a f eksemplerne fra tidligere:
Eksempel 5.11: Et terningspil – del 5
I terningspillet fra eksempel 5.3 bliver variansen:
V ( X ) = (1 – 3,5)2 · ⅙ + (2 – 3,5)2 · ⅙ + (3 – 3, 5)2 · ⅙ + (4 – 3,5)2 · ⅙
+ ( 5 – 3,5)2 · ⅙ + ( 6 – 3,5)2 ⅙ = 2,9167
Alternativt kan vi først finde E ( X 2) :
e ( x 2) = 12 ⅙ + 22 ⅙ + 32 ⅙ + 42 ⅙ + 52 ⅙ + 62 ⅙ = 15,167
og udregne variansen som:
V ( X ) = E ( X 2) – μ 2 = 15,167 – 3,52 = 2,9167
■
Eksempel 5.12: En skoleklasse – del 3
For den stokastiske variabel, Y, fra eksempel 5.4 er variansen givet ved:
■
Man kan også som mål for spredningen benytte kvadratroden a f vari­
Denne størrelse kalder man for standardafvi­
ansen:
gelsen, og den er opgjort i de samme måleenheder som den stokastiske
variabel, X, for hvilken den er udregnet:
Standardafvigelsen, σ ( Χ ) , a f en stokastisk variabel, X , med
varians, V(X), er givet ved:
Eksempel 5.13: Et terningspil – del 6
Standardafvigelsen a f den stokastiske variabel, X, fra eksempel 5.11 er
givet ved:
■
Ligesom for middelværdier har vi også nogle regneregler for varianser
og standardafvigelser:6
Regneregler for varians og standardafvigelse:
i) V ( a ) = 0
ii) V (b · X ) = b2 · V ( X ) = b2 · σ 2 ⇒
⇒ σ (a ) = 0
σ ( b · X ) = │b│· σ ( Χ )
iii) V (a + b · X ) = V (b · X ) = b2 · σ 2 ⇒ σ ( a + b · X ) = |b| · σ ( X )
hvor X er en diskret stokastisk variabel, a og b er konstanter og
σ 2 = V(X).
Variansen er således upåvirket af, at der lægges en konstant, a, til. Intui­
tionen er, at en additiv konstant ikke flytter på afstanden mellem de mu­
lige værdier, den stokastiske variabel kan antage. Dermed ændrer kon­
stanten ikke på afstanden mellem de enkelte værdier og middelværdien.
En konstant, b, har derimod betydning, når den ganges på værdierne
a f X. Hvis b er større end 1, vil den sprede værdierne mere og dermed
øge den samlede varians. Reglerne for standardafvigelse fås ved at tage
kvadratroden a f variansudtrykkene.
Eksempel 5.14: Et terningspil – del 7
Variablen Y i eksempel 5 .5 er givet ved: Y = – 5 + 2 · X , hvor vi fra
eksempel 5 .11 ved, at variansen a f X er 2 ,9 1 6 7 . Dermed kan man udreg­
ne variansen af Y ved brug a f regnereglerne:
V ( Y ) = V ( – 5 + 2 · X ) = 2 2· V ( X ) = 4 · 2 ,9 1 6 7 = 11,6 7
6 Man kan udlede disse regler fra reglerne for forventede værdier i afsnit 5.2.1, idet variansen, som nævnt
ovenfor, er at betragte som en forventning til en funktion, h(X).
Standardafvigelsen a f Y bliver følgelig:
■
5.2.4
Varians af en kontinuert stokastisk variabel
Variansen af en kontinuert stokastisk variabel er defineret på nøjagtig
samme måde som for en diskret stokastisk variabel. Den eneste forskel
er måden, den udregnes på. Da middelværdien a f en kontinuert stoka­
stisk variabel involverer integralregning, gør udregningen a f variansen
det også.
Variansen af en kontinuert stokastisk variabel, X , med tæt­
hedsfunktion, f(X ), udregnes som:
hvor μ = E ( X ) .
Regnereglerne for varians og standardafvigelse er de samme som i til­
fældet med en diskret stokastisk variabel:
Regneregler for varians og standardafvigelse:
i) V ( a ) = 0
⇒ σ (a ) = 0
ii) V (b · X ) = b2 · V ( X ) = b2 · σ 2 ⇒ + (b · X ) = |b| · σ ( Χ )
iii) V ( a + b · X ) = V( b · X ) = b2 · σ 2 ⇒ σ ( a + b · X ) = |b| · σ ( Χ )
hvor X er en kontinuert stokastisk variabel, a og b er konstanter
og σ 2 =V ( X ) .
5.2.5
Momenter generelt
Variansen a f en stokastisk variabel, X, er defineret som den forvente­
de værdi a f én bestemt funktion a f denne stokastiske variabel, nemlig
[ X – E ( X )]2. Idéen var at se på den forventede kvadrerede afvigelse
fra middelværdien a f den stokastiske variabel. Men man kunne jo også
opløfte X – E( X ) i tredje eller fj erde potens i stedet for i anden po­
tens. Alle disse muligheder kaldes under ét for momenter og er defineret
i næste boks:
Det k’te moment, mk, a f en stokastisk variabel, X, er: mk = E (Xk)
Det k’te centrale moment,
a f en stokastisk variabel, X, er:
Middelværdien er lig med det første moment: m1 = E ( X 1 ) = E ( X) ,
og variansen er lig med det andet centrale moment:
beskriver,
Det tredje centrale moment,
hvor skæv fordelingen a f X er. Hvis fordelingen a f X er symmetrisk,
så er det tredje centrale moment 0. Endelig sker det også, at man er
interesseret i det fjerde centrale moment:
Det
vægter værdier a f X langt fra middelværdien højt. Derfor bruges dette
beskrivende mål ofte, hvis man vil beskrive sandsynligheden for ekstre­
me værdier i forhold til middelværdien.
Der findes fordelinger, for hvilke der ikke eksisterer momenter. Det­
te kan ske, hvis der er for høj sandsynlighed for ekstreme (dvs. store
negative eller store positive) værdier af den stokastiske variabel. For
at forstå dette kan man bruge billedet a f middelværdien som det punkt,
hvor man skal understøtte en vippe med vægtlodder for at holde den
i balance, se figur 5.1. Hvis der er vægtlodder ekstremt langt ude på
vippen, og disse er for tunge, så brækker vippen. Det næste eksempel
viser en situation, hvor middelværdien a f en stokastisk variabel ikke
eksisterer.
Eksempel 5.15: Ingen middelværdi
Antag at den diskrete stokastiske variabel, X, kan antage følgende vær­
dier: x = 2, 4, 8, 16,..., med sandsynlighederne
Dvs. X kan
antage vilkårligt høje værdier, dog med mindre og mindre sandsynlig­
hed. Først tjekker vi, at f ( x ) rent faktisk er en sandsynlighedsfunkti­
on. Ifølge afsnit 4.2.1 skal sandsynlighederne summere til 1. Man kan
her vise, at den uendelige sum:
faktisk summerer til 1. Da også f (x ) ≥ 0 , følger det a f afsnit 4.2.1, at
f ( x ) er en sandsynlighedsfunktion.
Middelværdien a f en diskret stokastisk variabel er defineret som
summen a f alle de værdier, den stokastiske variabel kan antage, ganget
med deres respektive sandsynligheder. Foretager man denne udregning,
får man:
E ( X ) = 2 · f (2) + 4 · f (4) + 8 · f (8) + 16 · f (16) + ···
Man får altså en uendelig sum a f et-taller og dermed et uendeligt stort
tal. Derfor eksisterer middelværdien a f X ikke i dette tilfælde.
■
For stort set alle de fordelinger, som vi præsenterer senere i denne bog,
eksisterer både middelværdien og variansen.
5.3
Fraktiler
Fraktiler giver en alternativ måde at sammenfatte en fordeling på.
Hvor momenter bygger på gennemsnitsbetragtninger, så bygger frak­
tiler på opdelinger. Den mest anvendte fraktil er medianen. Kort fortalt
er medianen for en stokastisk variabel, X, den værdi, som X er større
end eller lig med med sandsynlighed 0,5 og mindre end eller lig med
med sandsynlighed 0,5. Rent visuelt deler medianen derfor sandsyn­
lighedsfordelingen for X på midten, som illustreret i figur 5.2, hvor
tæthedsfunktionen for en kontinuert stokastisk variabel, X, er afbildet.
Figur 5.2: Tæt­
hedsfunktion
og median
Man kan også finde værdier af X, som opdeler fordelingen på en anden
måde end med 0,5 til hver side. Disse værdier kalder man generelt for
p -fraktiler, hvor p angiver den del a f fordelingen, der ligger til venstre
for p-fraktilen. Den generelle definition a f en p-fraktil, som gælder både
for kontinuerte og diskrete stokastiske variabler, er lidt snørklet. Derfor
tager vi først det letteste tilfælde, som – for en gangs skyld – forekom­
mer, når den stokastiske variabel er kontinuert. For en kontinuert sto­
kastisk variabel, X, er p -fraktilen den (eller de) værdi(er) a f x , som, når
de sættes ind i den kumulative sandsynlighedsfunktion, F (x ) , giver p.
p -fraktilen for en kontinuert stokastisk variabel, X, med ku­
mulativ sandsynlighedsfunktion, F (x ), er en værdi, qp, således
at:
F ( qp) = P
Eksempel 5.16: Vareproduktion – del 2
Den kontinuerte stokastiske variabel, X, fra eksempel 5.10, som angav
en virksomheds varproduktion, havde følgende kumulative sandsyn­
lighedsfunktion, jf. eksempel 4.15:
Medianen (0,5-fraktilen) for X bestemmes som en løsning til
F ( q 0,5) = 0,5 , dvs. 0,1 · (q0,5 – 10) = 0,5, som giver q0,5 = 15.
Medianen er altså den samme som middelværdien i dette tilfælde, jf.
eksempel 5.10. 0,05-fraktilen findes på tilsvarende vis:
F
(q0,05)= 0,05 ⇔
0,1 · (q0,05·– 10) = 0,05 ⇔
q0,05 = 10,5
■
En stokastisk variabel kan dog godt have flere medianværdier (og
p -fraktiler), som illustreret i det følgende eksempel.
Eksempel 5.17: Multiple medianværdier
Antag, at en kontinuert stokastisk variabel, X, har sandsynlighed 0,5 for
at ligge mellem 1 og 2 og sandsynlighed 0,5 for at ligge mellem 3 og
4. Tæthedsfunktionen for X er tegnet i figur 5.3. I dette tilfælde er der
derfor sandsynlighed 0 for, at X antager en værdi mellem 2 og 3. Men
samtidig vil alle værdier mellem 2 og 3 dele sandsynlighedsmassen i to
lige store dele. Derfor vil alle værdier mellem 2 og 3 opfylde kravet til
en 0,5-fraktil ifølge definitionen i boksen ovenfor. Så disse værdier er
alle medianværdier.
Figur 5.3: Tæt­
hedsfunktion
med multiple
medianer
Når man som i eksempel 5.17 har et interval af værdier, som alle op­
fylder kravet til at være en p -fraktil, så vælger man typisk den midter­
ste værdi i intervallet. I eksempel 5.17 bliver 2,5 således medianen. Et
tilsvarende problem har vi, når vi har med diskrete stokastiske variabler
at gøre. Lad os derfor kigge nærmere på dem.
Eksempel 5.18: Et terningspil – del 8
Lad X være den diskrete stokastiske variabel, der angiver antallet a f øjne
ved et temingslag. Vi ved fra tidligere, at sandsynlighedsfordelingen for
X er følgende:
f ( 1) = ⅙ ,
f ( 2) = ⅙ ,
f (3) = ⅙ ,
f (4) = ⅙ ,
f (5 )= ⅙,
f (6) = ⅙
Der er altså sandsynlighed 0,5 for at få en værdi a f X mindre end 3,1,
men der er også sandsynlighed 0,5 for at få en værdi mindre end 3,5. Så
hvilken værdi er medianen? Som i tilfældet med kontinuerte variabler
vælger man typisk den midterste værdi a f det interval a f værdier, der
alle deler sandsynlighedsmassen i to lige store dele. Værdien 3,5 bliver
derfor medianen i dette tilfælde.
■
Hovedproblemet med at formulere betingelsen for en p -fraktil for en
diskret stokastisk variabel stammer fra det faktum, at den kumulative
sandsynlighedsfunktion, F, for en diskret stokastisk variabel er en trap­
pefunktion, se fx figur 4.1. Man kan derfor typisk ikke løse ligningen
F (qp) = p , som er definitionen a f en p -fraktil for en kontinuert sto­
kastisk variabel. Nedenfor giver vi en formel definition af en p -fraktil,
som gælder for både kontinuerte og diskrete stokastiske variabler. For
kontinuerte variabler kan definitionen dog reduceres til den allerede vi­
ste definition i boksen ovenfor:
Definition a f p-fraktil:
For en stokastisk variabel, X, med kumulativ sandsynligheds­
funktion, F ( x ) , er værdien, qp, en p-fraktil, hvis og kun hvis:
i) P ( X < qp) ≤ p
ii) P ( X > q p ) ≤ – p
Den første betingelse siger, at et udfald mindre end p -fraktilen højst
må have sandsynlighed p, mens den anden betingelse siger, at sandsyn­
ligheden for at få et udfald større end p -fraktilen skal være mindre end
eller lig med 1 – p . Denne snørklede definition er nødvendig, fordi den
kumulative sandsynlighedsfunktion for en diskret stokastisk variabel er
en trappefunktion og dermed ikke kontinuert. „Ånden” i en p -fraktil er
dog den samme som i tilfældet med en kontinuert stokastisk variabel.
Eksempel 5.19: Plat og krone
Den diskrete stokastiske variabel, Y, der antager værdien 1, når en mønt
lander på plat, og værdien 2, når den lander på krone, har følgende ku­
mulative sandsynlighedsfunktion:
Lad os prøve at finde den nederste kvartil, som er 0,25-fraktilen.
Hvis vi prøver at bruge definitionen a f en p -fraktil for en kontinu­
ert stokastisk variabel, så vil det ikke virke, da det er umuligt at løse
F (q0,25) = 0, 25 for en værdi a f q025 , se figur 5.4. Men da Y er di­
skret, skal vi bruge den generelle definition a f en p -fraktil. En kandidat
til 0,25-fraktilen er værdien 1. Vi tjekker derfor betingelserne i) og ii)
fra boksen ovenfor. For i) fås P ( Y < 1) = 0 , som er mindre end 0,25.
For ii) fås P ( Y > 1) = 1 – P ( Y ≤ 1) = 1 – 0,5 = 0,5, som er mindre
end 1 – 0,25 = 0,75. Begge betingelser er altså opfyldt, og dermed
er 1 en 0,25-fraktil. Grafisk er 0,25-fraktilen den værdi a f y, hvor F( y )
springer op over 0,25.
■
Figur 5.4:
Kumulativ
sandsynligheds­
funktion og
0,25-fraktil
Afslutningsvis bemærker vi, at fraktiler i modsætning til momenter al­
tid eksisterer. En række fraktiler har endvidere specielle navne, som det
fremgår af boksen nedenfor.
Specielle navne for fraktiler:
q05 kaldes medianen.
q0 25 og q0,75 kaldes kvartiler.
q0,1 q0,9,...q 0,9 kaldes deciler.
q0,01, q0,02,...q0,99 kaldes percentiler.
5.4
Valg af beskrivende mål
En gennemsnitlig beboer i København har færre end to ben. Dette ud­
sagn vækker mistanke om, at en stor miljøkatastrofe må have ramt ho­
vedstaden. Men udsagnet er faktisk korrekt, hvis der bare er én beboer i
København, som kun har ét ben (og ingen har mere end to!). Man skal
derfor være påpasselig med fortolkningen a f beskrivende mål, som for
eksempel en middelværdi, selvom udregningerne er korrekte. Lige så
vigtigt er det at vælge beskrivende mål, som i sammenhængen giver et
relevant billede a f en fordeling. I tilfældet med antal ben blandt de kø­
benhavnske beboere kunne det således være mere interessant at kende
sandsynligheden for, at en tilfældigt udvalgt beboer har to ben.
Et andet eksempel er valget af beskrivende mål for en indkomstfor­
deling. Antag, at den stokastiske variabel, X, angiver en simpel tilfæl­
digt udvalgt indbyggers indkomst. Hvis den forventede værdi a f X er
høj, betyder det så, at man kan konkludere, at indbyggerne er rige? Nej,
det betyder, at de i gennemsnit er rige. Hvis hovedparten a f indbyggerne
er fattige, men de få rige er ekstremt rige, så er middelindkomsten høj.
Medianindkomsten vil derimod være lav, fordi den ikke er særlig påvir­
ket af, at der findes en lille gruppe rige personer. For medianen gør det
ingen forskel, om de rigeste 49 % er lidt rige eller stenrige. Både mid­
delværdien og medianen er gyldige beskrivende mål, men de fortæller
to vidt forskellige historier om de samme indbyggere.
Middelværdien og medianen har det til fælles, at de begge giver et
bud på den centrale tendens i en fordeling. Medianen bygger primært
på sandsynligheden for udfaldene, hvorimod middelværdien medtager
udfaldenes størrelse. Hvilket a f de to mål der giver den bedste beskri­
velse a f fordelingens midte eller den „typiske” observation, afhænger af
det, vi ønsker at undersøge.
I en symmetrisk fordeling er medianen og middelværdien lig hinan­
den. I praksis kan man dog komme til at lave målefejl. For eksempel
kan man i indkomstfordelingen komme til at sætte et 0 for meget på
nogle a f de høje indkomster. Målefejl a f denne type vil typisk påvir­
ke udregningen a f middelværdien mere end udregningen a f medianen.
Man siger derfor, at medianen er mere robust over for sådanne målefejl.
5.4.1
Modalværdi
Et ofte (måske lidt for ofte) brugt beskrivende mål er modalværdien for
en stokastisk variabel. Modalværdien kaldes også typetallet og er den
mest sandsynlige værdi i en fordeling. Hvis den stokastiske variabel er
givet ved en simpel tilfældig udtrækning fra en virkelig population, så
er modalværdien den oftest forekommende værdi i populationen.
Eksempel 5.20: Modalværdi
Antag, at den stokastiske variabel, X, er defineret som udfaldet a f en
simpel tilfældig udtrækning fra følgende population: {1, 2, 3, 4, 5, 6, 7,
8, 9, 10, 1}. I dette tilfælde er modalværdien 1. Til sammenligning er
middelværdien a f X lig med 5,09, og medianen er 5.
■
Eksemplet viser, at man ikke skal fortolke modalværdien som et alter­
nativ til middelværdien eller medianen.
Når man skal beskrive formen a f en fordeling, kan man bruge udtryk­
kene unimodal og bimodal. En unimodal fordeling har sandsynligheden
koncentreret omkring modalværdien og med faldende sandsynligheder,
efterhånden som værdierne kommer længere væk fra modalværdien, se
figur 5.5. For en kontinuert stokastisk fordeling har en unimodal for­
deling således kun én top. Som det også fremgår a f figur 5.5, har en
bimodal fordeling derimod to toppe.
Figur 5.5.
Unimodal
og bimodal
fordeling
5.5
Beskrivende mål for sammenhænge mellem stokastiske variabler
For at sprede risikoen investerer investeringsforeninger i mange forskel­
lige aktier. Nogle aktier har tendens til at gå op, når andre går ned, og
vice versa. Ved at holde flere forskellige aktier kan man således udjæv­
ne store, og potentielt konkursskabende, udsving i de enkelte aktier.
Til at beskrive sammenhænge mellem stokastiske variabler, som fx
aktiekurser, kan man se på deres simultane fordeling. Det gjorde vi i ka­
pitel 4. Men fordi den simultane sandsynlighedsfunktion indeholder al
information om variablernes fordeling, er den svær at bruge til at danne
sig overblik. Nedenfor ser vi derfor på nogle beskrivende mål, som har
vist sig at være yderst nyttige til fx at beskrive sammenhænge mellem
forskellige aktiers kurser.
5.5.1
Forventet værdi af en sum af stokastiske variabler
Afkastet på en aktie kan man beskrive som en stokastisk variabel, X.
Antag, at der også er en anden aktie med afkast givet ved den stokasti­
ske variabel, Y Vi kan nu sammensætte en portefølje (en samling) af
aktier, hvor a er antal aktier af den første type, og b er antal aktier af
den anden type. Dermed vil vores samlede afkast blive givet ved den
stokastiske variabel, Z:
Z = a ·X +b ·Y
Hvad er nu det forventede afkast a f denne portefølje? Dette kan be­
stemmes ud fra følgende generelle formel for den forventede værdi af
en sum af stokastiske variabler, som både gælder for diskrete og for
kontinuerte variabler:
Den forventede værdi af en sum af stokastiske variabler (di­
skrete eller kontinuerte) er givet ved:
Ε ( a · X + b · Y) = E ( a · X ) + E ( b · Y) = a · E ( X ) + b · Ε ( Υ )
hvor a og b er konstanter.
Den forventede værdi af summen a f to stokastiske variabler afhænger
ikke af, hvordan de to stokastiske variabler samvarierer. Den afhæn­
ger udelukkende a f de to stokastiske variabiers individuelle forventede
værdier.
Det forventede afkast af porteføljen, Z, er derfor lig med det forven­
tede afkast a f de a X -aktier og de b Y-aktier:
E(Z) = a · E(X) + b · E(Y)
5.5.2
Kovarians
Et mål for risikoen a f en portefølje er variansen a f porteføljen,
V ( Z ) = V (a · X + b · Y) . Variansen a f en sum a f stokastiske varia­
bler, uanset om disse er diskrete eller kontinuerte, afhænger a f variansen
af hver enkelt stokastisk variabel, men også a f kovariansen. I kapitel 2
udregnede vi kovariansen mellem to populationskarakteristika. Kova­
riansen mellem to stokastiske variabler er tilsvarende defineret som:
Kovariansen, C ov(X , Y), mellem to stokastiske variabler, X og
Y, er defineret ved:
C o v ( X , Y) = Ε [ ( Χ – μ X ) · ( Y – μ Y)]
hvor μ X = E ( X ) og μ Y = E ( Y ) . En alternativ formel for udreg­
ning af kovariansen er:
C o v ( X ,Y ) = E ( X · Υ ) – μ X · μ Y
Udregningen af de forventede værdier er forskellig alt efter, om de sto­
kastiske variabler er diskrete eller kontinuerte. For to diskrete stokasti­
ske variabler kan man udregne kovariansen som:
Kovariansen mellem to diskrete stokastiske variabler, X og
7, udregnes som:
eller:
hvor μ X = E ( X ) , μ Y = Ε ( Υ ), og f ( x , y ) er den simultane sand­
synlighedsfunktion.
Sumtegnene
betyder, at der summeres over alle kombinatio­
ner a f værdier, som X og Y kan antage
Kovariansen udtrykker noget om, hvordan de to variabler samvarie­
rer. En positiv kovarians betyder, at høje værdier a f 7 er mest sandsyn­
lige sammen med høje værdier a f X, og tilsvarende at lave værdier a f 7
er mest sandsynlige sammen med lave værdier a f X. Omvendt betyder
en negativ kovarians, at lave værdier a f X er mest sandsynlige sammen
med høje værdier a f Y og omvendt.
Det følgende eksempel illustrerer udregningen af en kovarians for to
diskrete stokastiske variabler:
Eksempel 5.21: Markedsudvikling og virksomhedsfallit
Betragt de stokastiske variabler, X og Y, fra afsnit 4.3, som angav hen­
holdsvis, om en virksomhed gik fallit ( X = 0) eller ej (X = 1), og om
markedet blev ugunstigt (Y = 0) eller gunstigt ( Y = 1). Deres simultane
sandsynlighedsfunktion var givet i tabel 4.2. Kovariansen for disse to
variabler findes ved først at beregne de forventede værdier:
μ X = E ( X ) = 0 · f X (0) + 1 · f X ( 1) = 0 · 0,3 + 1 · 0,7 = 0,7
μ Y = E ( Y ) = 0 · f Y (0) + 1 · f Y (1) = 0 · 0,4 + 1 · 0,6 = 0,6
hvor man skal huske, at det er de marginale sandsynligheder, der anven­
des. Dernæst beregnes E (X · Y ):
= 0 · 0 · f (0 ,0 ) + 1 · 0 · f (1,0 ) + 0 · 1 · f ( 0 ,1) + 1 · 1 · f (1,1)
= 0 ·0 ·0 ,2 + 1 ·0 ·0 ,2 + 0 ·1 ·0 ,1 + 1 ·1 ·0 ,5 = 0 ,5
Dermed bliver kovariansen givet ved:
C o v ( X , Y ) = E ( X · Y) – μ X · μ Y = 0,5 – 0,7 · 0,6 = 0,08
■
I eksempel 5.21 er kovariansen lig 0,08. Dette fortæller os, at der er
størst chance for fallit (X = 0), når markedet er ugunstigt ( Y = 0), og
størst chance for at undgå fallit ( X = 1), når markedet er gunstigt (Y = 1).
Når man skal udregne kovariansen mellem to kontinuerte stokastiske
variabler, skal man bruge integralregning. Sumtegnene i udregningen af
kovariansen mellem to diskrete stokastiske variabler skal udskiftes med
integraltegn, og den simultane sandsynlighedsfunktion skal udskiftes
med den simultane tæthedsfunktion. Fortolkningen er dog nøjagtig som
før:
Kovariansen mellem to kontinuerte stokastiske variabler, X
og 7, udregnes som:
C o v ( X , Y ) = ∬x,y (x – μ x ) · ( y – μ Y) · f ( x , y ) dydx
eller:
C o v ( X , Y ) = (∬x,y x · y · f ( x , y ) dydx) – μ X · μ Y
hvor μ X = Ε ( Χ ) , μ Y = E ( 7), og f (x ,y ) er den simultane tæt­
hedsfunktion.
Vi har også nogle regneregler for kovarianser, som gælder, uanset om
de stokastiske variabler er kontinuerte eller diskrete. Disse er:
Regneregler for kovarianser:
i)
C o v ( X , Y ) = Co v ( Y , X )
ii) C ov(a · X , b · Y) = a · b · Cov( X , Y )
iii) Cov(a + X , b + Y ) = Co v ( X , Y )
iv) C o v (X + Z , Y ) = C o v ( X ,Y ) + C o v (Z ,Y )
hvor X, Y, og Z er (diskrete eller kontinuerte) stokastiske varia­
bler, og a og b er konstanter.
Vi er nu klar til at præsentere udtrykket for variansen a f en sum a f sto­
kastiske variabler og dermed variansen på vores aktieportefølje:
V( Z) = V( a · X + b · Y )
Variansen af en sum af stokastiske variabler:
V ( a · X + b · 7 ) = V ( a · X ) + V( b · Y) + 2 · C ov(a · X , b · Y)
= a2 · V ( X ) + b2 · V ( Y ) + 2· a ·b · C o v ( X , Y )
Her har vi i det sidste skridt udnyttet regel ii) fra boksen med regne­
regler for kovarianser. Variansen a f en sum af stokastiske variabler er
således lig med summen a f varianserne plus to gange kovariansen.
Eksempel 5.22: Risikodiversificering – del 1
Lad X og Y være to kontinuerte stokastiske variabler, som angiver det
fremtidige afkast på to forskellige aktier: AktieX og AktieY. Vi antager, at
middelværdierne a f X og Y begge er lig med 4, og varianserne, V ( X) og
V ( Y ) , begge er lig 2. Dermed kan effekten af kovariansen nemmest il­
lustreres. Antag, at kovariansen mellem X og Y er lig med –1. Hvis man
vælger at købe 2 stk. af AktieX, får man således et forventet afkast på:
E (2 · X ) = 2 · E (X ) = 2 · 4 = 8
med en varians på:
V (2 · X ) = 4 · V ( X ) = 4 · 2 = 8
Man får samme forventede afkast og varians, hvis man i stedet køber 2
stk. af AktieY, da vi antog, at den havde samme middelværdi og varians
som AktieX. Køber man derimod 1 stk. a f hver aktie, har man et forven­
tet afkast på:
E ( X + Y) = E ( X ) + E ( Y ) = 4 + 4 = 8
hvilket er det samme, som hvis man havde enten to aktier a f type X eller
to a f type Y. Variansen på porteføljen er derimod:
V ( X + Y) = V ( X ) + V ( Y ) + 2 · C o v ( X ,Y ) = 2 + 2 + 2 · (– 1) = 2
hvilket er fire gange mindre, end hvis man havde enten to aktier af
type X eller to a f type Y. Ved at sprede investeringen over to aktier kan
man således reducere variansen på afkastet, uden at det går ud over det
forventede afkast! Årsagen er, at når X giver et lavt afkast, så giver Y
typisk et højt afkast. På denne måde nedsætter man sandsynligheden for
store udsving i det samlede afkast.
■
5.5.3
Korrelationskoefficient
Et problem med kovariansen som mål for samvariationen mellem to
stokastiske variabler er, at dens størrelse afhænger a f måleenheden for
de stokastiske variabler. Ganger vi de stokastiske variabler, X og Y, med
to konstanter, a og b, så ganger vi også kovariansen op med disse:
Cov(a · X ,b · Y) = a · b · C o v ( X , Y )
Dette følger a f regneregel ii) ovenfor. Hvis man således omdefinerer
X fra fx centimeter til meter, som vi gjorde i kapitel 4, så ændrer man
også kovariansen mellem X og Y. For at få et mål for samvariationen,
der er uafhængigt a f sådanne ligegyldige transformationer a f de sto­
kastiske variabler, anvender man ofte korrelationskoefficienten. Denne
findes ved at dividere kovariansen med kvadratroden a f produktet af
varianserne:
Korrelationskoefficienten, ρ ( X, Y), for to stokastiske variabler,
X og Y, er givet ved:
Korrelationskoefficienten har samme fortegn som kovariansen, men vil
altid ligge mellem –1 og 1. Hvis korrelationskoefficienten er 1 eller
–1 siges de to variabler at være henholdsvis perfekt positivt og perfekt
negativt korrelerede.
Eksempel 5.23: Risikodiversificering – del 2
Korrelationskoefficienten for X og Y fra eksempel 5.22 kan beregnes til:
■
I afsnit 4.3.5 introducerede vi begreberne afhængighed og uafhængig­
hed mellem to stokastiske variabler til at analysere sammenhængen
mellem dem. Uafhængighed er et stærkere begreb end kovarians, idet
uafhængighed mellem to stokastiske variabler medfører, at kovariansen
mellem dem er 0. En kovarians mellem to stokastiske variabler på 0
medfører derimod ikke, at de er uafhængige. Denne forskel er illustreret
i en a f opgaverne til kapitlet.
5.6
Opgaver
1. Repetitionsspørgsmål:
a) Nævn de forskellige momenter, vi har stiftet bekendtskab med i
dette kapitel.
b) Hvordan udregnes den forventede værdi a f en diskret stokastisk
variabel?
c) Hvad er forskellen på variansen og standardafvigelsen a f en sto­
kastisk variabel?
d) Hvad er en fraktil?
e) Hvad udtrykker kovariansen mellem to stokastiske variabler?
Hvordan udregnes den?
f) Hvad er sammenhængen mellem kovariansen og korrelationsko­
efficienten?
g) Hvilke værdier kan korrelationskoefficienten antage?
h) Hvordan udregnes forventningen af en sum a f stokastiske vari­
abler?
i) Hvordan udregnes variansen a f en sum a f stokastiske variabler?
2. Lad X være en diskret stokastisk variabel med sandsynlighedsfunk­
tion som i tabellen.
a) Bestem den forventede værdi a f X .
b) Find E (2 + 5,4 · X ) og E(√ X ) .
c) Beregn V ( X ) .
d) Hvad er variansen a f 3 · X ?
x
f ( x) = P (X = x)
1
0,12
0
3
0,43
4
0,07
5
0,30
0,08
3. Lad Y være en kontinuert stokastisk variabel med: E ( Y ) = 3,2 og
E ( Y 2) = 14,1.
a) Beregn variansen og standardafvigelsen a f Y.
b) Find også variansen a f 7 · Y + 0,25.
c) Beregn E (7 + 2 · Y 2).
4. I et lotteri findes tre slags lodder, hvor gevinsten er henholdsvis 0 kr.,
100 kr. og 100.000 kr. Der findes 90.000 lodder a f den første type,
9.999 a f den anden type og kun ét a f den tredje type.
a) Hvad er den forventede gevinst på et tilfældigt udtrukket lod?
b) Antag, at alle lodder sælges. Hvad skal et lod da mindst koste, for
at lotteriet gennemføres uden tab for arrangøren?
c) Et lod koster 25 kr. Hvad er det forventede overskud for arrangø­
ren, hvis der sælges 9000 lodder?
5. En stokastisk variabel, X, har middelværdi 10 og varians 50.
a) Beregn middelværdi og varians a f den stokastiske variabel,
Y = 10 + 5 · X .
b) Find middelværdien a f Y = ( X – 10)2 og Z = X 2 (udnyt at
V( X) = Ε ( X2) – [E(X)]2).
6. Lad X og Y være to kontinuerte stokastiske variabler med følgende
fordelingsfunktioner:
a) Find medianen for henholdsvis X og Y.
b) Find 0,05-fraktilen og 0,95-fraktilen for X og Y.
7. Lad Y være en stokastisk variabel, der kan antage syv forskellige
værdier. Fordelingsfunktionen (den kumulative sandsynligheds­
funktion) for Y er givet i tabellen nedenfor.
a) Bestem medianen for Y.
b) Find 0,1-fraktilen og 0,75-fraktilen.
y
F( y) = P(Y ≤ y )
0
0,0083
1
0,0692
2
0,2553
3
0,5585
4
0,8364
5
0,9723
6
1
8. Betragt eksperimentet fra opgave 4 i kapitel 4, hvor X og Y var sto­
kastiske variabler (indikatorer) for henholdsvis køn og arbejdsskift
med simultane sandsynligheder som i tabellen nedenfor.
a) Beregn kovariansen mellem X og Y.
b) Find korrelationskoefficienten for X og Y.
c) Hvad fortæller dine resultater dig om sammenhængen mellem
køn og arbejdsskift?
Y= 1
Y =0
X= 1
0,35
0,23
X=0
0,15
0,27
9. Lad X o g Y være to stokastiske variabler med simultane sandsynlig­
heder som i tabellen nedenfor.
a) Beregn kovariansen mellem X og Y.
b) Er X og Y uafhængige?
c) Find den marginale sandsynlighedsfunktion fo r X .
d) Find også den betingede sandsynlighedsfunktion for X givet
Y = 1.
e) Fortolk dine resultater.
f) Find de forventede værdier af X og Y.
g) Find varianserne a f X og Y.
h) Lad den stokastiske variabel Z være givet ved Z = 2 · X + 3 · Y .
Beregn den forventede værdi og variansen a f Z .
Y=0
Y= 1
Y= 2
X=0
0,15
0,1
0,15
X=1
0,1
0,0
0,1
X=2
0,15
0,1
0,15
10. Lad X og Y være to stokastiske variabler med E ( X ) = 2,3 og
E ( Y ) = 1,4 . Lad endvidere standardafvigelserne a f X og Y være
henholdsvis 1,1 og 0,8, mens kovariansen er 0,2.
a) Beregn den forventede værdi a f Z = 2 · X + 3.3 · Y.
b) Find variansen a f Z.
6
Populære fordelinger
I kapitel 4 introducerede vi stokastiske variabler som en måde at re­
præsentere udfald a f et eksperiment på. De stokastiske variabler kunne
være både diskrete (fx terningslag) og kontinuerte (fx varemængder). I
dette kapitel skal vi se på nogle hyppigt forekommende typer a f forde­
linger for stokastiske variabler. Selvom en stokastisk variabel kan have
en hvilken som helst fordeling, så viser det sig, at der er nogle bestemte
fordelinger, som vi ofte støder på i praksis.
Mange a f de anvendelige fordelinger kan man beskrive relativt sim­
pelt. I de foregående kapitler har vi til enhver mulig værdi a f en stoka­
stisk variabel opskrevet en tilhørende sandsynlighed. Det har vi typisk
gjort i tabelform, hvis der er flere end to værdier. Men hvis en stokastisk
variabel kan antage mange værdier, kræver det en stor uoverskuelig
tabel at specificere fordelingen. I nogle tilfælde kan man i stedet speci­
ficere fordelingen a f en stokastisk variabel ved hjælp af få parametre.
Når de er beskrevet, kan man udregne sandsynligheden for alle mulige
værdier af den stokastiske variabel ved blot at indsætte i en formel. De
fordelinger, vi støder på i dette kapitel, kan alle specificeres ved hjælp
af en formel og nogle få parameterværdier.
I afsnit 6 .1 til 6.4 skal vi kigge på fire forskellige diskrete fordelin­
ger, mens vi i afsnit 6.5 skal stifte bekendtskab med normalfordelingen,
som er en fordeling for en kontinuert stokastisk variabel. Endelig skal
vi i afsnit 6.6 kigge på en simultan fordeling for flere diskrete stokasti­
ske variabler.
6.1
Bernoullifordelingen
En diskret stokastisk variabel, X siges at følge en Bernoullifordeling,
hvis: i) der er to mulige udfald, dvs. X kan antage to værdier (typisk
1 og 0), og ii) sandsynlighederne for, at den antager de to værdier, er
henholdsvis p og 1 – p. Vi siger da, a t X er Bernoullifordelt med para­
meteren p. Det skrives: X ~ B er(p ), hvor„ ~ “ læses som „fordelt“.
Figur 6.1:
Bernoulli­
fordelingen
Ofte betegner man de to mulige udfald for X som henholdsvis „succes“
(når X = 1) og „fiasko“ (når X = 0). De to betegnelser skal dog ikke
forstås således, at det ene udfald nødvendigvis er bedre end det andet.
Det er blot en måde, man har valgt at benævne udfaldene på. Alternativt
siger man, at X „har egenskaben“ (når X = 1) eller „ikke har egenska­
ben“ (når X = 0). Men det er blot en anden talemåde for det, der grund­
læggende er det samme, nemlig at X kan antage to og kun to værdier.
Der er – måske lidt overraskende – mange populationer, som leder
frem til Bernoullifordelte stokastiske variabler. Her er tre eksempler.
Eksempel 6.1: Plat og krone – del 1
Til eksperimentet „at kaste med en mønt“ er populationen: „krone“ og
„plat“. Vi kan definere en stokastisk variabel, X, således, at den anta­
ger værdien 1 i tilfælde a f krone (succes) og værdien 0 i tilfælde af
plat (fiasko). Hvis plat og krone er lige sandsynlige, dvs. hvis møn­
ten ikke er skæv, så er X Bernoullifordelt med parameteren p = ½ dvs.
X ~ Ber(½).
■
Eksempel 6.2: Ja eller nej
Hvis vi stopper en tilfældig dansker på gaden og spørger vedkommen­
de, om han (eller hun) stemmer ja eller nej ved en kommende afstem­
ning, og vi antager, at der kun er disse to svarmuligheder, og at alle po­
tentielle respondenter har taget stilling til spørgsmålet, så ingen svarer
„ved ikke“, så har vi at gøre med en population bestående a f ja-sigere
og nej-sigere. Vi kan derfor definere en stokastisk variabel, X, der tager
værdien 1, hvis personen viser sig at være en ja-siger, og værdien 0,
hvis det er en nej-siger. Da er X Bernoullifordelt med parameteren p,
hvor p er andelen i populationen, der stemmer ja.
■
Eksempel 6.3: Vejret i morgen
Lad Y være en stokastisk variabel, der antager værdien 1, hvis det regner
i morgen, og værdien 0, hvis det ikke gør det. Den tilhørende population
er en superpopulation med elementerne „regn“ og „ikke-regn“. Dermed
er Y Bernoullifordelt med parameteren p, hvor p er sandsynligheden for
regn i morgen (hvordan denne sandsynlighed så end er bestemt).
■
Som de ovenstående eksempler illustrerer, er Bernoullifordelingen re­
levant i situationer, hvor vi udvælger et element fra en population med
to typer af elementer. Det kan være fra en virkelig population med to
elementer, som i eksempel 6.2 med den danske befolkning, eller en
superpopulation, som i eksempel 6.3 med regnvejret. Populationer med
kun to typer a f elementer kaldes også Bernoullipopulationer.
En Bernoullipopulation er en virkelig population eller en su­
perpopulation, der består a f to typer a f elementer: succeser og
fiaskoer.
Vi kan også finde beskrivende mål for en stokastisk variabel, som er
Bernoullifordelt. Fordi der kun er to mulige værdier for en sådan sto­
kastisk variabel, kan man let udregne middelværdien og variansen ved
hjælp a f de metoder, vi præsenterede i kapitel 5:
E (X ) = 1 · p + 0 · (1 – p ) = p
E (X 2) = 12 · p + 02 · (1 – p ) = P
V (X ) = E (X 2) – [E (X )]2 = p – p 2 = p · (1 – p )
Lad os opsummere egenskaberne for en Bernoullifordelt stokastisk va­
riabel i en boks:
Bernoullifordelingen, X ~ Ber(p )
Sandsynlighedsfunktion:ƒ(1 ) = p og f(0 ) = 1 – p
Middelværdi og varians: E (X ) = p og V(X ) = p · (1 – p )
Fortolkning: X angiver udfaldet a f en udtrækning fra en Ber­
noullipopulation, hvor X = 1 er succes, X = 0 er fiasko, og p er
sandsynligheden for en succes.
6.2
Binomialfordelingen
Binomialfordelingen fremkommer, når man udtrækker n elementer
uafhængigt a f hinanden fra en Bernoullipopulation. På den måde har
hver udtrækning sandsynligheden p for succes. Dvs. hvis Χ 1 er den
stokastiske variabel for udfaldet a f den første udtrækning, således at
X 1 = 1 angiver en succes, så er X 1 Bernoullifordelt med parameteren
p: X 1 ~ Ber(p ) . Tilsvarende er X 2 ~ Ber(p ) , hvor X 2,angiver udfal­
det a f den anden udtrækning, osv. op til X n.Den stokastiske variabel,
Y, der angiver antallet a f succeser i de n udtrækninger, siges da at være
binomialfordelt med parametrene n og p. Vi skriver det på følgende
måde: Y ~ Bin(n, p ) , hvor n er antallet a f udtrækninger, o g p er sand­
synligheden for succes i hver af de n udtrækninger.
Eksempel 6.4: Plat og krone – del 2
Hvis vi slår plat eller krone fem gange og definerer den stokastiske vari­
abel Y som antallet a f „kroner“ i de fem forsøg, så er Y binomialfordelt
med n = 5 og p = ½ : Y ~ Bin (5 , ½).
■
Hvis Y er binomialfordelt med parametrene n og p, så betyder det, at
Y kan antage værdierne 0 ,1 ,2 ,...,n . Mere specifikt antager Y værdi­
en 0, hvis ingen a f de n udtrækninger resulterer i en succes, dvs. hvis
X 1 = 0 , X 2 = 0 ,..,
X n = 0. Derimod antager Y værdien n, hvis
alle de udtrukne er succeser: X 1 = 1, X 2 = 1, ..., X n = 1. Vi kan
derfor generelt skrive Y som:
Den værdi, Y antager, er således lig med antallet a f succeser i de n ud­
trækninger, dvs. summen a f X i ’erne.7
Binomialfordelingen fremkommer altså som fordelingen a f en sum
a f uafhængige Bernoullifordelte stokastiske variabler. Som vi skal se
senere, er den yderst anvendelig, når man fx udarbejder meningsmålin­
ger for ja/nej-valg (som fx en EU-afstemning) eller efterspørgselspro­
gnoser for køb/ikke-køb a f en vare. I disse tilfælde udvælger man en
stikprøve fra en Bernoullipopulation bestående a f enten ja- og nej-sigere eller købere og ikke-købere.
Vi mangler imidlertid at finde en formel for sandsynlighedsfordelin­
gen for Y. Næste eksempel viser, hvordan denne formel kan opbygges.
7 Dette illustrerer også, hvorfor det er hensigtsmæssigt at kode de to mulige udfald for Xi som 0 og 1 i
stedet for fx 13 og 17.
Eksempel 6.5: Plat og krone – del 3
Forestil dig, at vi slår plat eller krone to gange, og lad Y være antallet
a f „kroner“ i de to kast. Da er Y binomialfordelt med n = 2 og p =½
dvs. Y ~ Β in (2 ,½). Lad X ivære udfaldet af det i’te kast, således at X 1= 1,
hvis det første kast bliver krone, og X 1= 0, hvis det bliver plat, og tilsva­
rende for X 2. Da er Y lig med summen a f X 1,o g X 2: Y = X 1 + X 2. Fordi
de to kast er uafhængige, ved vi endvidere fra kapitel 4, at deres simulta­
ne sandsynlighed, ƒ (x 1, x2), er lig med produktet a f de marginale sand­
synligheder,
Sandsynligheden for at slå to gange krone er lig med sandsynligheden
for at slå krone i det første slag ganget med sandsynligheden for krone
i det andet slag osv. De forskellige mulige udfald a f eksperimentet med
tilhørende sandsynligheder og værdier af Y kan derfor sammenfattes i
følgende tabel:
X2
Tabel 6.1:
Sandsynlig­
heder for to
gange plat og
krone
Sandsynlighed
X1
1
1
1
0
0
0
1
0
p · p = ½·½ = ¼
p · (1 – p ) = ½·½= ¼
( 1 – p ) · p =½
·½
=¼
( 1 – p ) · ( 1 – p ) = ½·½ = ¼
Y
2
1
1
0
Lad sandsynlighedsfunktionen for Y være f Y(y ). Den kan da skrives
som:
f Y(2) = ¼
fY(1) = ¼ + ¼ =
½fY(0) = ¼
Sandsynligheden for Y = 1 er lig med summen af to sandsynligheder fra
tabel 6 .1, idet der er to kombinationer a f udfald af Χ 1 og Χ 2, der begge
giver Y = 1, nemlig hvis man først slår plat og dernæst krone eller først
krone og dernæst plat.
■
Eksempel 6.5 illustrerer, at sandsynlighedsfordelingen for Y afhænger
af det antal situationer, der kan lede til det samme antal succeser i n
udtrækninger. Dette kaldes også antal kombinationer i statistikkens ver­
den. Vi kan altså sige, at hvis Y ~ Bin(n , p ) , så er f Y(y ) , hvor y er
et helt tal, givet ved:
f Y(y ) = „antal kombinationer a f værdier a f X 1’ere der giver Y = y ”
„sandsynligheden for en sådan kombination”.
I eksempel 6.5 er der to kombinationer a f værdier a f X 1og X 2, som giver
Y = 1. Sandsynligheden for hver a f disse kombinationer er (½)2. Derfor
f Y ( 1 ) = 2 (½)2 = ½.
Mere generelt kan vi finde antallet a f kombinationer, der giver k succes­
er i n udtrækninger, ved hjælp a f følgende formel:
hvor „n !“ udtales „n fakultet“ og beregnes som:
n ! = n · (n – 1) · ( n – 2) · ... · 2 · 1.
Eksempel 6.6: Fakultet!
4! = 4 · 3 · 2 · 1 = 24 og 2! = 2 · 1 = 2 og 0!=1. Det sidste er en defini­
tion.
■
Eksempel 6.7: Plat oq krone – del 4
I eksempel 6.5 fandt vi, at der var to måder, hvorpå man kunne få én krone
(k = 1) i to forsøg (n = 2). Lad os kontrollere, at formlen også giver os
dette:
■
Eksempel 6.8: Binomialkoefficienten
Der er altså seks måder, hvorpå man kan udtrække to succeser i fire ud­
trækninger, fx 2 gange „krone“ i fire kast med en mønt. En måde kunne
være: plat-krone-plat-krone, en anden: plat-plat-krone-krone. Opskriv
selv de seks forskellige kombinationer.
■
Binomialkoefficienten er vores generelle formel til at beregne antallet
a f kombinationer i n udtrækninger, der giver k succeser. Så mangler vi
blot at finde sandsynligheden for hver a f disse kombinationer. Da de
enkelte elementer er udvalgt uafhængigt, så ved vi, at sandsynligheden
for en given kombination a f X i’ere er lig med produktet a f deres margi­
nale sandsynligheder.
Eksempel 6.9: Plat og krone – del 5
Sandsynligheden for at slå plat-plat-krone-krone i fire (uafhængige)
kast med en mønt er således:
½
= · (½½· ½) 4· ½
■
Eksempel 6.10: Kombinationssandsynlighed
Hvis vi trækker fem uafhængige gange fra en Bernoullipopu­
lation med p = 0,3, så er sandsynligheden for først at få to suc­
ceser, dernæst to fiaskoer og til sidst én succes givet ved:
0,3 · 0,3 · ( 1 – 0,3) · ( 1 – 0,3) · 0,3 = (0,3)3 · ( 1 – 0,3)5–3
■
Generelt er sandsynligheden for en given kombination a f k succes­
er og n – k fiaskoer i n uafhængige udtrækninger givet ved formlen:
p k · ( 1 – p )n–k, hvor p er sandsynligheden for succes i hver udtræk­
ning. Vi kan derfor skrive sandsynligheden for, at Y er lig med k, som
følger:
hvor
er antallet a f kombinationer, der giver k succeser, og
p k · (1 – p )n–k er sandsynligheden for hver a f disse kombinationer.
Dette er sandsynlighedsfunktionen for en B in( n , p ) stokastisk varia­
bel, Y. Bemærk, at hvis n er lig med fx 100, kan Y antage 101 forskel­
lige værdier med tilhørende 101 forskellige sandsynligheder. Men vi
behøver kun at kende n og p for at kunne bruge formlen ovenfor til at
udregne alle disse 101 sandsynligheder.
Vi kan også beregne beskrivende mål for en binomialfordelt varia­
bel ligesom i kapitel 5. Her udnytter vi, at Y er en sum a f uafhængige
stokastiske variabler: Y = X 1 + ... + X n . Dermed er middelværdien
af Y givet ved:
E (Y ) = E (X 1 + ... + X n) = E (X 1) + ... + E (X n) = p + ... + p = n · p
mens variansen a f Y er:
V (Y ) = V (X 1 + ... + X n) = V (X 1) + ... + V (X n)
= p · (1 – p ) + ... + p · (1 – p ) = n · p · (1 – p )
Variansen a f X 1 + ... + X n er her blot lig med summen a f de enkelte
varianser, idet X i’erne er uafhængige og kovarianserne dermed nul, jf.
regnereglerne i kapitel 5.
Vi opsummerer binomialfordelingen i en boks:
Binomialfordelingen, Y ~ Bin(n, p )
Sandsynlighedsfunktion:
k = 0,1,2,...,n
Middelværdi og varians: E ( Y) = n · p og V( Y) = n · p · (1 – p )
Fortolkning: Y angiver antal succeser blandt n uafhængige
udtrækninger fra en Bernoullipopulation, hvor der er konstant
sandsynlighed, p, for succes i hver udtrækning.
Eksempel 6.11 : Plat og krone – del 6
Hvad er sandsynligheden for tre gange krone i eksempel 6.4, hvor
Y ~ B i n ( 5 , ½)?
Middelværdien og variansen a f Y er i dette tilfælde:
E ( Y ) = 5 · 0,5 = 2,5 og
V (Y ) = 5 · 0,5 · (1 – 0,5) = 1,25
■
Eksempel 6.12: Fødselsdag på en mandag
Forestil dig, at vi har et selskab på syv personer. Hvad er sandsynlig­
heden for, at to a f de syv personer er født på en mandag? Hvis de syv
personers fødselsdage er uafhængige (altså ingen tvillinger i selska­
bet), kan hver enkelt person ses som en udtrækning fra en Bernoulli­
population af „mandagsfødte“ og „ikke-mandagsfødte“. p = 1/7 må da
være sandsynligheden for at trække en mandagsfødt (en succes). Den
stokastiske variabel, Y, der angiver antallet a f mandagsbørn i selskabet,
er derfor binomialfordelt med n = 7 og p = 1/7. Dermed bliver sand­
synligheden for, at to personer i selskabet er født en mandag, givet ved:
Hvad er nu sandsynligheden for, at mindst to har fødselsdag en man­
dag? Denne sandsynlighed er lig med 1 minus sandsynligheden for, at
højst én har fødselsdag en mandag. Dvs:
P (Y ≥ 2) = 1 – P (Y ≤ 1) = 1 – P (Y = 1) – P( Y = 0)
= 1 – 0 ,4 0 – 0,34 = 0,26
■
Bemærk, at hvis Bernoullieksperimentet foregår ved, at vi trækker fra
en virkelig population, fx udvælger en elev fra en klasse, betyder an­
tagelsen om uafhængighed mellem de enkelte udtrækninger, at vi må
trække med tilbagelægning, for at de enkelte udtrækninger kan blive
uafhængige. Når vi har trukket den første elev og observeret, om ved­
kommende er en pige (succes) eller en dreng (fiasko), må vi altså „læg­
ge personen tilbage“ i populationen, før vi trækker igen. I princippet har
vi derfor mulighed for at trække den samme person to gange.
Hvad ville der ske, hvis vi ikke lagde personen tilbage? Antag, at den
første person, vi udtrækker, er en succes (en pige). Hvis ikke vi lægger
hende tilbage, betyder det, at andelen a f tilbageværende piger i klassen
nu er blevet mindre. Hvis der fx til at starte med var 5 piger og 5 drenge,
så er der nu kun 4 piger tilbage. Det betyder, at sandsynligheden for at
trække en pige i anden omgang er blevet mindre. Den er nu kun 4/9,
hvor den før var 5 /10. Derfor må vi kræve, at der foregår tilbagelægning
a f de udtrukne elementer, når vi trækker fra en endelig population, hvis
Y skal være binomialfordelt. Hvis ikke vi gør det, ender vi i stedet i den
hypergeometriske fordeling, som vi skal kigge på i det følgende.
6.3
Den hypergeometriske fordeling
Den hypergeometriske fordeling er tæt relateret til binomialfordelingen.
Den fremkommer, når man udtrækker n elementer til en stikprøve fra
en virkelig Bernoullipopulation uden tilbagelægning. Dvs. det samme
element i populationen kan højst blive udvalgt én gang. Sandsynlighe­
den for at trække en succes (eller en fiasko) ændrer sig derfor undervejs,
fordi antallet a f tilbageværende succeser (og fiaskoer) i populationen
ændres, efterhånden som elementerne udvælges.
Forestil dig, at vi trækker n gange uden tilbagelægning fra en popu­
lation med N elementer, hvoraf M er succeser og N – M er fiaskoer.
Hvis vi lader Y angive det samlede antal succeser i de n udtrækninger,
så siges Y at være hypergeometrisk fordelt med parametrene n, M og N.
Vi skriver da, at Y ~ H yp ( n, Μ , Ν ) . Sandsynlighedsfunktionen for Y,
dvs. sandsynligheden for at trække k succeser i de n forsøg, er givet i
den følgende boks:
Hypergeometrisk fordeling, Y ~ Hyp(n, Μ , N)
Sandsynlighedsfunktion:
k = 0,1,2, . . ., Μ
Middelværdi og varians:
Fortolkning: Y angiver antal succeser i n udtrækninger uden til­
bagelægning fra en virkelig Bernoullipopulation med N elemen­
ter, heraf M med egenskaben succes.
Bemærk, at vi aldrig kan trække mere end M succeser (antallet a f suc­
ceser i populationen). Derfor er sandsynligheden for Y > M lig med
nul. Bemærk også, at M / N er andelen a f succeser i populationen til at
begynde med. Hvis vi derfor i stedet havde trukket med tilbagelægning,
ville Y være binomialfordelt med p = M / N.
Den hypergeometriske fordeling kan man bruge i forbindelse med fx
en kvalitetskontrol. Det næste eksempel illustrerer dette:
Eksempel 6.13: Kvalitetskontrol
En virksomhed har produceret N = 10 maskiner, hvoraf M = 3 er de­
fekte. Virksomheden ved dog ikke, at tre a f maskinerne er defekte. Da
kvalitetskontrol er kostbart, beslutter virksomheden at udvælge tre ma­
skiner, som den tester for defekter. Lad Y være antallet a f succeser (her
defekte maskiner) i de tre udtrækninger. Da udtrækningen sker uden
tilbagelægning (der er ingen idé i at undersøge den samme maskine to
gange), så er Y hypergeometrisk fordelt med parametrene n = 3, M = 3
og N = 10. Sandsynligheden for, at kvalitetskontrollen finder to defekte
maskiner, er:
Dermed er sandsynligheden 1 – 0,175 = 0,825 for, at virksomheden
kommer til at sælge en maskine, som er defekt – nemlig den maskine,
som ikke blev fanget i kontrollen. Sandsynligheden for, at kvalitetskon­
trollen opdager alle tre defekte maskiner, er 0,0083. Hvis virksomheden
vil undgå at sende defekte maskiner på markedet, har den altså ikke
nogen god kvalitetskontrol i dette eksempel, da der er over 99 % sand­
synlighed for, at mindst én defekt maskine undgår kvalitetskontrollen.
■
Eksempel 6.14: På vagt juleaften
I en virksomhed skal man udvælge fire ansatte til at tage vagten jule­
aften. Virksomhedens ledelse overvejer, om den skal udvælge de fire
personer tilfældigt blandt de 19 ansatte. Dette forekommer umiddelbart
mest fair, men ledelsen vil samtidig være ked af, at ansatte med min­
dre børn skal være på arbejde juleaften. Den ønsker derfor at beregne
risikoen (sandsynligheden) for, at der kommer mere end én forælder på
vagt juleaften, hvis vagtholdet udvælges tilfældigt blandt de ansatte. A f
de 19 ansatte er der Y med mindre børn.
Udtrækningen a f vagter blandt de ansatte kan ses som fire ud­
trækninger fra en Bernoullipopulation med Y succeser (forældre) og
12 fiaskoer (ikke-forældre). Hvis vi lader Y angive antallet a f forældre
blandt de udtrukne, så ved vi, at Y ~ H yp(4,7,19). Den forventede
værdi a f Y er da E (Y ) = n · M /N = 4 · 7/19 = 1,473. Vi skal nu bereg­
ne P ( Y > 1). Denne sandsynlighed må være lig med:
1 – P (Y = 1) – P (Y = 0)
Der er altså 47,5% sandsynlighed for, at mere end én forælder kommer
på vagt juleaften.
■
6.4
Poissonfordelingen
Binomialfordelingen og den hypergeometriske fordeling fremkommer,
når man tager en stikprøve fra en Bernoullipopulation og undersøger
sandsynligheden for at få et bestemt antal successer. Dette kunne fx
være en situation, hvor vi spørger nogle mennesker på gaden, om de
stemmer „ja“ (X i = 1) eller „nej“ (X i = 0) ved en kommende afstemning.
Det kunne også være, at vi spurgte, om de „stemmer“ (Xi = 1) eller
„ikke stemmer“ (Xi = 0) ved det forestående valg, eller om de er „gift“
(Xi= 1) eller „ikke gift“ (Xi = 0). Den stokastiske variabel, Y, der angi­
ver antallet a f ja-stemmer i et sådant eksperiment, Y = X 1+ X 2 + ... + X n
er binomialfordelt, hvis udtrækningerne er uafhængige, og hypergeo­
metrisk fordelt, hvis udtrækningerne er uden tilbagelægning og dermed
afhængige.
Forstil dig nu, at vi er interesserede i at lave en model for, hvor
mange kunder der kommer ind i en butik. Vi observerer derfor en bu­
tik i 10 timer og lader den stokastiske variabel, X 1 antage værdien 1,
hvis der kommer kunder ind i butikken i løbet a f den første time, og
værdien 0, hvis der ikke gør det. Tilsvarende angiver X 2, om der kom­
mer kunder ind i løbet a f den anden time. Hvis vi lader Y være lig med
X 1+ X 2
,.X 10, er Y så binomialfordelt? Ja, hvis: i) udtrækningerne er
+
uafhængige, dvs. hvis der kommer kunder i en given time, så påvirker
det ikke sandsynligheden for kunder i de efterfølgende timer, og ii) hvis
sandsynligheden for at observere kunder i hver af de 10 timer er den
samme. I så fald er Y binomialfordelt med n = 10 og p lig med sandsyn­
ligheden for, at der kommer kunder i løbet a f en given time.
Det kunne måske være mere interessant at modellere det samlede
antal kunder i løbet af de 10 timer. Problemet med binomialmodellen
er, at Χ 1 antager værdien 1, uanset om der kommer 1 eller 100 kunder
ind i butikken den første time. Dette kunne man måske løse ved at for­
korte tidsintervallerne. I stedet for at observere, om der kommer kun­
der i løbet a f en time, kunne vi lave en observation hvert minut. Hvis
tidsintervallet var et minut, og vi stadig betragtede butikken i 10 timer,
ville vi trække 600 (= 60·10) gange i stedet for 10 gange fra Bernoul­
lipopulationen. Stadig må vi antage, at udtrækningerne er uafhængige,
og at sandsynligheden for at observere kunder er den samme i alle 600
tidsintervaller. Naturligvis er sandsynligheden for at observere kunder
i et givet tidsinterval nu blevet mindre, således at der også er mindre
risiko for at observere mere end én kunde per tidsinterval. Dermed vil
værdien a f Y også være tættere på at angive det faktiske antal kunder,
der kommer ind i forretningen.
Der er dog stadig en vis risiko for, at mere end én kunde kommer
ind i butikken inden for et givet tidsinterval. Hvis vi imidlertid fortsæt­
ter med at mindske tidsintervallerne, indtil de bliver uendeligt små, vil
denne risiko til sidst forsvinde. Sandsynligheden for, at der kommer
mere end én kunde ind i butikken i løbet a f et uendeligt lille tidsin­
terval, bliver nul. Dermed bliver Y også lig med summen a f kunder i
løbet a f de 10 timer. Fordi tidsintervallerne er blevet uendeligt små, må
vi have uendeligt mange tidsintervaller, dvs. vi må trække uendeligt
mange gange, for at de skal dække de 10 timer. Det bliver derfor meget
besværligt (umuligt) at regne på Y’s sandsynlighedsfunktion fra bino­
mialfordelingen. Heldigvis viser det sig, at sandsynlighedsfunktionen,
dvs. sandsynligheden for at observere k kunder i løbet a f de 10 timer,
nu kan skrives som:
hvor λ er det forventede antal kunder i løbet a f de 10 timer. I dette
tilfælde siger man, at Y er Poissonfordelt med parameteren λ. En Poissonfordelt variabel angiver altså antallet a f begivenheder (fx kunder) i
løbet a f et tidsinterval (fx 10 timer).
Man kan således opfatte en Poissonfordelt variabel, Y, som antal­
let a f succeser, hvis man igennem en tidsperiode trækker kontinuer­
ligt (uafbrudt) fra en Bernoullipopulation og til sidst lægger antallet
af succeser (hændelser) sammen. Dette er da værdien a f Y. Alternativt
kan man opfatte det som en situation, hvor man trækker én gang fra en
superpopulation bestående a f forskellige „hændelsesantal“. Dvs. man
trækker fx elementet „2 kunder på 10 timer“. Y er da lig med 2.
Som det forhåbentlig fremgår af det ovenstående, er der nogle un­
derliggende antagelser, som skal være opfyldt, for at vi kan modellere
en situation ved hjælp a f Poissonfordelingen. Disse er følgende:
i) antallet a f hændelser i ikke-overlappende tidsintervaller skal være
uafhængige (antallet af kunder i den ene time skal være uafhæn­
gigt af antallet a f kunder i den anden time osv.).
ii) sandsynlighederne i to lige lange intervaller skal være ens (dvs.
samme sandsynlighed for at observere kunder i hver time).
iii) sandsynligheden for mere end én hændelse i et meget kort tidsin­
terval skal være nul.
Eksempel 6.15: En hjemmeside
En internetvirksomhed ved, at der i gennemsnit er fem hits per time
på dens hjemmeside. I forbindelse med lanceringen a f et nyt produkt
ønsker den at beregne sandsynligheden for, at den når ud til mindst 10
kunder via hjemmesiden i den første time. Kan den bruge Poissonfor­
delingen til dette? Det kræver, at man med rimelighed kan antage: i) at
antallet a f hits i ikke-overlappende tidsintervaller er uafhængige, ii) at
sandsynlighederne for hits i to lige lange tidsintervaller er de samme
og iii) sandsynligheden for mere end ét hit i et meget kort tidsinterval
er nul.
Virksomheden vurderer, at dette er rimelige antagelser, og at antallet
af hits derfor er Poissonfordelt. Da det forventede antal hits per time er
5, er dette værdien a f λ. Sandsynligheden for præcis 10 hits i løbet af
den første time efter lanceringen kan da beregnes som:
For at f å sandsynligheden for mindst 10 kunder skal vi her­
til lægge sandsynligheden for 1 1 kunder, sandsynligheden
for 12 kunder osv. Alternativt kan vi udregne P ( Y ≥ 10) som
1 – P (Y = 9) – P (Y = 8) – ... – P (Y = 0).
■
Vi opsummerer Poissonfordelingen i følgende boks:
Poissonfordelingen, Y ~ Poi(λ)
Sandsynlighedsfunktion:
Middelværdi og varians: E (Y) = λ og V(Y) = λ
Fortolkning: Y angiver antal hændelser i en tidsperiode, hvor:
• λ er det forventede antal hændelser
• hændelser i ikke-overlappende tidsintervaller er uafhængige
• sandsynlighederne i to lige lange intervaller er ens
• sandsynligheden for mere end én hændelse i et meget kort
tidsinterval er nul.
Eksempel 6.16: Bestilling af pizzaer
Et pizzeria får i gennemsnit tre bestillinger per kvarter. Det har lovet
kunderne, at pizzaen er gratis, hvis der går mere end et kvarter fra be­
stilling til levering. Dette vil ske, hvis der i et givet kvarter kommer
mere end fem bestillinger. Derfor ønsker pizzeriaejeren at beregne risi­
koen for dette. Hvis vi antager, at Y angiver antallet a f pizzabestillinger
i et kvarter, og at Y følger en Poissonfordeling, så er λ = 3. Dermed
bliver sandsynlighederne for henholdsvis 0, 1, 2, 3, 4 og 5 bestillinger:
Og sandsynligheden for mere end 5 bestillinger kan da beregnes som:
P (Y > 6) = 1 – P (Y = 0) – P (Y = 1) – P (Y = 2) – P (Y = 3)
– P ( Y = 4) – P (Y = 5) = 1 – 0,050 – 0,144 – 0,224 – 0,224
–0 ,1 6 8 – 0,101 = 0,084
Der er således 8,4 % sandsynlighed for, at ejeren i et givet kvarter må
aflevere gratis pizza.
■
6.5
Normalfordelingen
Fordelingerne i afsnit 6.1 til 6.4 er alle diskrete fordelinger, hvor den
stokastiske variabel kun kan antage et tælleligt antal værdier. Normal­
fordelingen, som vi nu skal se på, er derimod en fordeling for en konti­
nuert stokastisk variabel. Normalfordelingen har opnået sin popularitet
a f to årsager. For det første har mange naturlige størrelser i virkelige
populationer en fordeling, som ligner normalfordelingen, og for det an­
det, som vi skal se i de efterfølgende kapitler, er mange estimatorer og
teststatistikker normalfordelte.
Normalfordelingen, Y ~ Ν (μ, σ2)
En kontinuert stokastisk variabel, Y, er normalfordelt, hvis den
har tæthedsfunktion:
hvor μ = E ( Y) er middelværdien, og σ2 = V(Y ) er variansen.
Tæthedsfunktionen for en normalfordelt variabel, Y, er illustreret i figur
6.2 for forskellige værdier af μ og σ2. Man kan se i figuren, at grafen
for tæthedsfunktionen afhænger a f både μ og σ2. Middelværdien ligger
midt i grafen, hvor tæthedsfunktionen antager den største værdi. Hvis
middelværdien, μ, er høj, ligger grafen længere til højre. Der vil da være
større sandsynlighed for at få større værdier a f Y. Hvis variansen er høj,
har grafen „tykkere haler“, dvs. der er større sandsynlighed for at få
værdier af 7, som ligger langt væk fra middelværdien.
Figur 6.2:
Tætheds­
funktioner for
normalfordelte
variabler
Hvordan finder vi sandsynligheder i normalfordelingen? Hvis
Y ~ Ν (μ , σ 2), så er sandsynligheden for at få en værdi a f 7, som er
mindre end eller lig med y , givet ved F (y ), hvor F er den kumulative
sandsynlighedsfunktion for Y. Grafisk set er F (y ) lig med arealet under
tæthedsfunktionen til venstre for y som illustreret i figur 6.3.
Figur 6.3:
Kumulativ
sandsynlighed
i en normalfor­
deling
Det er oplagt, at dette areal vil afhænge af størrelserne a f μ og σ2. Hvis
μ er høj, vil arealet være mindre. En højere middelværdi gør det mindre
sandsynligt at observere en lav værdi a f Y. Arealet, dvs. den kumulative
sandsynlighedsfunktion, kan udregnes ved at integrere tæthedsfunktio­
nen. Dette er desværre umuligt, da der ikke eksisterer et analytisk ud­
tryk for F (y ), når Y er normalfordelt. Ved brug a f computersimulatio­
ner kan man dog for givne værdier a f μ and σ2 beregne sandsynligheden
for, at Y vil antage en værdi mindre end y. Det er dog stadig ikke en
særlig praktisk løsning i mange situationer.
Heldigvis kan man udregne de kumulative sandsynligheder for en­
hver normalfordeling ud fra den normalfordeling, som har middelværdi
μ = 0 og varians σ2 = 1. Denne specifikke normalfordeling, N (0 ,1 ) ,
kaldes standardnormalfordelingen. Den er så vigtig, at dens kumulative
sandsynlighedsfunktion har fået et specielt symbol, Φ (z ), og tilsva­
rende har dens tæthedsfunktion fået betegnelsen φ (z ) . Den kumulative
sandsynlighedsfunktion, Φ (z ), er desuden tabuleret i tabel 1 bagerst i
bogen for udvalgte værdier a f z . De næste to eksempler viser, hvordan
man kan bruge tabellen til at finde sandsynligheder i standardnormal­
fordelingen.
Eksempel 6.17: Tabelopslag 1
Lad Z være standardnormalfordelt, dvs Z ~ N ( 0 , 1) . Find sandsynlig­
heden for, at Z er mindre end –2,62. Vi skal altså finde Φ (z ), hvor
z = –2,62. I tabel 1 bagerst i bogen angiver det første tal i hver række
værdien a f z til og med 1. decimal, hvorimod det første tal i hver kolon­
ne angiver den 2. decimal a f z . Vi skal derfor finde den værdi i tabel­
len, der står ud for rækken med –2,6 og kolonnen med 2. Her finder vi
værdien 0,0044. Sandsynligheden for en værdi a f Z mindre end –2,62
er derfor 0,0044.
Tabel 5.2
Udsnit af
sandsynlig­
hedstabel 1
z
0
2
1
– 3,0
0,0013
0,0013
0,0013
– 2,9
0,0019
0,0018
0,0018
– 2,8
0,0026
0,0025
0,0024
– 2,7
0,0035
0,0034
0,0033
– 2,6
0,0047
0,0045
0,0044
– 2,5
0,0062
0,0060
0,0059
■
Eksempel 6.18: Tabelopslag 2
Find P (Z > 1,06), når Z er standardnormalfordelt. Fra tabel 1 finder
vi, at P (Z ≤ 1,06) = Φ ( 1,06) = 0,8554. Sandsynligheden for, at Z er
større end 1,06, er da:
P ( Z > 1,06) = 1 – Φ(1,06) = 1 – 0,8554 = 0,1446.
■
Når det nu er muligt at finde sandsynligheder for standardnormalfor­
delingen, mangler vi blot at etablere sammenhængen mellem standard­
normalfordelingen og alle de andre normalfordelinger. Denne sam­
menhæng finder man ved standardisering. Standardisering ændrer en
stokastisk variabel med middelværdi μ og varians σ2 til en ny stokastisk
variabel med middelværdi 0 og varians 1. Hvis den oprindelige stoka­
stiske variabel er normalfordelt, så vil den nye stokastiske variabel også
være normalfordelt, men nu med middelværdi 0 og varians 1:
Standardisering af en stokastisk variabel
Den stokastiske variabel, Y, med middelværdi E (Y) = μ og vari­
ans V(Y) = σ2 standardiseres ved at udregne:
Z bliver da en stokastisk variabel med middelværdi E ( Z ) = 0 og
varians V( Z ) = 1.
Specielt for normalfordelingen: Hvis Y ~ Ν (μ, σ2), så er Z ~
N (0, 1).
Det følgende eksempel viser, hvordan vi kan bruge standardisering til at
udregne sandsynligheder for en normalfordelt variabel:
Eksempel 6.19:.Standardisering
Lad Y ~ N (10 ,4 ). Vi skal finde sandsynligheden P ( Y ≤ 8). Dette
gøres ved hjælp a f standardisering:
P ( Y ≤ 8) = P ( Y – 1 0 ≤ 8 – 10)
h v o r Z = ( Y– 1 0 ) /2 . B e m æ rk , at vi udnytter, at vi gerne må træk­
ke det samme tal (middelværdien 10) fra og dividere med det samme
tal (standardafvigelsen 2) på begge sider a f et ulighedstegn. Fordi Y
er normalfordelt med middelværdi 10 og varians 4, så må variablen
Z = ( Y – 1 0 )/2 være standardnormalfordelt ifølge boksen ovenfor.
Dermed kan vi slå den sidste sandsynlighed op i tabel 1. Vi finder såle­
des, at P (Y ≤ 8) = Φ (– 1 ) = 0,1587.
■
Sandsynligheden for, at den stokastiske variabel, Y, antager en vær­
di mindre end a, er altså den samme som sandsynligheden for, at den
standardiserede variabel, Z = ( Y – μ ) / σ , antager en værdi mindre end
( a – μ ) / σ , og denne sandsynlighed kan findes ved at bruge tabel 1 for
standardnormalfordelingen.
Lad os opsummere teknikken i en boks:
Sandsynligheder i normalfordelingen:
For Y ~ Ν(μ, σ2) gælder følgende regler:
i)
ii)
iii)
hvor a og b er konstanter, og Φ(z) findes i tabel 1.
Eksempel 6.20: Aktieafkast
Lad den stokastiske variabel, X, repræsentere afkastet på en aktie (i kro­
ner på et år). Antag desuden, a t X er normalfordelt med E (X ) = μ = 20
og V(X ) = σ2 = 5. Hvad er da risikoen (sandsynligheden) for et afkast
på mindre end 15 kroner i et givet år? Vi løser problemet på samme
måde som i ovenstående eksempel:
= Φ (–2,24) = 0,0125
Der er altså kun en sandsynlighed på 1,25 % for et afkast på mindre end
15 kroner.
■
6.6
Multinomialfordelingen
Den multinomiale fordeling er en generalisering a f binomialfordelin­
gen. I stedet for at trække fra en population med kun to forskellige typer
a f elementer (en Bernoullipopulation) trækker man nu fra en population
med m forskellige typer. Et element kan derfor antage m forskellige
værdier. Som i binomialfordelingen antages det, at udtrækningerne er
uafhængige. Det betyder, at hvis der udtrækkes fra en virkelig populati­
on, så sker det med tilbagelægning.
Eksempel 6.21: En EU-afstemning – del 1
Forestil dig, at vi stopper fem tilfældige mennesker på gaden og spør­
ger, om de stemmer ja, nej eller blankt ved en kommende EU-afstem­
ning. Her er der således tre forskellige typer af elementer i populationen
(ja, nej, og blank). I princippet er der ikke noget til hinder for, at vi
kommer til at stoppe den samme person to gange, så derfor er der tale
om en udtrækning med tilbagelægning fra populationen.
■
I binomialfordelingen lod vi X i være en stokastisk variabel, der antog
værdien 1, hvis den i’te udtrækning resulterede i en succes. Den stoka­
stiske variabel, Y (antallet a f succeser i de n trækninger), var da lig med
summen a f X i’erne. I eksempel 6.21 kan vi ikke nøjes med en enkelt
variabel. Vi kunne lade Y angive antallet a f ja-stemmer, men det er ikke
tilstrækkeligt til at fortælle os, hvordan nej-stemmer og blanke stemmer
fordeler sig i stikprøven. Til eksperimentet i eksempel 6.21 har vi brug
for tre stokastiske variabler.
Eksempel 6.22: En EU-afstemning – del 2
Lad den stokastiske variabel Y1 være antallet a f ja-sigere i de fem ud­
trækninger fra eksempel 6.21, Y2 antallet af nej-sigere og Y3 antallet af
blanke. Det er fordelingen a f ( Y1,Y2,Y3), som siges at være en multino­
mialfordeling. Antag nu, at andelen a f ja-stemmer i populationen er 0,4,
andelen, der stemmer nej, er 0,5, og andelen, der stemmer blankt (eller
ikke stemmer), er 0 ,1. Hvad er da sandsynligheden for, at stikprøven
kommer til at bestå a f fx to ja-sigere ( Y1 = 2), to nej-sigere ( Y2 = 2) og
en blank (Y3 = 1)?
■
Når vi har at gøre med en multinomialfordeling, skal vi, som illustreret
i eksempel 6.22, beregne sandsynligheden for tre eller flere stokastiske
variabler, (Y1,Y2,...,Ym). Multinomialfordelingen er derfor en simultan
fordeling. I eksempel 6.22 er der tale om en simultan fordeling for Y1
Y2 og Y3. Det næste eksempel viser, hvordan sandsynligheder i multino­
mialfordelingen fremkommer:
Eksempel 6.23: En EU-afstemning – del 3
Baseret på populationsandelene fra eksempel 6.22 kan vi starte med
at beregne sandsynligheden for først at møde to ja-sigere, dernæst to
nej-sigere og til sidst én, der stemmer blankt. Denne sandsynlighed er
givet ved: 0,4 · 0,4 · 0,5 · 0,5 · 0,1 = 0,004, fordi de enkelte udtræknin­
ger er uafhængige. Tilsvarende er sandsynligheden 0,004 for at møde
den samme kombination a f vælgere i en anden rækkefølge, fx 0,1
0,4 · 0,5 · 0,5 · 0,4 = 0,004.
For at finde den samlede sandsynlighed skal vi gange sandsynlig­
heden 0,004 med det antal kombinationer a f udfald, der resulterer i to
ja-sigere, to nej-sigere og en blank stemme. Dette antal a f kombinati­
oner kan findes ved hjælp a f formlen i nedenstående boks, der kaldes
multinomialkoefficienten, og som er en generalisering a f binomialkoef­
ficienten fra afsnit 6 .2 . I dette tilfælde giver den:
Dvs. der findes 30 forskellige kombinationer, hvorved man kan få
to ja-sigere, to nej-sigere og en blank. Den samlede sandsynlig­
hed for at udtrække to ja-sigere, to nej-sigere og en blank er derfor
0,004 · 30 = 0,12.
■
Multinomialkoefficienten
Antallet a f kombinationer, hvorved n udfald kan resultere i k 1
udfald a f type 1, k2 udfald a f type 2, ..., og kmudfald a f type m,
er givet ved:
hvor k1 + k2 + ... + km = n.
Sandsynligheden for at udtrække k1 elementer af type 1, k2 a f type 2
osv. i n uafhængige trækninger fra en population med m forskellige
elementer er derfor:
hvor p1 er sandsynligheden for at få et udfald af type 1 i en udtrækning,
p 2 sandsynligheden for at få et udfald af type 2 osv.
Eksempel 6.24: Terningkast
Forestil dig, at vi slår 12 gange med en terning og observerer antallet af
enere, toere, treere, firere, femmere og seksere. Hvad er sandsynlighe­
den for at slå to a f hver slags? Hvis vi lader Y1angive antallet a f enere,
Y2 antallet a f toere osv., vil ( Y1, Y2, Y3, Y4,Y5,Y6) være multinomialfor­
delt m ed p 1= 1/6, p 2 = 1/6,...,p6 = 1/6. Vi kan betragte hvert kast som en
udtrækning fra populationen a f terningslag, hvor sandsynligheden for
at trække (slå) en ener er 1/6 osv. Dermed bliver sandsynligheden for to
enere, to toere osv.:
P (Y1 = 2, Y2 = 2,...,Y6 = 2)
= 0,0034
■
Lad os slutte med at opsummere multinomialfordelingen i en boks:
Multinomialfordelingen,
(Y1,Y2,...,Ym, ~ M (n, p 1, p 2,...,pm)
Sandsynlighedsfunktion:
Middelværdi og varians a f Yi:
E (Yi) = n · p i og
V (Yi) = n · p i · (1 – p i)
Fortolkning:
• n uafhængige udtrækninger fra en population med m forskellige typer a f ele­
menter.
• Y 1 angiver antal udfald a f type 1, Y2 antal udfald a f type 2 osv. i de n udtræk­
ninger.
• Der er konstante sandsynligheder, p 1, p 2,. . . , p m, for de m forskellige udfald i
hver udtrækning.
6.7
Opgaver
1. Repetitionsspørgsmål:
a) Giv et eksempel på en Bernoullifordelt stokastisk variabel.
b) Hvad er sammenhængen mellem Bernoullifordelingen og bino­
mialfordelingen?
c) Giv et eksempel på en stokastisk variabel, der er binomialfordelt.
d) Hvad er forskellen på binomialfordelingen og den hypergeome­
triske fordeling?
e) Illustrér forskellen i d) med et eksempel.
f) Er en Poissonfordelt stokastisk variabel diskret eller kontinuert?
g) Giv et eksempel på et fænomen, der kan tænkes at være Poisson­
fordelt.
h) Er en normalfordelt stokastisk variabel diskret eller kontinuert?
i) Giv et eksempel på et fænomen, der kan tænkes at være normal­
fordelt.
j) Forklar forskellen på en normalfordelt og en standardnormalfor­
delt stokastisk variabel.
k) Hvad er forskellen på multinomialfordelingen og binomialfor­
delingen?
1) Hvad adskiller multinomialfordelingen fra de øvrige fordelinger
i dette kapitel?
m) Beskriv en situation (et eksperiment), hvor multinomialfordelin­
gen kunne være relevant.
2. Du har fået arbejde hos en bager. Bagermesteren fortæller, at der er
planlagt 12 nye slags kager til salg i de kommende år. Erfaringen har
vist, at 60 % a f kagerne i bageriet bliver en succes. Lad X være den
stokastiske variabel, der betegner antallet a f succeskager blandt de
12 nye kager.
a) Hvilken fordeling beskriver, om en enkelt kage bliver en succes?
b) Hvilken fordeling følger Χ ?
c) Bageren ønsker at gå på pension, såfremt ingen a f de 12 kager
bliver en succes. Hvad er sandsynligheden for denne hændelse?
d) Bageren giver dig lønforhøjelse, hvis mindst 10 kager får succes.
Find sandsynligheden for dette.
e) H v a d e r E(X ) og V(X ) ?
3. På en bilfabrik har man et problem: 25 % af de færdigproducerede
biler kan ikke starte. Der udtages nu en tilfældig stikprøve på 10
biler. X = antal biler i stikprøven, der ikke kan starte.
a) Hvilken fordeling følger X ?
b) Hvad er sandsynligheden for, at mere end 8 biler i stikprøven
ikke kan starte, P (X > 8)?
c) Hvad er sandsynligheden for, at alle bilerne kan starte?
d) Hvad er det forventede antal biler, der ikke kan starte?
4. Du har ikke lavet de tre opgaver, som din lærer stillede i sidste sta­
tistiktime, og du overvejer nu, om du skal blive væk fra den time,
hvor læreren vil hive eleverne op til tavlen for at lade dem svare på
opgaverne. Vi antager, at læreren tilfældigt vælger én elev til hver
opgave. Samme elev kan altså godt svare på alle stillede opgaver.
Antag, at alle 50 elever på holdet møder op til timen.
a) Hvad er sandsynligheden for, at du slipper for at skulle besvare
en a f opgaverne?
b) Hvad er sandsynligheden for, at du skal besvare alle tre opgaver?
Forstil dig nu, at 20 a f de andre elever heller ikke har lavet opgaver­
ne, men alligevel møder op. Hvis læreren kommer til at hive en af
disse 20 elever op til en opgave, er han derfor nødt til at sende ved­
kommende ned og kalde en ny elev op. Sådan fortsætter han, indtil
han har fundet en elev, der har lavet opgaven.
c) Hvad er nu sandsynligheden for, at du går fri? (Hint: Hvad bety­
der det, om de 20 elever er til stede eller ej?).
5. På pensumlisten i statistik er der otte emner. Til eksamen vil der
blive stillet opgaver inden for tre a f disse emner. En a f de studeren­
de har valgt at satse lidt og har derfor kun læst på fem a f emnerne.
Lad Y være den stokastiske variabel, der angiver antallet af opgaver,
som den studerende kan svare på til eksamenen, hvis de tre emner til
eksamenen udvælges tilfældigt blandt de otte.
a) Hvordan er Y fordelt?
b) Opstil sandsynlighedsfunktionen for Y i en tabel.
c) Hvad er det forventede antal opgaver, som den studerende kan
svare på?
6. Du er taget på kasino for at spille poker. Du har ikke mange penge
tilbage og vælger at satse alt på den næste runde. Du sidder derfor og
regner lidt på sandsynlighederne for din næste hånd (5 kort).
a) Hvis X angiver antal esser i din kommende hånd, hvordan er X
da fordelt?
b) Hvad er sandsynligheden for, at du får fire esser? Hvad er sand­
synligheden for, at du blot får tre?
c) Du sidder og drømmer lidt om en Royal Straight Flush (es, kon­
ge, dame, knægt og tier, alle i hjerter). Hvad er sandsynligheden
for at få denne? (Hint: Tænk på de fem hjerter som succeser).
Du får nu rent faktisk tre esser og vælger derfor at bytte de sidste to
kort.
d) Hvad er sandsynligheden for, at du får det sidste es ved denne
manøvre? (Hint: Husk, at parametrene i fordelingen nu er æn­
dret).
7. Ole er på vej hjem fra byen og står nu og venter på en taxa. Han ved,
at der gennemsnitligt kommer én taxa hvert tiende minut. Lad X =
antal taxaer, der passerer.
a) Hvilken fordeling kan vi antage, at X følger?
b) Visse egenskaber ligger til grund for den sandsynlighedsforde­
ling, som X følger. Nævn og forklar disse.
Mens han står og venter, falder han i snak med en fornuftig ung
dame og glemmer alt om taxaer. Samtalen varer 1 time.
c) Hvor mange taxaer vil du forvente, der er kørt forbi?
d) Hvad er sandsynligheden for, at der er kørt Y taxaer forbi?
e) Hvad er sandsynligheden for, at der er kørt maksimalt 4 taxaer
forbi?
8. Jens har fået nat-sommerarbejde på en fabrik, hvor han er sat til at
holde vandindslusningen fri for vandmænd med et fiskenet. Efter­
som der ikke er så mange at snakke med om natten, giver han sig
til at anvende sin lommestatistik på at beskrive sit nye arbejde. Han
finder hurtigt ud af, at vandmændene bliver suget til indslusningen i
en lind strøm. Fra han starter kl. 23 om aftenen, til han går kl. Y om
morgenen, kommer der gennemsnitligt 90 vandmænd i timen. La d X
angive den stokastiske variabel, der beskriver antallet a f tilstrømme­
de vandmænd i en periode på 1 minut.
a) Hvordan kan vi med rimelighed antage, at X er fordelt?
b) Hvad er sandsynligheden for, at der svømmer to vandmænd til i
en periode på 1 minut?
c) Hvor mange vandmænd vil du forvente, at der svømmer til på 1
minut?
Lad Y angive den stokastiske variabel, der beskriver antallet a f til­
strømmede vandmænd i en periode på et kvarter.
d) Hvordan er Y fordelt?
e) Da han finder det dejligt afslappende, at kun få vandmænd skal
fiskes op, ønsker han at finde sandsynligheden for, at højst 2
vandmænd tilstrømmer i løbet a f et kvarter. Hvad er denne sand­
synlighed?
f) Find V( Y).
9. En normalfordelt variabel, X, har tæthedsfunktionen:
a) Hvad er middelværdien a f X?
b) Hvad er variansen og standardafvigelsen a f X?
10.L ad X ~ N (3 ,4 ). Beregn følgende sandsynligheder:
a) P (X ≤ 3)
b) P (X < 3)
c) P (X ≤ – 1 )
d) P (X ≤ 2)
e) P (X ≥ 5)
f) P ( –1 ≤ X ≤ 5)
g) Skitsér ved hjælp a f en tæthedsfunktion for X de arealer, der sva­
rer til sandsynlighederne i spørgsmål a)-f).
11. Den stokastiske variabel, X , er normalfordelt med middelværdi 1 og
varians 9.
a) Standardisér X.
b) Hvilken fordeling følger den standardiserede variabel?
12.En konsulentvirksomhed er ved at lave en undersøgelse a f tilfreds­
heden blandt sine kunder. Derfor udvælger den 10 a f sine tidligere
kunder tilfældigt (og med tilbagelægning) og spørger, om de har
været: i) meget tilfredse, ii) tilfredse eller iii) utilfredse med den
konsulentservice, de har modtaget. Lad X være antallet a f meget til­
fredse kunder blandt de 10 adspurgte kunder, Y antallet a f tilfredse
og Z antallet a f utilfredse. Antag også, at 40 % a f alle virksomhedens
kunder har været meget tilfredse, 30 % utilfredse og 30 % tilfredse.
a) Hvilken fordeling følger X, Y og Z?
b) Hvad er sandsynligheden for, at andelene blandt de adspurgte
bliver de samme som andelene i populationen?
c) Hvad er sandsynligheden for, at ingen a f de adspurgte er hverken
tilfredse eller meget tilfredse?
d) Hvad er sandsynligheden for, at halvdelen a f de adspurgte er util­
fredse, mens den anden halvdel er meget tilfredse?
7
Stokastiske processer8
I praksis er vi ofte stillet over for problemer med usikkerhed, som ud­
vikler sig over tid. Eksempler på dette er udviklingen i valutakurser
eller tiden til det næste opkald hos vagtlægen. I dette kapitel introdu­
cerer vi stokastiske processer, som er nyttige redskaber til at håndtere
sådanne problemstillinger.
Basalt set er en stokastisk proces blot en samling af stokastiske va­
riabler. Så selvom vi definerer en række nye begreber og ny notation i
dette kapitel, har vi allerede set mange a f de involverede teknikker i de
tidligere kapitler.
I afsnit 7 .1 definerer vi en stokastisk proces, og i afsnit 7.2 diskuterer
vi forskellige transformationer af en stokastisk proces. I afsnit 7.3 be­
tragter vi to aspekter ved stokastiske processer, som er særligt interes­
sante, nemlig tilstanden af den stokastiske proces på et givet tidspunkt
samt ventetiden til en bestemt hændelse i den stokastiske proces. Vi
forklarer i afsnit 7.4, hvordan man kan inddele stokastiske processer i
fire typer, og i de efterfølgende fire afsnit, 7.5-7.8, præsenterer vi nogle
meget brugte eksempler på hver af de fire typer af stokastiske processer.
Vi runder kapitlet a f med en oversigt over disse eksempler.
7.1
En stokastisk proces
Forestil dig en samspilsramt familie, hvor manden og konen hver mor­
gen kaster en mønt for at afgøre, hvem a f dem der skal tage bilen på
arbejde, og hvem a f dem der skal cykle. Hvis udfaldet af møntkastet
bliver „plat“, får manden bilen, mens kvinden får bilen i tilfælde af
„krone“ . Vi kan da lade den stokastiske variabel, Z t, angive udfaldet af
møntkastet på den t’te morgen:
'8
D ette kapitel kan springes over, idet de efterfølgende k apitler ikke b yg g er p å indholdet a f dette kapitel.
Der er en række aspekter, som kan være a f interesse i forbindelse med
ovenstående eksempel: Hvad er fx det forventede årlige antal morge­
ner, hvor kvinden har bilen? Hvad er sandsynligheden for, at manden
har bilen fem dage i træk? Hvor mange dage skal manden regne med at
vente, inden han får bilen? Og hvad er sandsynligheden for, at kvinden
skal vente mere end tre dage, inden hun igen får bilen? Det er sådanne
spørgsmål, som stokastiske processer kan hjælpe os med at håndtere og
besvare.
Møntkastene på de forskellige morgener i den lille familie kan re­
præsenteres ved en samling a f stokastiske variabler: Z t, t = 1,2,3,.... En
sådan samling a f stokastiske variabler, der er indekseret med fodtegnet
t, som her repræsenterer et tidsforløb, kalder man en stokastisk proces.
En stokastisk proces, {Zt, t ∈ T }, er en samling a f stokastiske
variabler, Zt, indekseret med fodtegn t, hvor t tilhører mængden
a f tidsindeks, T.
Udfaldet a f en stokastisk proces, {zt, t ∈ T }, kaldes en realise­
ring eller en stikprøvesti („sample path“).
I eksemplet ovenfor var T = {1,2,3,...}. Mængden a f tidsindeks er der­
med tællelig. Vi siger da, at den stokastiske proces foregår i diskret tid.
Vi skal senere se eksempler på stokastiske processer, hvor mængden
af tidsindeks er utællelig, dvs. hvor der hele tiden er nye realiseringer
a f Zt. Sådanne stokastiske processer siges at foregå i kontinuert tid. En
utællelig mængde a f tidsindeks er fx intervallet T = [0;24] timer.
I kapitel 4 så vi, at en stokastisk variabel er en funktion, som anta­
ger en talværdi for ethvert udfald a f et eksperiment. På samme måde
forholder det sig med stokastiske processer. Til ethvert udfald a f det
underliggende eksperiment knytter der sig en realisering a f den stoka­
stiske proces.
Eksempel 7.1 : Møntkast – del 1
Betragt et eksperiment, hvor man kaster en mønt tre gange efter hin­
anden og hver gang observerer den øverste side a f mønten. Et muligt
udfald a f dette eksperiment er: ω = (krone, plat, krone). Man kan også
definere en stokastisk proces for dette eksperiment. Lad mængden af
tidsindeks være T = {1,2,3}. Vi kan da definere de stokastiske variabler
i en stokastisk proces på følgende vis:
Tabel 7.1:
Udfald af
Sandsynlighed
Realisering
Udfald
ω
Ζ1(ω)
Ζ2(ω)
Ζ3(ω)
Ρ (ω)
perimentet
(K, Κ , Κ )
1
1
1
1/8
og tilhørende
( Κ, Κ , Ρ)
1
1
0
1/8
( Κ , Ρ, Κ )
1
0
1
1/8
( Κ , Ρ, Ρ )
1
0
0
1/8
(Ρ, Κ , Κ )
0
1
1
1/8
(Ρ, Κ , Ρ )
0
1
0
1/8
(Ρ, P, Κ )
0
0
1
1/8
(Ρ, Ρ, Ρ )
0
0
0
1/8
møntkasteks­
realiseringer af
den stokasti­
ske proces
■
I eksempel 7 .1 er et muligt udfald a f eksperimentet ω = (krone, plat,
krone). Bemærk, at det er alle elementerne i ω (her: krone, plat og kro­
ne), som udgør udfaldet a f eksperimentet „at kaste en mønt tre gange“.
Det enkelte element i ω refererer vi til som en begivenhed.
Ligesom vi kan tilskrive sandsynligheder til en stokastisk variabel,
kan vi også tilskrive sandsynligheder til en stokastisk proces. Vi kan
fx udregne sandsynligheden for at få en bestemt realisering af den sto­
kastiske proces. Næste eksempel illustrerer, hvordan man kan udregne
sådanne sandsynligheder.
Eksempel 7.2: Møntkast – del 2
Hvis møntkastene i eksempel 7 .1 er uafhængige og identisk fordelte
med sandsynlighed 0,5 for henholdsvis plat og krone, så er sandsynlig­
heden for hver enkelt realisering lig med 0.53 = 1/8. Disse sandsynlig­
heder er angivet i den sidste søjle af tabel 7.1.
■
7.2
Transformation af en stokastisk proces
En a f fordelene ved at modellere med en stokastisk proces er, at den gør
det nemmere at lave en god specifikation a f en praktisk situation. Man
kan efterfølgende bruge den stokastiske proces til at specificere en ny
stokastisk proces, som modellerer et andet aspekt ved den praktiske si­
tuation end den første stokastiske proces. Den nye stokastiske proces er
en transformation a f den oprindelige proces. I dette afsnit ser vi blandt
andet nærmere på den transformation, som akkumulerer en stokastisk
proces i diskret tid.
Vi betragter den stokastiske proces: {Z ,t t ∈ {1,2,3,...}}. Det kunne fx
være den stokastiske proces med møntkast fra eksempel 7.1. Hvis man
er interesseret i antallet a f gange, man får krone, kan man lave en trans­
formation a f den stokastiske proces, der fanger dette. Transformationen
tager summen a f de stokastiske variabler, som udgør den stokastiske
proces, indtil et bestemt tidspunkt. Lad således {X ,t t ∈ {1,2,3,...}} være
den transformerede stokastiske proces i diskret tid givet ved:
Vi kalder denne transformation for partiel-sumtransformationen. Som
nævnt ovenfor summerer denne transformation en del a f den oprindeli­
ge proces, nemlig delen op til tidspunkt t. Fx er X 2 summen a f Z 1og Z2.
Det næste eksempel uddyber denne sammenhæng.
Eksempel 7.3: Møntkast – del 3
I møntkasteksperimentet fra eksempel 7.1 giver partiel-sumtransforma­
tionen en stokastisk proces, {X t, t ∈ {1,2,3,...}}, hvor X t er antallet af
krone-udfald opnået på tidspunkt t. Den er givet ved:
Her har vi direkte angivet X ’s og Z ’s afhængighed a f udfaldet a f ekspe­
rimentet. Dermed er det nemmere at se sammenhængen mellem de to
stokastiske processer:
X 1(ω) = Ζ 1(ω)
X 2(ω) = Ζ1(ω) + Ζ2(ω)
X3(ω) = Ζ1(ω) + Ζ2(ω) + Ζ3(ω)
Denne sammenhæng er illustreret i tabel 7.2., hvor de mulige realiserin­
ger af den stokastiske proces, {X t, t ∈ {1,2,3}}, er angivet sammen med
de tilhørende realiseringer a f den stokastiske proces, {Z t, t ∈ {1,2,3}}.
Tabel 7.2: Ud­
ω
Z1(ω)
Z2(ω)
Z3(ω)
X1(ω)
X2(ω)
X3(ω)
Ρ(ω)
(K, K, K)
1
1
1
1
2
3
1/8
og tilhørende
(K, K, P)
1
1
0
1
2
2
1/8
realiseringer af
(K, P, K)
1
0
1
1
1
2
1/8
(K, P, P)
1
0
0
1
1
1
1/8
(P, K, K)
0
1
1
0
1
2
1/8
(P, K, P)
0
1
0
0
1
1
1/8
(P, P, K)
0
0
1
0
0
1
1/8
fald af mønt­
eksperimentet
de to stokasti­
ske processer
(P, P, P)
0
0
0
0
0
0
1/8
Der er også andre transformationer af en stokastisk proces, som er prak­
tisk anvendelige. En sådan transformation er fx første-differens trans­
formationen, som giver ændringen i en stokastisk proces fra et tids­
punkt til det næste. Den kan formelt skrives som:9
Hvis Zt er en persons indkomst i år t, så er X t ændringen af personens
indkomst fra år t – 1 til år t.
I stedet for den absolutte ændring fra ét tidspunkt til det næste kan vi
udregne væksten i procent. Denne transformation er:
9
N ogle gange bruges notatio nen ΔΖ t fo r Z t – Z t–1, dvs. ΔΖ t = Z t – Z t–1.
Bemærk, at når den stokastiske proces, {Zt, t = tstart,...,tslut}, er defineret
for t = tstart,...,tslut, så er første-differenstransformationen (både absolut
og i procent) kun defineret for t = (tstart + 1),...,tslut, idet vi ikke kan ud­
regne ændringen for den første periode.
7.3
Tilstand og ventetider i en stokastisk proces
I forbindelse med stokastiske processer er der to aspekter, som påkalder
sig særlig interesse: Tilstanden a f den stokastiske proces på et bestemt
tidspunkt samt ventetiden, indtil en bestemt tilstand opnås første gang.
Det første aspekt, at fastslå tilstanden for den stokastiske proces på
et givet tidspunkt, er fx interessant, hvis den stokastiske proces repræ­
senterer kursen på en aktie eller gevinster ved spil. Eftersom den stoka­
stiske proces består a f begivenheder, som sker tilfældigt, er værdien på
et bestemt tidspunkt også stokastisk.
Mere formelt: Tilstanden på tidspunkt t0 a f den stokastiske proces
I eksempel 7.3 er
{X t, t ∈ T} er givet ved den stokastiske variabel
X 2 fx antallet a f krone-udfald efter to kast med mønten. Den stokastiske
har en fordeling, og det er denne fordeling, vi kalder til­
variabel
standsfordelingen a f den stokastiske proces på tidspunkt t0.
Figur 7 .1 viser en realisering a f den stokastiske proces fra eksempel
7.3. Her er den realiserede værdi a f X 2 lig med 1, fordi man har fået plat
i første kast og krone i det næste. Den realiserede værdi a f X 2 kunne
dog også have været enten 0 eller 2, hvis man havde fået henholdsvis to
gange plat eller to gange krone. Det følgende eksempel viser, hvordan
man kan udregne tilstandsfordelingen.
Figur 7.1:
Realiseret
tilstand på
tidspunkt
t0 = 2
Eksempel 7.4: Møntkast – del 4
Ud fra sandsynlighederne i tabel 7.2 for de forskellige realiseringer
af {Z t, t = 1,2,3} i møntkasteksperimentet er det relativt let at udreg­
ne sandsynligheden for, at den transformerede stokastiske proces,
{X t, t ∈ 1,2,3}, antager en bestemt værdi på et bestemt tidspunkt, t0. For
t0 = 3 er sandsynlighederne således givet ved:
P (X 3 = 0) = 1/8 (svarer til udfaldet (P, P, P)),
P (X 3 = 1) = 3/8 (svarer til udfaldene (K, P, P) (P, K, P) og (P, P, K))
P(X 3 = 2) = 3/8 (svarer til udfaldene (K, K, P), (K, P, K) og (P, K, K))
P (X 3 = 3) = 1/8 (svarer til udfaldene (K, K, K)).
Dette er tilstandsfordelingen for den stokastiske proces på tidspunkt
t0 = 3. Tilstandsfordelingen for den stokastiske proces {Zt, t ∈ 1,2,3} på
tidspunkt t0 = 3 er simplere. Den er givet ved:
P(Z3 = 0) = 1/2
P(Z3 = 1 ) = 1/2
■
Eksemplet ovenfor illustrerer nytten af stokastiske processer. I stedet
for direkte at skulle specificere eller udregne sandsynlighedsfordelin­
gen for antallet a f krone-udfald efter n kast, er det ofte nemmere (mere
intuitivt) at modellere situationen „fra bunden a f “ved hjælp a f stokasti­
ske processer og derigennem nå frem til en fordeling for den stokastiske
variabel a f interesse.
Det andet aspekt, ventetiden, handler om at fastslå, hvor lang tid det
tager, inden den stokastiske proces første gang når (eller passerer) en
bestemt tilstand. Eftersom den stokastiske proces består a f begivenhe­
der, som sker tilfældigt, er det også stokastisk, hvornår processen når en
bestemt tilstand. I eksemplet med den samspilsramte familie kan man
således ønske at kende sandsynligheden for, at der går mindst tre dage,
inden manden får bilen.
Mere formelt: Vi skal have bestemt fordelingen a f en ny stokastisk
som vi definerer som tiden, indtil den stokastiske proces,
variabel,
{X t, t ∈ T}, når en bestemt tilstand, x 0, dvs. tiden indtil X t ≥ x 0 for første
gang.10 Denne fordeling kalder man for en ventetidsfordeling.
Eksempel 7.5: Møntkast – del 5
I møntkasteksperimentet er vi interesserede i at finde ud af, hvor lang
tid det tager, inden vi får krone første gang. Derfor sætter vi x0 = 1 og
lader Y1 være den stokastiske variabel, som angiver, hvor lang tid det
tager, før den stokastiske proces, {X t, t ∈ 1,2,3}, første gang når værdi­
en 1. Sandsynlighedsfordelingen for denne variabel kan udregnes ud fra
sandsynlighederne i tabel 7.2:
P (Y1= 1) = 4/8, idet udfaldene (K, K, K), (K, K, P), (K, P, K) og (K,
P, P) alle giver krone i første kast.
Ρ (Υ1= 2) = 2/8, idet udfaldene (P, K, K) og (P, K, P) begge giver det
første krone-udfald efter to kast.
P( Y1= 3) = 1/8, idet udfaldet (P, P, K) giver det første krone-udfald
efter tre kast.
Bemærk, at Ρ ( Υ1 = 1) + Ρ( Υ1 = 2) + Ρ ( Υ1 = 3) = 7/8 og altså ikke
summerer til 1. Det skyldes, at udfaldet (P, P, P) ikke når værdien 1,
før processen slutter. Dermed er Ρ ( Υ1 > 3) = 1/8, selvom processen i
princippet slutter ved t = 3. Dette betyder dog blot, at den stokastiske
proces med sandsynlighed 1/8 ikke når værdien 1 inden for mængden
af tidsindeks, T. Derfor kan man beskrive ventetidsfordelingen med de
fire sandsynligheder: P( Y1= 1), P ( Y1= 2), P ( Y1= 3) og P (Y1> 3).
Figur 7.2 viser den realisering a f den stokastiske proces, der svarer
til udfaldet (P, K, K). Denne realisering når værdien x0 = 1 efter to tids­
perioder, dvs. Y1= 2.
hvilk et læ ses
10 D en form elle definition a f den stokastiske variabel,
som : F o r ethvert udfald, ω, a f et eksperim ent finder m an den k orteste tid, t, fo r hvilk en X t (ω ) e r m indst
lige så stor som x 0.
Figur 7.2:
Realiseret
ventetid for
x0=1
■
Alt efter anvendelsen bruger man også andre betegnelser for ventetiden
og dens fordeling. Man kan fx have et eksperiment, hvor man fortsæt­
ter med at udtrække elementer, indtil man når en bestemt værdi. Dette
kaldes „inverse sampling“. Man kalder også nogle gange ventetid for
„first passage time“.
Man kan udregne beskrivende mål for tilstandsfordelinger og ven­
tetidsfordelinger a f en stokastisk proces. Det foregår på samme måde
som i kapitel 5. Fx kan man være interesseret i at kende den forventede
af den stokastiske
eller den forventede tilstand,
ventetid,
proces på tidspunktet t0. Man kan ligeledes udregne fraktiler for disse
fordelinger.
7.4
Fire typer af stokastiske processer
For lettere at kunne anvende stokastiske processer i en praktisk sam­
menhæng er det nyttigt at kategorisere de stokastiske processer i fire
forskellige typer. Typerne afhænger af: ( 1) om den stokastiske variabel,
X t (eller Z )t , er diskret eller kontinuert, og (2) om den stokastiske proces
forløber i diskret eller i kontinuert tid.
Som vi har set i kapitel 4, er der forskel på, hvordan man laver be­
regninger med diskrete og kontinuerte stokastiske variabler, og det
samme er tilfældet for en stokastisk proces. Kategoriseringen har der­
for yderligere den fordel, at den gør det lettere at holde rede på, hvilke
værktøjer man skal bruge hvornår.
Tabel 7.3 illustrerer inddelingen i de fire typer. Efterfølgende gives
eksempler på hver a f de fire typer.
Tabel 7.3:
Tilstand (X t)
Fire typer af
Diskret
Kontinuert
Diskret
(tællelig)
A
C
Kontinuert
(ikke-tællelig)
B
D
stokastiske
processer
Tid (Τ)
Det gennemgående eksempel i dette kapitel omkring den samspilsramte
familie, som hver morgen kaster en mønt for at beslutte, hvem der skal
have bilen, er et eksempel på en stokastisk proces med diskret tilstand
og diskret tid (type A i tabel 7.3). Som vi skal se i afsnit 7.5, er en
Bernoulliproces et eksempel på en ofte anvendt stokastisk proces af
denne type. En Bernoulliproces er karakteriseret ved, at der på bestemte
tidspunkter (fx hver morgen) enten indtræffer eller ikke indtræffer en
begivenhed (fx et krone-udfald i et møntkast).
Et eksempel på en stokastisk proces med diskret tilstand og konti­
nuert tid (type B i tabel 7.3) er et opkald til en vagtlæge. Personer kan
ringe på ethvert tidspunkt (derfor kontinuert tid), men det er altid et
tælleligt antal personer, og sjældent mere end én ad gangen, der ringer
(derfor diskret tilstand). En ofte anvendt stokastisk proces a f denne type
er en Poissonproces, som vi skal se på i afsnit 7.6.
Et eksempel på en stokastisk proces med kontinuert tilstand og di­
skret tid (type C i tabel 7.3) er målingen a f betalingsbalancen én gang
om måneden. Overskuddet på betalingsbalancen kan i princippet være
lig med ethvert reelt tal, og derfor er tilstandsfordelingen kontinuert. En
„Gaussisk random walk“ er en ofte anvendt stokastisk proces a f denne
type, som vi skal se på i afsnit 7.7.
Et eksempel på en stokastisk proces med kontinuert tilstand og kon­
tinuert tid (type D i tabel 7.3) er aktiekurserne (i børsens åbningstid).
Aktierne kan handles på ethvert tidspunkt, og de kan handles til en hvil­
ken som helst ikke-negativ kurs. En ofte anvendt proces a f denne type
er en Wienerproces, som vi skal stifte bekendtskab med i afsnit 7.8.
Når vi i de følgende afsnit definerer forskellige stokastiske processer,
så er der grundlæggende fire ting, vi specificerer. Som kategoriseringen
i de fire typer ovenfor indikerer, skal man specificere tidsaspektet og de
mulige tilstande. Dette er de to første punkter nedenfor. Derudover spe-
cificerer vi fordelingen i et tidsinterval og en eventuel starttilstand samt
sammenhængen mellem disjunkte (ikke-overlappende) tidsintervaller:
1.
2.
3.
4.
Tid: Mængden a f tidsindeks, T.
Tilstand: Mulige tilstande a f X t.
Fordeling a f udfald i et tidsinterval og evt. starttilstand.
Sammenhæng mellem udfald i disjunkte tidsintervaller.
Disse fire grundlæggende elementer i specifikationen a f en stokastisk
proces giver en nyttig fremgangsmåde til at tænke over, hvordan man
kan bruge stokastiske processer til at modellere og forstå praktiske pro­
blemstillinger.
7.5
Bernoulliproces og binomialproces
I dette underafsnit ser vi på to eksempler på en stokastisk proces med
diskret tilstand og diskret tid. Det er Bernoulliprocessen og binomial­
processen. Vi har samlet disse to i dette afsnit, fordi de er transforma­
tioner a f hinanden og dermed begge a f typen A fra tabel 7.3, samtidig
med at de er interessante hver for sig.
7.5.1
Bernoulliproces
En Bernoulliproces er defineret ud fra følgende fire antagelser:
En B ernoulliproces, {Z t, t ∈ T}, opfylder følgende antagelser:
1. Tid: T = {1,2,3,...}
2. Tilstand: Z t ∈ {0,1}
3. Fordeling a f udfald: Zt ~ Ber(p ), dvs.:
4. Sammenhæng mellem udfald: Zt er statistisk uafhængig a f Z ,s
når t ≠ s
Bernoulliprocessen er således karakteriseret ved, at der på ethvert tids­
punkt, 1, 2, 3 osv., enten indtræffer (Z t = 1) eller ikke indtræffer (Z t = 0)
en begivenhed. Dvs. på hvert a f disse tidspunkter sker der en udtræk­
ning fra en Bernoullipopulation. De forskellige udtrækninger er endvi­
dere uafhængige (antagelse 4).
Figur 7.3 viser en realisering (en stikprøvesti), {zt, t ∈ T}, for en
Bernoulliproces. I figuren er T = {1,2,...,20}.
Figur 7.3: En
realisering af
en Bernoulli­
proces
7.5.2
Binomialproces
Det er ofte antallet a f begivenheder i en Bernoulliproces, som er af inter­
esse. Det giver anledning til en ny proces, binomialprocessen, som er
partiel-sumtransformationen af Bernoulliprocessen:
hvor Zm er det m ’te element i Bernoulliprocessen. Binomialprocessen
består altså af en sum af uafhængige Bernoullifordelte stokastiske vari­
abler. Vi ved fra kapitel 6, at en sådan sum er binomialfordelt med para­
metrene n og p, hvor n er antallet a f stokastiske variabler i summen, og
p er parameteren fra Bernoullifordelingen. Med dette resultat i hånden
kan vi formelt definere en binomialproces:
En binomialproces, {X t, t ∈ T}, opfylder:
1. Tid: T= {1,2,3,...}
2. Tilstand: X t ∈ {0,1,2,...t }
3. Fordeling a f udfald: (X t+
n – Xt) ~ Bin(n ,p ) og X 0 = 0,
hvor p er sandsynligheden for en succes i den underliggende
Bernoullifordeling.
4. Sammenhæng mellem udfald:
når t 1> t2 > t3 > t4
er statistisk uafhængig
Antagelse 3 siger, at antallet af begivenheder i et tidsrum bestående af
n tidspunkter er binomialfordelt med parametrene n og p. Bemærk, at
antagelsen indebærer, at sandsynligheden for et antal udfald mellem to
tidspunkter kun afhænger af tidsforskellen mellem de to tidspunkter og
ikke af, hvornår i processen denne tidsforskel forekommer. Desuden er
antallet a f udfald i et tidsrum uafhængigt af antallet a f udfald i et andet
ikke-overlappende tidsrum (antagelse 4). Begge dele følger af, at de
underliggende Bernoullifordelte variabler, Z t, er uafhængige.
Figur 7.4 viser den realisering, {x t, t ∈ T}, af binomialprocessen,
som svarer til realiseringen, {zt, t ∈ T} , i figur 7.3, dvs. udfaldet af det
underliggende eksperiment er det samme i de to figurer. Det ses fx, at
for t = 8 er x 8 = 3 , fordi der indtraf tre begivenheder inden for de første
otte tidspunkter i figur 7.3.
Figur 7.4:
En realisering
af en binomial­
proces
En binomialproces tilhører de såkaldte tælleprocesser. En tælleproces
modellerer et antal begivenheder, som er forekommet frem til et bestemt
tidspunkt. Tælleprocesser er nyttige til at modellere mange praktiske
problemstillinger. I de næste underafsnit udleder vi derfor henholdsvis
tilstandsfordelingen og ventetidsfordelingen for binomialprocessen.
7.5.3
Tilstandsfordeling for en binomialproces
Tilstandsfordelingen for
i en binomialproces følger umiddelbart af
antagelse 3 ovenfor. Sætter vi t = 0 og n = t0, så har vi:
Tilstandsfordelingen for binomialprocessen:
Sandsynlighedsfunktionen for
Middelværdi og varians er:
Eftersom tilstandene er tællelige, er tilstandsfordelingen diskret. Ud­
trykkene for sandsynlighedsfunktion, middelværdi og varians følger
direkte ved indsættelse i formlerne for en binomialfordeling fra kapitel
6. Det ses, at den forventede tilstand (middelværdien) a f binomialpro­
cessen stiger med tiden, t0, og det samme gør variansen.
Eksempel 7.6: Møntkast – del 6
I møntkasteksperimentet er middelværdien a f X 3 ifølge ovenståen­
de formel lig med: t0 · p = 3 · 0,5 = 1,5. Dette kan man også over­
bevise sig om ved at udregne middelværdien direkte fra sandsyn­
lighedsfordelingen for X 3 i eksempel 7.4. Variansen er tilsvarende:
t0 · p ( 1 – p ) = 3 · 0 , 5 · ( 1 – 0 ,5) = 0,75.
■
7.5.4
Ventetidsfordeling for en binomialproces
Lad
være tiden indtil binomialprocessen, X t er lig med x 0 for første
gang. Fordelingen af
er så anvendt, at den har fået sit eget navn: Den
negative binomialfordeling. Den er givet i den følgende boks:
Ventetidsfordelingen for en binomialproces (den negative
binomialfordeling):
Sandsynlighedsfunktionen for
Middelværdi og varians er:
Eftersom mængden a f tidsindeks er tællelig, er ventetiden nødvendigvis
en diskret stokastisk variabel.
Man kan udlede den negative binomialfordeling ved at benytte den
struktur, som den stokastiske proces giver. For at binomialprocessen
når tilstanden x 0 første gang på tidspunkt y, skal det være tilfældet, at
binomialprocessen er i tilstand x0 – 1 på tidspunkt y – 1. Ellers kan den
ikke nå x 0 på tidspunkt y , da den kun kan springe med 1 ad gangen.
Ydermere skal den springe med 1 på tidspunkt y , idet den ellers ikke vil
nå x 0 første gang på tidspunkt y. Det vil sige, at Xy – X y–1 = Zy = 1.
Ud fra ovenstående betragtninger kan betingelsen for at opnå tilstan­
den x 0 på tidspunkt y derfor omformuleres til følgende betingelse:
Med brug a f regneregler for betingede sandsynligheder kan højresiden
omskrives til:
P (X y–1 = (x0 – 1) ,Z y = 1) = P (X y–1 = (x0 – 1)|Z y = 1) · P (Z y = 1)
Ifølge antagelse 4 for binomialprocessen e r X y–1 og Zy statistisk uafhæn­
gige. Dermed fås:
Begge sandsynligheder på højresiden er kendte og kan findes ved hjælp
a f henholdsvis Bin(y – 1, p ) og Ber(p ), og ved indsættelse a f disse fås
formlen for den negative binomialfordeling i ovenstående boks.
Skal man finde ventetiden til første gang, der sker en begivenhed, er
x 0 = 1 og Y1 ~ Negbin(1,p ). Denne fordeling har også fået sit eget navn,
nemlig den geometriske fordeling. Den skrives Y1 ~ Geo(p ). Sandsyn­
lighedsfunktionen for den geometriske fordeling er:
hvilket blot er den negative binomialfordeling med x 0 = 1. Da Bernoul­
liprocessen er sammensat a f uafhængige Bernoullifordelte stokastiske
variabler, gælder det, at fra ethvert tidspunkt i en Bernoulliproces er
ventetiden til den næste begivenhed geometrisk fordelt.
Eksempel 7.7: Møntkast – del 7
I møntkasteksemplet kan man beregne den forventede ventetid til det
første krone-udfald ud fra formlen i ovenstående boks:
Den forventede ventetid til det første krone-udfald er således to kast.
■
7.6
Poissonproces
En Poissonproces er et eksempel på en stokastisk proces med diskret
tilstand og kontinuert tid. Man kan fortolke Poissonprocessen som en
proces, der til ethvert tidspunkt måler antallet a f begivenheder op til
dette tidspunkt. Dermed er Poissonprocessen også en tælleproces. Den
er defineret ud fra følgende fire antagelser:
En Poissonproces, {X t, t ∈ T} opfylder:
1. Tid: T = [0,∞)
2. Tilstand: X t ∈ {0,1,2,3,...}
3. Fordeling a f udfald: X t+
τ – X t~ Poi(λ · τ) og X 0 = 0, hvor λ er
det forventede antal begivenheder per tidsenhed.
4. Sammenhæng mellem udfald:
er statistisk uafhængig
når t 1>t2 > t3> t4
Ifølge antagelse 3 er antallet a f begivenheder i et interval a f længden
r Poissonfordelt med parameteren λ · τ, hvor λ er det forventede antal
begivenheder per tidsenhed. Antagelse 3 indebærer, at det kun er læng­
den, r, a f tidsintervallet, som har betydning for fordelingen af antallet
a f begivenheder, hvorimod tidspunktet for starten a f tidsintervallet ikke
har nogen betydning.
7.6.1
Tilstandsfordeling for en Poissonproces
Tilstandsfordelingen for
kan man finde direkte fra antagelse 3. Sæt­
ter vi t = 0 and τ = t0, så har vi:
Tilstandsfordelingen for en Poissonproces:
Sandsynlighedsfunktionen for
Middelværdi og varians er:
Eftersom tilstandene er tællelige, er tilstandsfordelingen diskret. Ud­
trykkene for sandsynlighedsfunktion, middelværdi og varians følger di­
rekte ved indsættelse i formlerne for en Poissonfordeling fra kapitel 6.
Ligesom ved binomialprocessen ses det, at middelværdien stiger med
tiden, t0. Det samme gør variansen.
Man kan bruge informationen om Poissonprocessens tilstand på et
givet tidspunkt, s, til at revidere sandsynlighederne for processens til­
stand på et senere tidspunkt, t. Dette gør man ved hjælp a f betingede
sandsynligheder. Hvis der på tidspunkt s er indtruffet b begivenheder,
er sandsynligheden for, at der på tidspunkt t er indtruffet x t begivenhe­
der, lig med sandsynligheden for, at der indtræffer x t – b begivenheder
mellem tidspunkt s og tidspunkt t.
P (X t = xt | X s = b ) = P (X t – X s = x t – b)
Dette resultat følger a f antagelse 4 i ovenstående boks og dermed gæl­
der dette resultat uanset fordelingen a f X t og X s. Fra Poissonprocessens
tredje antagelse kender vi imidlertid fordelingen a f X t – X s. Det betyder,
at vi kan udregne den betingede sandsynlighed ved at bruge Poissonfor­
delingen med parameteren λ · (t – s).
Eksempel 7.8: Opkald til vagtlægen – del 1
I en lille region er der i gennemsnit 10 opkald per time til vagtlægen. Vi
antager, at antallet a f opkald følger en Poissonproces med λ = 10. Efter
et kvarter er sandsynligheden for, at tre personer har ringet, givet ved
idet X 0,25 ~ Poi(10 · 0,25).
Sandsynligheden for, at der er 12 personer, som har ringet efter en
time, er
idet X 1~ P oi(10 · 1).
Hvis vi ved, at der er tre personer, som har ringet efter et kvarter, så
er sandsynligheden for, at der er 12 personer, som har ringet efter en
time, givet ved:
P (X 1 = 12 | X 0,25 = 3) = P (X 1 – X 0,25 = 12 – 3)
= P (X 1 – X 0,25 = 9)
idet (Χ 1– X 0,25) ~ Poi(10 · ( 1 – 0,25)).
Bemærk, at sandsynligheden for, at 12 personer ringer på en time, er
højere, hvis vi ved, at der allerede er tre personer, der har ringet inden
for det første kvarter. Hvis vi omvendt vidste, at ingen personer havde
ringet inden for det første kvarter, så ville sandsynligheden for, at 12
personer ringer på en time, være mindre, end hvis vi ikke vidste, hvor
mange der havde ringet det første kvarter.
■
7.6.2
Ventetidsfordeling for en Poissonproces
være tiden indtil Poissonprocessen når værdien x 0. Fordelingen
har også fået sit eget navn og kaldes Erlangfordelingen. Den er
beskrevet i næste boks.
Lad
Ventetidsfordelingen for en Poissonproces (Erlangfordelin­
gen):
Tæthedsfunktionen for
Og den kumulative sandsynlighedsfunktion er:
Middelværdi og varians er:
Fordi mængden a f tidsindeks er utællelig (et interval) i dette tilfælde, er
ventetiden en kontinuert stokastisk variabel.
Man kan udlede Erlangfordelingen på følgende måde: Hvis man
skal vente længere end tiden y , indtil antallet a f begivenheder er x 0, så
må det betyde, at der er sket færre end x 0 begivenheder til tidspunkt y .
Udtrykt med sandsynligheder gælder det derfor:
hvor X y er tilstanden på tidspunkt y, og X y~ Poi(λ · y ) ifølge tilstands­
fordelingen fra afsnittet ovenfor. Eftersom
P(X y< x 0) = P(X y≤ x 0 –1), fås Erlangfordelingen ved at indsætte i først­
nævnte udtryk:
Hvis man er interesseret i, hvornår næste begivenhed indtræffer i en Po­
issonproces, sætter m an x 0 = 1 i Erlangfordelingen. Derved fås følgende
tæthedsfunktion og kumulative sandsynlighedsfunktion for Y1(tiden til
næste begivenhed):
Denne fordeling, som er et specialtilfælde af Erlangfordelingen, kalde;
også for eksponentialfordelingen og skrives: Y1~ EXP(λ).
Eksempel 7.9: Opkald til vagtlægen – del 2
I eksempel 7.8 antog vi, at opkaldene til vagtlægen fulgte en Poisson­
proces med λ = 10. Sandsynligheden for, at man højst skal vente i et
kvarter, før to personer har ringet, er givet ved:
= 1 – 0 ,0 8 2 – 0,205 = 0,713
idet Y2 ~ Erlang(10,2). Sandsynligheden for, at man skal ven­
te mere end en time på, at 12 personer har ringet, er tilsvarende:
P( Y12 > 1) = 1 – P ( Y12 ≤ 1), hvor Y12 ~ Erlang(10,12). Prøv selv at regne
denne ud!
Sandsynligheden for, at man højst venter to minutter på et opkald, er
P (Y1≤ 2/60), hvor Υ1 ~ Erlang(10, 1) = EXP(10). Denne sandsynlighed
er:
■
7.7
Gaussisk random walk
En Gaussisk random walk er et eksempel på en stokastisk proces med
kontinuert tilstand og diskret tid. Den Gaussiske random walk er én
blandt mange specifikationer a f en random walk. Om en random walk
gælder generelt, at det er en stokastisk proces, hvor hver stokastisk
variabel, X t, kan skrives som en partiel sum a f uafhængige identisk
fordelte stokastiske variabler.11 Binomialprocessen er således også et
eksempel på en random walk. Som navnet antyder, kan denne proces
bruges til at illustrere „tilfældig gang“, fx den slags der observeres ef­
ter våde julefrokoster, hvor hvert skridt kan være enten fremad- eller
bagudrettet.
I en Gaussisk random walk er udfaldet på et bestemt tidspunkt nor­
malfordelt (også kaldet Gaussisk). Den Gaussiske random walk er defi­
neret ud fra følgende fire antagelser:
En Gaussisk random walk, {X t, t ∈ T}, opfylder:
1. Tid: T= {0,1,2,3,...}
2. Tilstand: X t ∈ (–∞ ,∞)
3. Fordeling a f udfald: (X t+n – X t) ~ Ν ( n ·μ , n ·σ2) o g X 0 = 0,
hvor μ kaldes driftparameteren, og σ2 kaldes diffusionskoef­
ficienten
4. Sammenhæng mellem udfald:
når t1 > t2 > t3 > t4
er statistisk uafhængig
En Gaussisk random walk er en stokastisk proces med kontinuert til­
stand. Det betyder, a t X t kan antage en hvilken som helst værdi. Anta­
gelse 3 fortæller os, at ændringen i processen i et tidsrum bestående af n
perioder findes ved et udtræk fra en normalfordeling, hvor middelvær­
dien og variansen afhænger af, hvor langt tidsrummet er: N ( n μ , n · σ 2).
Antagelse 4 siger endvidere, at denne udtrækning er uafhængig a f for­
tiden i processen.
1 1 En random walk, {X t, t = 1, 2, 3, ...} , opfylder: i) X t = Z 1 + Z 2 + .. + Z t =
stisk uafhæ ngig a f Z s, når t ≠ s ; og iii) fordelingen a f Z t er den sam m e uanset t.
ii) Zt e r stati­
7.7.1
Tilstandsfordeling for en Gaussisk random walk
Tilstandsfordelingen kan man finde direkte fra antagelse 3 ovenfor.
Sætter vi t = 0 og n = t0, så har vi:
Tilstandsfordelingen for en Gaussisk random walk:
Tæthedsfunktionen for
Middelværdi og varians er:
Betingelsen om, at den Gaussiske random walk, {X t t ∈ T}, starter ved
X 0 = 0, er ikke restriktiv. Hvis man gerne vil have en stokastisk proces,
der starter ved en anden værdi,
, men derudover har
samme egenskaber som en Gaussisk random walk, sa er sammenhæn­
gen mellem de to givet ved:
Den stokastisk proces
kaldes også for en Gaussisk random
walk med start i a.
På samme måde som i Poissonprocessen kan man udregne den be­
tingede sandsynlighed for, at processen er i en bestemt tilstand på tids­
punkt t, givet at man ved, hvor den befinder sig på et tidligere tidspunkt,
s. Under antagelse 4 i boksen ovenfor kan vi udnytte, som ved Poisson­
processen, at:
P (X t≤x t | X s = b) = P (X t–X s ≤ x t –b)
Det betyder, at vi kan udregne den betingede sandsynlighed ved at
anvende normalfordelingen med middelværdi (t – s) · μ og varians
(t – s) · σ2.
Eksempel 7.10: Valutareserven – del 1
Forestil dig et land, som på årsbasis har et valutaunderskud på gen­
nemsnitligt 20 milliarder kr. Lad os derfor antage, at indholdet af va­
lutareserven på årsbasis følger en Gaussisk random walk med μ = –20
(milliarder kr.) og σ2 = 625. Valutareserven indeholder 60 mia. kr. på
starttidspunktet (år 0). Sandsynligheden for, at valutareserven er tom
efter to år, er derfor givet ved:
hvor
er en Gaussisk random walk med startværdi i 60. Ifølge oven­
stående er X 2 normalfordelt med middelværdi 2 · (–20) = –4 0 og varians
2 · 625 = 1250. Vi kan da udregne ovenstående sandsynlighed:
Bemærk, at selvom valutakassen ikke er tom på tidspunkt 2, kan valu­
takassen godt have været tom mellem tidspunkt 0 og tidspunkt 2. For
at undersøge sandsynligheden for dette skal man se på ventetidsforde­
lingen.
■
7.7.2
Ventetidsfordeling for en Gaussisk random walk
Ventetidsfordelingen for en Gaussisk random walk er kompliceret og
kan ikke skrives op på en simpel form. Vi vælger derfor ikke at disku­
tere den yderligere her. Man kan dog bruge ventetidsfordelingen for
en Wienerproces, gennemgås i næste afsnit, som en approksimation til
denne.
7.8
Wienerproces
En Wienerproces er et eksempel på en stokastisk proces med kontinuert
tilstand og kontinuert tid. Den er defineret ud fra følgende fire antagel­
ser:
En Wienerproces, {X t, t ∈ T}, opfylder:
1. Tid. T = 0 ,∞)
2. Tilstand: X t ∈ (–∞ ,∞)
3. Fordeling a f udfald: (Χ t+τ – X )t ~ Ν(μ · τ ,σ 2τ ) og X 0 = 0, hvor μ
kaldes driftparameteren, og σ2 kaldes diffusionskoefficienten
4. Sammenhæng mellem udfald:
når t1> t 2> t 3> t4
er statistisk uafhængig
Wienerprocessen kaldes også for en Brownsk bevægelse. Wienerpro­
cessen minder meget om den Gaussiske random walk med den forskel,
at Wienerprocessen forløber i kontinuert tid. Det betyder, at den hele
tiden ændrer sig, mens den Gaussiske random walk kun ændrer sig på
de fastsatte tidspunkter (1,2, 3 osv.). Figur 7.5 viser eksempler på reali­
seringer a f henholdsvis en Gausssisk random walk og en Wienerproces.
Figur 7.5:
Realiseringer
af en Gaussisk
random walk
og en Wiener­
proces
7.8.1
Tilstandsfordeling for en Wienerproces
Tilstandsfordelingen følger direkte af antagelse 3 og er fuldstændig ma­
gen til tilstandsfordelingen for en Gaussisk random walk:
Tilstandsfordelingen for en Wienerproces:
Tæthedsfunktionen for
Middelværdi og varians er:
Som for den Gaussiske random walk gælder det, at betingelsen
for startværdien, X 0 = 0, ikke er restriktiv. Hvis man ønsker en
med startværdi i a, så gælder det, at
Wienerproces,
hvor {X t, t ∈ T} er en Wienerproces som
defineret i boksen ovenfor.
7.8.2
Ventetidsfordeling for en Wienerproces
være tiden indtil Wienerprocessen, X t, når x 0 første gang.
Lad
Fordelingen af kaldes den inverse Gaussiske fordeling eller Wald-for­
delingen. Den er beskrevet i næste boks.
Ventetidsfordelingen for en Wienerproces (den inverse
Gaussiske fordeling):
F o r x0 > 0 o g µ > 0:
Tæthedsfunktionen for
Den kumulative sandsynlighedsfunktion er:
Middelværdi og varians er:
Ventetiden er defineret som den tid, det tager processen at nå eller pas­
sere værdien x0. Man kan også analysere, hvor lang tid der går, inden en
proces bliver mindre end eller lig med en bestemt værdi. For en Wiener­
proces kan man bruge resultatet ovenfor direkte på grund a f følgende
betragtning: Lad Wt være en Wienerproces med negativ driftparameter,
μ W< 0. Den tid, det tager Wt at nå ned til værdien w0 < 0, svarer til den
tid, det tager den „spejlvendte“ proces, X t (hvor X t er magen til W, blot
med positiv driftparameter, μX = –μ W
) at nå op til værdien – w0 > 0. Det
næste eksempel illustrerer dette.
Eksempel 7.11: Valutareserven – del 2
I eksempel 7.10 antog vi, at indholdet a f valutareserven følger en Gaus­
sisk random walk med μ = –20 og σ2 = 625. Hvis valutareserven opgø­
res løbende, er dens indhold bedre beskrevet med en Wienerproces med
de samme parametre.
Lad Y–60 være ventetiden, indtil Wienerprocessen med startværdi i 0
passerer –60 for første gang. Vi bruger –60, fordi valutareserven til at
starte med indeholder 60 mia. kr., så Y–60 svarer til ventetiden, indtil va­
lutareserven er tømt for første gang. Denne er også lig med ventetiden
indtil den spejlvendte proces med startværdi i 0 når 60, og derfor følger
Y–60 følgende inverse Gaussiske fordeling:
Sandsynligheden for, at valutareserven tømmes inden for de næste to år,
er da P(Y–60 < 2), som kan udregnes ved at indsætte i udtrykket for den
kumulative sandsynlighedsfunktion i boksen ovenfor:
■
I eksempel 7.10 udregnede vi sandsynligheden for, at valutareserven
var tom efter to år. Denne sandsynlighed – som er den samme for den
Gaussiske random walk og Wienerprocessen – var mindre end oven­
stående sandsynlighed for, at den tømmes første gang inden to år. Det
skyldes, at valutareserven godt kan blive midlertidigt tømt, inden de to
år er gået, uden at være tom efter præcis to år.
7.9
Resumé af udvalgte stokastiske processer
I dette kapitel har vi gennemgået idéen med en stokastisk proces og vist
nogle forskellige eksempler på stokastiske processer. De mest alminde­
lige er opsummeret i nedenstående tabel.
Tabel 7.4:
Stokastisk
proces
Tid
Tilstand
Tilstands­
fordeling
Ventetids­
fordeling
stokastiske
Binomialproces
Disk.
Disk.
Bin (t0,p )
Negbin(x0,p )
processer
Poissonproces
Kont.
Disk.
Poi(t0 · λ)
Erlang(λ ,x0)
Gaussisk random
walk
Disk.
Kont.
Ν (μ · t0,σ 2·t0)
Udeladt
Wienerproces
Kont.
Kont.
Ν (μ · t0, σ 2·t0)
Oversigt over
udvalgte
7.10
Opgaver
1. Repetitionsspørgsmål
a) Hvad er en stokastisk proces? Hvordan er den defineret?
b) Hvad forstår man ved en realisering eller en stikprøvesti?
c) Forklar, hvad det vil sige, at en stokastisk proces foregår i hen­
holdsvis diskret og kontinuert tid.
d) Forklar, hvad man forstår ved en partiel-sumtransformation.
e) Forklar, hvad man forstår ved en første-differenstransformation.
f) Gør rede for, hvordan henholdsvis tilstandsfordelingen og vente­
tidsfordelingen for en stokastisk proces er defineret, og hvad de
kan bruges til.
g) Forklar forskellen på de fire typer a f stokastiske processer i afsnit
7.4.
2. Betragt en binomialproces, {X t, t = 1,...,3}, med p = 0,5. Lad
W t = 2 · X t – t. Processen {Wt, t = 1,...,3} kaldes en simpel random
walk, fordi hvert skridt er enten +1 eller – 1.
a) Opskriv alle stikprøvestier for {Wt, t = 1,...,3} og sandsynlighe­
den for hver a f dem.
b) Find tilstandsfordelingen for Wt på tidspunkt t = 3.
c) Find sandsynligheden for, at Wt er større end eller lig med 2 på
tidspunkt t = 3.
d) Find sandsynligheden for, at Wt er mindre end 1 på tidspunkt
t = 3.
e) Find ventetidsfordelingen for Y W
0 for w0 = 1.
f) Find sandsynligheden for, at ventetiden er længere end 2, når
w0= l .
3. Udviklingen i huspriserne i et særligt yndet område a f landet kan
beskrives ved en Gaussisk random walk, {X t, t = 1,...}, med drift­
parameter lig med 2 og diffusionskoefficient lig med 1. Processen
starter i X 0 = 0, hvilket dog ikke dækker over, at huse er gratis i
udgangspunktet, men blot at det initiale prisniveau er normaliseret
til 0, fordi det er udviklingen i prisniveauet og ikke det absolutte
niveau, der har interesse.
a) Find tilstandsfordelingen for følgende transformation af den
Gaussiske random walk: Wt = a + b · X t, hvor a og b er konstan­
ter. Denne transformation antages at kunne beskrive udviklingen
i lejlighedspriserne i samme område, når a = – 1 og b= 1,2.
b) Find sandsynligheden for, a t X t er mindre end 4 for t = 2.
c) Find sandsynligheden for, at W t er mindre end 4 for t = 2.
d) Find sandsynligheden for, at X t er større end 2 for t = 3.
e) Find sandsynligheden for, at Wt er større end 2 for t = 3.
f) Find tilstandsfordelingen for følgende transformation a f den
Gaussiske random walk: Wt = X t – X t–1.
g) Find sandsynligheden for, at Wt er mindre end 4 for t = 2.
h) Find sandsynligheden for, at Wt er større end 2 for t = 3.
4. Prisen på et finansielt aktiv følgeren Wienerproces med driftparameter
μ = 0,1 og diffusionskoefficient σ2 = 0,2. Tiden måles i dage. Ved
årsskiftet er prisen på aktivet 274 kr. (per stk.).
a) Hvad er sandsynligheden for, at aktivet har en lavere pris i slut­
ningen a f januar end ved årsskiftet (dvs. efter 31 dage)?
b) Hvad er sandsynligheden for, at man skal vente mere end 31
dage, før prisen på aktivet er højere end 280 kr.?
c) Hvad er den forventede pris a f aktivet efter et år (365 dage)?
8
Fra deduktion til induktion
I de foregående kapitler har vi kigget på situationer, hvor fordelingen af
den stokastiske variabel var kendt. Vi udnyttede den stokastiske varia­
bels fordeling til at beregne sandsynlighederne for at realisere bestemte
værdier. Vi fortolkede også den stokastiske variabel som resultatet af
en udtrækning fra en population – enten en virkelig population eller en
superpopulation – hvor sandsynlighedsfordelingen for den stokastiske
variabel var bestemt a f populationens fordeling (sammensætning) samt
udvælgelsesmekanismen. Vi forudsatte, at populationen og udvælgel­
sesmekanismen var kendte. Denne type analyse kalder man deduktion,
fordi man analyserer fra det generelle (populationen og udtræknings­
mekanismen) til det specifikke (stikprøven).
I de resterende kapitler vender vi problemstillingen om. Statistiske
metoder har ofte til formål at hjælpe os med at lære om populationen
eller udtrækningsmekanismen. Måden at opnå denne information på er
ved at udtrække en stikprøve. Denne type analyse kalder man indukti­
on, fordi man analyserer fra det specifikke (stikprøven) til det generelle
(populationen og udtrækningsmekanismen).
Ved hjælp a f den erhvervede viden om populationen og udtræknings­
mekanismen kan man lave forudsigelser. En forudsigelse er et udsagn
om, hvordan man tror, en fremtidig stikprøve vil blive. Først benytter
man sig altså a f en (eksisterende) stikprøve til at lære om populationen
og udvælgelsesmekanismen. Dette er induktion. Derefter udnytter man
det lærte om populationen og udvælgelsesmekanismen til at forudsige
en fremtidig stikprøve. Dette er deduktion.
I afsnit 8.1 kigger vi nærmere på induktive analyser, og i afsnit 8.2
giver vi en oversigt over de forskellige analysesituationer, man kan be­
finde sig i. Dette giver samtidig en forklaring på bogens struktur. I afsnit
8.3 giver vi et kort overblik over de resterende kapitler i bogen.
8.1
Induktive analyser
Man foretager en meningsmåling i forbindelse med en EU-afstemning,
fordi man ikke kender andelen a f ja- og nej-stemmer i befolkningen
(populationen). Tilsvarende kan en virksomhed foretage en markedsun­
dersøgelse, fordi den ønsker at afdække befolkningens (populationens)
efterspørgsel efter et nyt produkt. Disse informationer bruger man da til
at skønne om, hvor stor en andel a f hele befolkningen der vil stemme
ja, eller hvor meget befolkningen vil efterspørge i alt a f produktet. Man
observerer altså nogle få elementer (stikprøven) fra en virkelig popula­
tion og bruger disse til at udtale sig om hele populationen.
I tilfælde med en superpopulation er det ofte udvælgelsesmekanis­
men, som er a f interesse. Fx kan en virksomhed, der producerer skruer,
være interesseret i at vide, hvorledes længden a f de skruer, der kommer
ud a f produktionsapparatet, forventes at fordele sig. Den ved måske, at
skruerne altid har en længde mellem 12 og 17 mm, men den vil gerne
vide, hvad middellængden af de producerede skruer er. De producerede
skruer er ikke en stikprøve fra en virkelig population. De er derimod en
stikprøve fra en superpopulation a f mulige skruelængder, som befinder
sig i intervallet mellem 12 og 17 mm. Denne superpopulation er fuld­
stændigt beskrevet. Det ukendte er, hvorledes udvælgelsesmekanismen
virker på denne superpopulation. Det er udvælgelsesmekanismen, som
bestemmer, hvordan fordelingen a f de producerede skruelængder ser
ud. Her bruger virksomheden altså stikprøven til at lære noget om en
sandsynlighedsfordeling a f en stokastisk variabel, nemlig den stokasti­
ske variabel, som angiver længden på en produceret skrue.
Stikprøver kan altså bruges både til at lære om virkelige populatio­
ner og til at lære om sandsynlighedsfordelinger a f stokastiske variabler.
Husk dog på, at en virkelig population altid kan repræsenteres ved for­
delingen af en stokastisk variabel. Hvis den stokastiske variabel angiver
værdien af det udtrukne element, og alle elementer har samme chance
for udvælgelse, så er fordelingen a f den stokastiske variabel givet ved
andelsfunktionen for den virkelige population. Dette viste vi i kapitel 4.
Man kan altså tænke på alle situationer, hvor man anvender stik­
prøver i en induktiv analyse, som situationer, hvor man ønsker at lære
noget om fordelingen a f en stokastisk variabel. Denne abstraktion er
særdeles anvendelig.
8.2
En oversigt over analysesituationer
I dette afsnit giver vi en kort oversigt over, hvornår og til hvilke formål
man anvender deduktive og induktive analyser i statistikken. Tabel 8.1
viser de mulige situationer, vi kan befinde os i, når vi skal foretage
en analyse. Populationen og udvælgelsesmekanismen kan enten være
kendte eller ukendte.
Tabel 8.1:
Analyse­
situationer
Population
Kendt
Ukendt
Kendt
(1)
(2)
Ukendt
(3)
(4)
Udvælgelsesmekanisme
I situation ( 1) i tabel 8.1 er både population og udvælgelsesmekanisme
kendte. Formålet med analyser i denne situation er at forudsige en frem­
tidig stikprøve. Opgaven er rent deduktiv, og derfor har vi kun brug for
sandsynlighedsteori og ikke statistik. Hvis man fx kaster en terning, så
er både populationen (ener, toer, ..., sekser) og udvælgelsesmekanis­
men (alle udfald har samme chance for udvælgelse) kendte. Formålet
er at forudsige sandsynligheden for at få fx en sekser. Selvom vi havde
en stikprøve til rådighed i denne situation, ville vi ikke have noget at
bruge den til. Det er udfaldet a f en fremtidig stikprøve, som vi forsøger
at forudsige. Det er denne type analyse, vi har lavet hidtil i bogen.
Situation (2) med en ukendt population og en kendt udvælgelsesme­
kanisme opstår fx, når vi ønsker at lære noget om en virkelig population.
Man kan eksempelvis undersøge, hvordan danskernes holdning er til et
tv-program, eller hvordan befolkningen vil stemme ved en EU-afstem­
ning. Hvis vi har en stikprøve, hvor vi ved, at alle i populationen har
haft samme sandsynlighed for udvælgelse, så er opgaven rent induktiv:
Baseret på stikprøven skal vi skønne om populationens egenskaber.
Situation (3) med en kendt population, men med en ukendt udvæl­
gelsesmekanisme havde vi ovenfor i skrueeksemplet. En sådan situati­
on forekommer typisk, når man skal lave en forudsigelse. For at lave
en forudsigelse skal man have kendskab til både population og udvæl­
gelsesmekanisme. Da udvælgelsesmekanismen er ukendt, er opgaven
først at foretage et skøn over denne ved hjælp af stikprøven. Denne
opgave er induktiv. Dernæst kan man bruge kendskabet til populationen
og skønnet om udvælgelsesmekanismen til at lave en forudsigelse af
en fremtidig stikprøve, fx længden a f nogle fremtidige skruer. Denne
opgave er deduktiv.
Et andet eksempel på dette er, når vi ønsker at forudsige kursen på
en obligation i fremtiden. Her har vi tidligere kurser på den samme
obligation til rådighed. Denne stikprøve er udvalgt fra en superpopula­
tion af alle mulige kurser (kurserne fra 0 til uendelig). Det er imidlertid
ukendt, hvordan udvælgelsen er sket fra denne superpopulation. Vi kan
opnå et skøn om sandsynligheden for de forskellige kurser i superpo­
pulationen ved hjælp a f stikprøven. Dernæst kan vi bruge disse sand­
synligheder til en forudsigelse a f fx kursen om to uger, da denne udgør
en ny (fremtidig) stikprøve. Her følges den induktive analyse igen a f en
deduktiv analyse.
Situation (4), hvor både population og udvælgelsesmekanisme er
ukendte, forekommer i tilfælde med virkelige populationer, hvor man
er interesseret i at lære om populationen eller lave en forudsigelse. For
eksempel kunne man ønske at kende en populations holdning til kva­
liteten a f en restaurant. Hvis stikprøven består a f alle de personer, som
besøger restauranten, så er udvælgelsesmekanismen i forhold til hele
populationen også ukendt, da man ikke ved, med hvilken sandsynlig­
hed en person spiser på restauranten. Denne sandsynlighed afhænger
typisk a f personens holdning til restaurantens kvalitet, og denne hold­
ning er ukendt.
8.3
Estimatorer og test
I det følgende kapitel kigger vi nærmere på, hvordan man kan opnå
en repræsentativ stikprøve fra en population samt de problemer, der
ofte opstår i forbindelse med indsamlingen a f en stikprøve. Som nævnt
ovenfor anvender man stikprøven i en induktiv analyse til at danne sig
et skøn over en fordeling (af en stokastisk variabel) eller et aspekt af
en fordeling, fx middelværdien. Et sådant skøn, som er dannet på bag­
grund en stikprøve, kalder man for en estimator.
Kapitel 10 præsenterer den generelle idé bag estimatorer ved at fo­
kusere på en estimator for middelværdien a f en fordeling, når vi har en
simpel tilfældig stikprøve til rådighed. I kapitel 11 kigger vi på andre
estimatorer for middelværdien under alternative stikprøveformer. Ka­
pitel 12 giver en oversigt over forskellige estimatorer, herunder også
estimatorer for andre parametre i fordelingen, fx variansen.
Fordi en estimator er baseret på en stikprøve, er estimatoren ligesom
stikprøven stokastisk. Vi kan derfor ikke udtale os skråsikkert om vær­
dien af den parameter, som estimatoren er et skøn om. Vi kan dog sige
noget om, hvilken størrelsesorden parameteren sandsynligvis har. Det
gør vi ved at konstruere konfidensintervaller for parameteren eller ved
at teste hypoteser om parameteren.
Ved konstruktion af konfidensintervaller anvender vi stikprøven til
at opstille et interval a f værdier (i stedet for blot et enkelt estimat), som
den „sande“ parameterværdi med stor sandsynlighed ligger indenfor.
Konfidensintervaller skal vi kigge på i kapitel 13.
Hvis vi fx har en hypotese om, at en fordelings middelværdi er 5,
kan vi bruge stikprøven til at udregne et skøn over middelværdien og
sammenligne dette med den hypotetiske værdi. Hvis de to ligger langt
fra hinanden, er det usandsynligt, at fordelingens middelværdi er 5, og
vi forkaster derfor hypotesen. Dette er idéen bag hypotesetest, som vi
gennemgår i kapitel 14.
I kapitlerne 15 og 16 behandler vi metoder til at teste hypoteser om
sammenhænge mellem stokastiske variabler. Et typisk eksempel er, når
vi ønsker at undersøge, om to grupper a f en befolkning (fx mænd og
kvinder) er ens. Kapitel 15 fokuserer på det tilfælde, hvor vi har kvan­
titative data, og viser, hvordan man kan teste, om to middelværdier er
forskellige, når man korrigerer for den usikkerhed, som er foranlediget
af stikprøven. I kapitel 16 præsenterer vi tilsvarende test for kvalitative
data.
Endelig introducerer vi regressionsanalyse i kapitel 17 og 18. Re­
gressionsanalyse er en metode til at estimere konkrete sammenhænge
mellem stokastiske variabler. I den forbindelse skal vi også se, hvordan
man kan teste hypoteser om sådanne sammenhænge.
9
Stikprøvemetoder
Hovedformålet med en statistisk analyse er at opnå viden om en ukendt
fordeling. Det kunne fx være fordelingen a f et bestemt karakteristikum
i en virkelig population. Det er typisk for dyrt at opnå et fuldstændigt
kendskab til populationen. Derfor udtager man en stikprøve. I dette ka­
pitel diskuterer vi, hvordan man udtager en stikprøve fra en virkelig
population samt almindelige fejlkilder i forbindelse med udtagningen
a f en stikprøve.
En god kvalitet a f stikprøven er essentiel for den efterfølgende ana­
lyse. Hvis man ikke har en ordentlig stikprøve, havner man i en situ­
ation, som man på engelsk meget rammende kan beskrive som: „Gar­
bage in, garbage out“. Når vi i senere kapitler gennemgår forskellige
statistiske metoder, er det meget vigtigt at huske, at nok så avancerede
metoder kommer til kort, hvis de underliggende data ikke er ordentlige.
I praksis er dataindsamlingsprocessen, som nogle måske har en tendens
til at gå lidt let hen over for at komme til udledningen af selve resulta­
terne, a f vital betydning for, om man faktisk får brugbare resultater eller
bare „affald“ ud i den anden ende.
I kapitel 3 præsenterede vi begreberne „statistisk eksperiment“ og
„sandsynlighedsmodel“. En vigtig del a f begge begreber er udvælgel­
sen a f stikprøven. Indtil nu har vi ikke fokuseret på dette ud over at
konstatere, at der faktisk foregår en udvælgelse. Udvælgelsen medfører,
at man kan definere stokastiske variabler samt en fordeling af disse i
sandsynlighedsmodellen. I praksis er udvælgelsen af en stikprøve fra en
virkelig population kompliceret, og der er mange potentielle fejlkilder.
Det kan medføre stikprøver, som ikke er særligt informative eller deci­
deret misvisende for selve populationen. I dette kapitel vil vi derfor gå i
detaljer med udvælgelsen af en stikprøve og analysere diverse fejlkilder.
I afsnit 9.1 præsenterer vi de fire hovedpunkter i designet a f en stik­
prøveudvælgelse: Valg a f population og karakteristika, opstilling af
stikprøveenheder og stikprøveramme, udtræk fra stikprøveramme og
måling a f karakteristika. Disse gennemgås efterfølgende i afsnit 9.29.5. I afsnit 9.6 og 9.7 bliver vi en anelse mere tekniske og opstiller
en model for stikprøven. Denne model gør det muligt at definere en
repræsentativ stikprøve i afsnit 9.8 samt diskutere konsekvenser a f ik­
ke-repræsentative stikprøver i afsnit 9.9. Endelig diskuterer vi fejlkil­
der i forbindelse med stikprøveudvælgelsen og observationsfejl i afsnit
9 .10 og 9.11.
9.1
Design af stikprøveudvæigelse
I kapitel 3 definerede vi et statistisk eksperiment som udtagningen a f en
stikprøve fra en population. I dette kapitel fokuserer vi på, hvordan man
designer en stikprøveudtagning fra en virkelig population. De begreber,
vi definerer undervejs, er dog også anvendelige for superpopulationer.
Ved udelukkende at fokusere på virkelige populationer har elementerne
i populationen imidlertid en fysisk fortolkning, og tilsvarende har de
tilhørende karakteristika.
De fire hovedpunkter, som man skal overveje grundigt i designet af
en stikprøveudvælgelse, er følgende:
1. Valg af population og karakteristika
2. Opstilling a f stikprøveenheder og stikprøveramme
3. Udtræk fra stikprøveramme
4. Måling af karakteristika
Valget a f population og elementernes karakteristika udspringer a f selve
undersøgelsens formål. Det er imidlertid ikke altid så enkelt, som man
skulle tro, at afgøre, hvad der er formålet med en undersøgelse. Det er
derfor vigtigt at afdække og præcisere dette. Her skal man ikke være
blind for, at der kan være mange aktører med modsatrettede interesser
involveret i en undersøgelse. Disse aktører vil typisk gerne øve indfly­
delse på undersøgelsens design, fordi dette har stor betydning for de
resultater, man finder. Vi ser på dette i afsnit 9.2.
Hvor valg a f population og karakteristika er baseret på undersøgel­
sens formål, er opstilling a f stikprøveenheder og stikprøveramme af
mere teknisk karakter. Stikprøveenheden er den mængde a f elementer
fra populationen, som man undersøger ad gangen. Fx kan man lade et
ægtepar være stikprøveenheden, selvom man i virkeligheden er interes­
seret i hver a f de to personer. Stikprøverammen er en opskrivning a f alle
de mulige stikprøveenheder samt en beskrivelse af, hvordan man kan
komme til at undersøge hver enkelt a f dem. Beskrivelsen kan fx være
en postadresse på hver a f stikprøveenhederne. Vi ser på stikprøveenhe­
der og -rammer i afsnit 9.3.
Udtrækket fra stikprøverammen giver os vores stikprøve. Den væ­
sentligste forskel mellem metoder til udtræk fra en stikprøveramme er,
hvorvidt de er beskrevet a f en kendt sandsynlighedsfordeling eller ej.
En metode til udtrækning er fx, at alle stikprøveenheder har samme
sandsynlighed for udvælgelse. Vi ser på denne del i afsnit 9.4.
Når man har udvalgt en stikprøveenhed, skal man undersøge ele­
menterne i stikprøveenheden for de karakteristika, man vil måle. For
stikprøver bestående af personer bruger man ofte spørgsmål til perso­
nerne for at bestemme værdierne a f forskellige karakteristika. Vi ser
nærmere på dette i afsnit 9.5.
Det næste eksempel illustrerer de forskellige elementer i designet af
en stikprøveudvælgelse.
Eksempel 9.1: Holdninger til EU
Vi betragter en undersøgelse a f danske vælgeres holdning til EU-med­
lemskab. Formålet er derfor at udspørge danskere over 18 år (populatio­
nen) om deres holdning til EU (det relevante karakteristikum). Man kan
udpege populationselementerne ud fra deres hovedbopæl (stikprøveen­
heden). En komplet samling a f adresser på bopæle (stikprøverammen)
kan bruges til at kontakte alle personerne på en bestemt bopæl. Man
kan udvælge stikprøveenheder ved at nummerere bopælene i stikprø­
verammen med fortløbende tal og lade en computer udtrække tilfældigt
blandt disse tal (udtrækket fra stikprøverammen). Endelig kan man lade
en interviewer besøge bopælen og spørge om personernes holdninger til
EU (målingen a f karakteristika).
■
Selvom ovenstående eksempel og gennemgangen ovenfor antyder, at
man skal gøre tingene i den nævnte rækkefølge, vil man i praksis sprin­
ge frem og tilbage mellem punkterne. Ofte afprøver man designet ved
at lave en såkaldt p ilotundersøgelse, som er en lille udgave a f den en­
delige stikprøveundersøgelse, med det formål at få noget erfaring med
designet. I de følgende afsnit går vi i detaljer med de enkelte punkter i
designet a f en stikprøveudvælgelse.
9.2
Valg af population og karakteristika
Det første hovedpunkt i designet a f en stikprøveudvælgelse er valget af
population og karakteristika. Populationen og karakteristikaene a f inte­
resse er ikke nødvendigvis lig med den population og de karakteristika,
man undersøger. Specifikationen a f populationen og karakteristikaene
a f interesse er et resultat a f undersøgelsens formål. Det kan fx være, at
man vil undersøge, hvordan et giftstof påvirker en persons helbred. A f
etiske årsager vil man dog ikke give personen en stor dosis a f giftstoffet
for at se effekten på hans eller hendes helbred. I stedet kan man under­
søge giftstoffets effekt på kunstige celler i et laboratorium. Dermed er
den population, der undersøges, lig med samlingen a f kunstige celler,
og det relevante karakteristikum er de kunstige cellers evne til at dele
sig. Håbet er, at denne population kan bruges som substitut for popula­
tionen af interesse, som er hele befolkningen.
Man kalder populationen af interesse for målpopulationen. Mål­
populationen er ikke nødvendigvis den population, som indgår i det
statistiske eksperiment, hvis man fx som ovenfor af praktiske årsager
er nødt til at undersøge en anden population. Vi bibeholder begrebet
population som betegnelse for den samling a f elementer, hvorfra stik­
prøven udtages. Når vi blot skriver „population“, refererer vi altså til
den population, som indgår i det statistiske eksperiment.
Én årsag til, at populationen i et statistisk eksperiment nogle gange
er forskellig fra målpopulationen, kan som nævnt ovenfor være, at det
er praktisk umuligt at udtage en stikprøve fra målpopulationen. I dette
tilfælde er der intet overlap. mellem populationen, hvorfra stikprøven
udtages, og målpopulationen. En anden årsag kan være, at det nogle
gange er relativt omkostningstungt at udtage en stikprøve fra hele mål­
populationen. Det kan således være billigere at lave en undersøgelse
inden for et begrænset område, fx i Viborg, og så overføre resultaterne
herfra til hele landet. I dette tilfælde er populationen, hvorfra stikprøven
udtages, en delmængde a f målpopulationen.
Når målpopulationen er forskellig fra populationen, som undersø­
ges, rejser det spørgsmålet om, hvor godt elementernes karakteristika i
målpopulationen er beskrevet a f den population, man undersøger. Det­
te spørgsmål kan statistisk teori ikke besvare. Den statistiske teori er
iscenesat omkring et statistisk eksperiment og en sandsynlighedsmodel.
Det er derfor op til undersøgeren selv at argumentere for (ved hjælp
af sin viden om problemstillingen), at man kan overføre de fundne re­
sultater til målpopulationen. Hvis man fx vil overføre resultater fra en
stikprøveundersøgelse foretaget i Viborg, må man retfærdiggøre, at den
kan generaliseres til hele landet, hvis dette er målpopulationen.
Specifikationen a f elementernes karakteristika kan være besværlig.
Hvis man fx vil undersøge kvaliteten a f forskellige gymnasier ved at
måle elevernes karakterer til studentereksamen i skriftlige fag, vil det
være nyttigt også at kende elevernes forudgående evner, således at man
ikke fejlagtigt kommer til at konkludere, at et gymnasium er bedre end
et andet, hvis det i virkeligheden blot er elevernes forudgående evner,
som forårsager forskellen. Men evner er ikke en veldefineret, endsige
målbar, størrelse. Nogle gange bruger man værdier fra en IQ-test, som
helst skal være foretaget, inden eleverne starter i gymnasiet.
Problemet er således, at det kan være svært at definere de relevante
karakteristika. Dette problem kan statistisk teori heller ikke hjælpe os
med at løse. Det er undersøgeren, som ud fra sin viden om problem­
stillingen må retfærdiggøre sine valg a f karakteristika, der skal måles.
Eksempel 9.2: Ungdomskriminalitet
Et ministerium ønsker at få ungdomskriminaliteten belyst og ansætter
et konsulentfirma til at foretage denne undersøgelse. Det rejser en ræk­
ke spørgsmål: Hvem er de unge? Hvilken type kriminalitet taler vi om?
Skal undersøgelsen baseres på de dømte, på den anmeldte kriminalitet
eller den udførte kriminalitet? Konsulentfirmaet vælger at lade målpo­
pulationen være de unge mellem 15 og 18 år. Populationen, hvorfra
stikprøven udtages, sættes til de unge mellem 15 og 18 år, som er blevet
anklaget for kriminalitet, og det relevante populationskarakteristikum
er omfanget a f berigelseskriminalitet. Diskuter disse valg.
■
9.3
Opstilling af stikprøveenheder og stikprøveramme
Man kalder de enheder, som skal udvælges, for stikprøveenheder. En
stikprøveenhed kan bestå a f mere end et element. Ofte er det billigere
at udtage mange elementer samlet, fx en hel skoleklasse, frem for at
udvælge elementerne hver for sig. Samlingen a f alle stikprøveenheder
kalder man for stikprøverammen.
For at stikprøverammen kan bruges i praksis, skal den indeholde
oplysninger om, hvordan man kan komme i kontakt med stikprøveen­
hederne. Man laver typisk en liste, hvor fx virksomhedernes cvr-numre
og adresser er skrevet op. Listen er altså drejebogen for, hvordan man
fysisk får kontakt med stikprøveenhederne og ultimativt elementerne i
populationen.
En stikprøveramme kan være mere eller mindre præcis med hensyn
til, hvordan man får fat i et element. Hvis man fx laver en stikprøve­
udvælgelse ved at interviewe mennesker, som befinder sig et bestemt
sted på et bestemt tidspunkt, fx i en lufthavn en torsdag eftermiddag,
så er stikprøverammen præcis med hensyn til stikprøveenhederne (her:
personer), men ikke med hensyn til, hvordan man får kontakt med dem
alle. Det er dem, der tilfældigvis er i lufthavnen den pågældende tors­
dag, som kan blive udtrukket til stikprøven.
Oplysningen om, hvordan man får fat i et element, er ofte et karak­
teristikum ved elementet. Et cpr-nummer eller en adresse er fx karak­
teristika ved en person. Vi kalder et sådant karakteristikum for et ud­
vælgelseskarakteristikum. Det kan også være hensigtsmæssigt at tænke
på andre og mindre præcise oplysninger som udvælgelseskarakteristika
ved elementerne. Fx kan man se det „at være til stede i en lufthavn en
given torsdag eftermiddag“ som et udvælgelseskarakteristikum ved en
person.
Opstillingen af en præcis stikprøveramme er blandt andet vigtig, for­
di man typisk ikke selv udfører hele undersøgelsen. For efterfølgende at
kunne vurdere kvaliteten a f undersøgelsen skal man have en præcis idé
om, hvordan undersøgelsen er foretaget. Dette afhænger igen af, hvor­
dan undersøgernes opgaver er præciseret. En del a f denne præcisering
findes i stikprøverammen.
9.4
Udtræk fra stikprøveramme
Metoden til udtrækning a f stikprøveenheder fra stikprøverammen har
stor indflydelse på kvaliteten og muligheden for at vurdere kvaliteten af
stikprøveudvælgelsen. I de to næste underafsnit opdeler vi metoderne i
statistisk udtagning og ikke-statistisk udtagning.
9.4.1
Statistisk udtagning
En væsentlig statistisk overvejelse i designet a f stikprøveudvælgelsen
er udtagningen a f stikprøveenheder fra stikprøverammen. Statistisk ud­
tagning betyder, at sandsynligheden for udvælgelse a f en bestemt stik­
prøveenhed er kendt. Fx kan alle stikprøveenheder have samme sand­
synlighed for udtagning. Vi behandler tre typer a f statistisk udtagning
i denne bog: Simpel tilfældig udvælgelse, stratificeret udvælgelse og
klyngeudvælgelse. I de efterfølgende kapitler behandler vi disse tre ud­
tagningsmetoder indgående. Specielt fokuserer vi på simpel tilfældig
udvælgelse, fordi den gør beregningerne relativt simple, og fordi den
også indgår i mere komplicerede udvælgelsesmetoder.
Fordelen ved en statistisk udtagning er, at den giver mulighed for
at kvantificere kvaliteten a f undersøgelsen. Hvis sandsynligheden for
udvælgelse a f en stikprøveenhed derimod ikke er kendt, er det svært at
vurdere kvaliteten a f undersøgelsen. Den anden fordel ved statistisk ud-
tagning er, at man nemmere kan få en stikprøve, som giver et retvisende
billede af populationen.
9.4.2
Ikke-statistisk udtagning
Ikke-statistisk udtagning betyder, at man ikke kender sandsynligheden
for udvælgelsen a f en stikprøveenhed. Det gør det reelt set umuligt at
vurdere kvaliteten a f en undersøgelse. Ikke-statistisk udtagning er dog
meget brugt i praksis, fordi den er relativt billig at udføre. Der er også
tilfælde, hvor det er svært at udføre en statistik udtagning. En del a f de
fejlkilder, som vi behandler senere i dette kapitel, skyldes, at man be­
handler en stikprøve som et resultat af en statistisk udtagning, selvom
den (delvist) er et resultat af en ikke-statistisk udtagning. Vi omtaler i
det følgende fire eksempler på ikke-statistisk udtagning: Tilgængelig
udtagning, bevidst udtagning, kvotaudtagning og „snowballing“.
Tilgængelig udtagning forekommer, når undersøgeren lader be­
kvemmelighed afgøre udtagningen a f stikprøveenheder. Fx kan man
foretage interviews blandt personer, som er på indkøb i et indkøbscen­
ter. Fordelen ved denne metode er, at den er billig, fordi man ikke be­
høver at finde frem til bestemte personer. Det er også metodens største
ulempe, fordi man ikke kender sandsynligheden for, at en bestemt per­
son indgår i stikprøven. Hovedproblemet er, at sandsynligheden for det,
man undersøger, kan være afhængig a f sandsynligheden for udtagning
til stikprøven. Hvis man fx interviewer personer om deres holdning til
indkøb i store indkøbscentre ved at interviewe personer, som netop er på
indkøb i store indkøbscentre, så er der en stor sandsynlighed for, at disse
personers holdninger til spørgsmålet er mere positive end hos befolk­
ningen som helhed. Dermed giver stikprøven ikke et retvisende billede
af populationen. Vi går mere i detaljer med dette problem i afsnit 9.10.
Bevidst udtagning forekommer, når undersøgeren udpeger, hvem
der skal undersøges, uden brug a f sandsynligheder. Man anvender nog­
le gange denne metode, når man ønsker at udspørge personer, som man
antager, har en specielt stor viden om undersøgelsens emne. Derved kan
man interviewe færre personer og gøre undersøgelsen billigere. Hoved­
problemet med bevidst udtagning er, at de udtagne personer ofte ikke
giver et retvisende billede a f hele populationen.
Kvotaudtagning foregår ved, at man på forhånd beslutter, at der skal
forekomme en bestemt kvote, eller andel, af personer i stikprøven med
bestemte karakteristika, som ikke er undersøgelsens direkte fokus. Disse
karakteristika kalder man også baggrundskarakteristika. I en undersøgel­
se af unges internetforbrug kan man fx ønske, at halvdelen af de udtagne
personer skal være fra provinsen, mens den anden halvdel skal være fra
København. Det gode ved kvotaudtagning er, at personer med forskel­
lige baggrundskarakteristika er repræsenteret i stikprøven. Problemerne
kan opstå, hvis disse baggrundskarakteristika har indflydelse på det ka­
rakteristikum, man undersøger. Dermed løber man også her en risiko for,
at stikprøven ikke giver et retvisende billede af populationen. Hvis man
imidlertid kender fordelingen af det anvendte baggrundskarakteristikum
(her: bopæl i København eller provins), kan man faktisk bruge denne in­
formation til at forbedre kvaliteten a f undersøgelsen, fordi man efterføl­
gende kan korrigere stikprøvens resultater. Ideen med stratifikation, som
vi gennemgår i kapitel 11, er netop, at kendskab til fordelingen af et bag­
grundskarakteristikum kan bruges til at forbedre stikprøveudvælgelsen.
„Snowballing“ foregår ved, at man lader et udvalgt element udpege
den næste stikprøveenhed, som skal undersøges. Metoden kan bruges i
tilfælde, hvor man har svært ved at finde personer med bestemte karak­
teristika. Hvis man fx vil undersøge ludomani blandt pokerspillere, kan
man lade en undersøgt pokerspiller udpege det næste element i stikprø­
ven, fordi de typisk kender hinanden i „branchen“.
9.5
Måling af karakteristika
Når man har fået fat på et element, skal man måle dets karakteristika.
Alt efter problemstillingen er der forskellige metoder til at måle karak­
teristika. Vi diskuterer i det følgende målemetoder baseret på observa­
tion og selvrapportering.
Måling ved observation foregår ved, at undersøgeren aflæser de re­
levante karakteristika. Det kan fx ske i et antropologisk studium eller i
en fysisk undersøgelse.
Når man observerer en persons adfærd, er det vigtigt ikke at påvirke
adfærden. En skoleklasse opfører sig måske bedre (eller værre), hvis
der sidder en undersøger bagerst i klasselokalet. Når målingen foregår
med måleinstrumenter, er der selvfølgelig også en risiko for, at målein­
strumenterne ikke måler særlig præcist eller ligefrem helt forkert.
Når man laver en fysisk undersøgelse a f et elements karakteristi­
ka, kan det nogle gange medføre ødelæggelse a f elementet. Hvis man
således undersøger, om en nytårsraket virker ved at affyre den, er den
efterfølgende sværere at sælge.
Ved selvrapportering er det elementet selv, som måler karakteristi­
kaene. Med selvrapportering er det vigtigt at undersøge, om elementet
er i stand til og ønsker at afgive en korrekt måling. En fordel ved selv­
rapportering er, at man også kan undersøge karakteristika, som ikke er
til stede på undersøgelsestidspunktet. Ud over at undersøge, hvor meget
en person har forbrugt a f et produkt, kan man fx også spørge om, hvor
meget personen vil forbruge a f produktet i fremtiden. Den første måling
afslører, hvad man har gjort, og kaldes afsløret præference. Den anden
måling afslører, hvad man vil gøre, og den kaldes form odet præference.
En meget brugt metode ved selvrapportering er besvarelse a f spørgs­
mål, enten mundtligt eller skriftligt. Man skal her overveje, hvordan
man vil præsentere spørgsmålene til en person. Fx kan man stille spørgs­
målene ved personligt interview. Man kan også sende et spørgeskema
med posten, ringe, sende en e-mail, lave et internetbaseret spørgeskema
eller bede personen føre en dagbog. De forskellige metoder har fordele
og ulemper, som påvirker sandsynligheden for at få svar og sandsynlig­
heden for at få korrekte svar, men også prisen på undersøgelsen.
Selve spørgsmålsformuleringen har også stor betydning for sand­
synligheden for, at en person svarer, og at svaret er korrekt. Blandt an­
det skal man overveje, om spørgsmålene er forståelige, værdiladede,
nemme at besvare, følsomme, om de afslører uvidenhed eller er vildle­
dende. Derudover kan rækkefølgen af spørgsmålene, svarmuligheder­
ne samt antallet a f spørgsmål være vigtige for at få præcise målinger.
Endelig er det ofte en god idé at formulere nogle åbne spørgsmål, hvor
personen har mulighed for at afgive et mere uddybende svar. Dette kan
især være tilfældet i en pilotundersøgelse.
For at man kan fæste lid til svarene på spørgsmålene, skal det helst
forholde sig således, at hvis man gentager stikprøveudvælgelsen og må­
lingen, vil man få lignende svar. Dette kaldes reliabilitet. Sagt med andre
ord skal andre kunne gentage eksperimentet og finde frem til nogenlun­
de samme resultat. Man skal også sikre sig, at det, man ønsker at måle,
rent faktisk også er det, man måler. Dette kaldes validitet.
Vi ser nærmere på konsekvenserne a f målefejl i afsnit 9.11.
9.6
Stokastisk stikprøve
Når en stikprøve er udtaget statistisk, kan vi modellere usikkerheden i
forbindelse med stikprøven ved at lade den repræsentere a f stokastiske
variabler. Medmindre andet er nævnt, vil vi fremover antage, at stikprø­
ver er foretaget med statistisk udtagning. I dette afsnit vil vi derfor for­
malisere repræsentationen af en stokastisk stikprøve og dens fordeling.
Den statistiske repræsentation af en stikprøve foregår med stokasti­
ske variabler. Værdien af det undersøgte karakteristikum for element i
kan vi skrive som en stokastisk variabel med fodtegn i, fx X . En stik­
prøve bestående af n elementer kan man således repræsentere med n
stokastiske variabler, X1,...,Xn.
En stikprøve med n elementer repræsenteres a f n stokastiske
variabler, X 1,...,X n. Den skrives: (X1, ...,X n).
Før udtagningen er foretaget, ved vi ikke, hvilke værdier stikprøven
vil antage. Men når stikprøven er udtaget, har man n konkrete værdier.
Dette kalder man for den realiserede stikprøve:
En realiseret stikprøve med n elementer er n værdier, x1,..., x n,
af de stokastiske variabler, X 1,..., X n. Den skrives (X 1,..., X n) =
(x1,.. . , x n) eller blot (x1,. . . , x n).
Hver stokastisk variabel, X i, har en fordeling givet ved f Xi (xi). Stikprø­
ven har også samlet set en fordeling, som er den simultane fordeling
a f X 1,...,Xn. Hvis fx stikprøvestørrelsen n er lig med 2, så har X 1 for­
delingen f 1x (x 1), X 2 har fordelingen f X2 (x2), og stikprøven (X 1,X 2) har
fordelingen f (x 1,x 2).
Stikprøvefordelingen er den simultane fordeling a f de n sto­
kastiske variabler, (X1,..., X n), givet ved f (x 1,..., x n), som er en
sandsynlighedsfunktion, hvis de stokastiske variabler er diskre­
te, og en tæthedsfunktion, hvis (mindst én af) de stokastiske va­
riabler er kontinuerte.
Eksempel 9.3: En Bernoullipopulation – del 1
Betragt en population, hvor alle elementerne har et karakteristi­
kum, som enten har værdien 0 eller værdien 1. Det kunne være
en kodning for at ville stemme nej (=0) eller ja (= 1) ved en fol­
keafstemning om en ny grundlov. Lad andelen a f l ’ere i po­
pulationen være p. Antag, at man udtager n = 2 elementer uaf­
hængigt a f hinanden, dvs. med tilbagelægning. Det medfører, at
Χ 1~ Ber(p ) og X 2 ~ Ber(p ) og dermed at:
Dette er de marginale fordelinger for de to stokastiske variabler, X 1 og
X 2 Stikprøvens samlede fordeling kan man da finde fra de to marginale
fordelinger, fordi det er antaget, a t X 1 og X 2 er uafhængige:
Det første lighedstegn følger af antagelsen om uafhængighed. Sand­
synligheden for, at det første udtrukne element svarer nej, og det andet
udtrukne element svarer ja, er fx lig med (1 – p ) · p, fordi dette er sand­
synligheden for den realiserede stikprøve (x1,x 2) = (0, 1).
■
9.7
En model for stikprøven
I praksis udtager man en stikprøve fra en virkelig population på basis
a f et andet karakteristikum ved hvert element end det, man egentlig er
interesseret i. Vi betegner dette karakteristikum med z og refererer til
det som et udvælgelseskarakteristikum. Et udvælgelseskarakteristikum
kan fx være et cpr-nummer og er specificeret i stikprøverammen. I dette
afsnit opstiller vi en model for sammenhængen mellem udvælgelses­
mekanismen, fordelingen a f det valgte udvælgelseskarakteristikum i
stikprøven samt fordelingen af det karakteristikum, vi er interesserede
i at undersøge. Denne model kan efterfølgende bruges til at definere en
repræsentativ stikprøve samt illustrere konsekvenserne a f forskellige
fejlkilder i stikprøveudvælgelsen.
Lad Z i være en stokastisk variabel, der angiver værdien a f det an­
vendte udvælgelseskarakteristikum for det i’te element i stikprøven. Da
udtrykker f zi (z ) udvælgelsesmekanismen. Hvis fx udvælgelsesmeka­
nismen udvælger en person på baggrund af cpr-nummeret, og alle num­
re har lige stor chance for udvælgelse, så er fzi (z ) = 1/N , hvor N er an­
tallet a f personer i populationen, og z er et cpr-nummer i populationen.
Hvis man i stedet kun udvælger kvinder til stikprøven, så er f zi (z ) = 0
for alle ulige cpr-numre, og f zi (z) = 1/N kvinde for alle lige cpr-numre i
populationen, hvor Nkvinde er antallet a f kvinder i populationen.
Forskellige elementer i populationen kan godt have samme værdi af
et udvælgelseskarakteristikum. Dette afgøres af, hvor præcist stikprø­
verammen er specificeret. Senere i kapitlet viser vi, hvilke problemer
dette medfører. Det er derfor vigtigt at vide, om et element har en unik
værdi af et udvælgelseskarakteristikum. Hvis det er tilfældet, siger vi,
at elementet er identificeret:
Et element i en virkelig population er identificeret, hvis ingen
andre elementer i populationen har den samme værdi af det an­
vendte udvælgelseskarakteristikum. Hvis dette ikke er tilfældet,
siges elementet at være ikke-identificeret.
Alle elementer er identificerede, hvis man bruger personers cpr-num­
re som udvælgelseskarakteristikum, idet alle personer har forskellige
cpr-numre. Det er derimod ikke tilfældet, hvis man bruger telefonnum­
re, fordi forskellige personer kan have samme telefonnummer, og fordi
nogle personer slet ikke har en telefon.
Sammenhængen mellem det anvendte udvælgelseskarakteristikum
og det karakteristikum, vi er interesserede i, kan udtrykkes ved den be­
tingede fordeling, f Xi│Zi (x│z). Den betingede fordeling giver sandsynlig­
heden for at udtrække en bestemt værdi, x, a f vores karakteristikum af
interesse, givet en bestemt værdi, z, a f vores udvælgelseskarakteristi­
kum.
Hvis et element i en virkelig population er identificeret med vær­
dien z# a f udvælgelseskarakteristikummet, så er fXi│Zi (x #│z #) = 1, hvor
x # er elementets værdi a f karakteristikummet a f interesse. Hvis ele­
mentet er ikke-identificeret, så er fXi│Zi (x#│z#) ≤ 1, hvor lighedstegnet
kun gælder, hvis alle elementer med værdien z# a f det anvendte udvæl­
gelseskarakteristikum har samme værdi a f det karakteristikum, vi er
interesserede i.
Vi kan nu udtrykke fordelingen for det i‘te element i stikprøven,
f Xi(x ), som en funktion a f fXi│Zi (x#│z#) og f Zi(z ). Som i kapitel 4 kan
vi finde en marginal sandsynlighed ved at summere over de simultane
sandsynligheder:
Fra definitionen a f en betinget sandsynlighed kan vi endvidere udtrykke
den simultane sandsynlighed som:
fXi,Zi(x,z) = fXi│Zi (x│z) · fZi ( z )
Ved indsættelse af denne formel i den første formel fås et udtryk for
fordelingen af det f te element i stikprøven, som afhænger af udvælgel­
sesmekanismen, f Zi (z ), og den betingede fordeling a f X. givet værdien
af det anvendte udvælgelseskarakteristikum:
Det næste eksempel illustrerer denne sammenhæng.
Eksempel 9.4: Udtrækning fra en lille population
Betragt en udtrækning (med tilbagelægning) fra en population med blot
fire elementer, hvor hvert element er identificeret med værdierne 1, 2,
3 og 4 a f et udvælgelseskarakteristikum, z. Disse værdier er angivet for
de fire elementer i tabel 9.1 sammen med værdierne af det karakteristi­
kum, x, vi er interesserede i.
Tabel 9.1:
Udvælgelseskarakteristikum, z
Karakteristikum af interesse, x
1
5
kum og karak­
2
7
teristikum af
3
7
interesse
4
8
Udvælgelses­
karakteristi­
Da alle elementer er identificeret via det anvendte udvælgelseskarakte­
ristikum, så er fx f x i│
Zi (7|2) = 1, da kun ét element har værdien z = 2,
og for dette element er x = 7. Bemærk, at elementet med z = 3 også har
x = 7, men dette er uden betydning, når man betinger på z = 2.
Antag, at udvælgelsesmekanismen tildeler alle fire elementer sam­
me chance for udvælgelse. Så er:
hvor fx den anden sandsynlighed kan udregnes ved hjælp a f formlen
ovenfor på følgende vis:
En anden udvælgelsesmekanisme kan give en anden fordeling a f X i.
Antag fx, at elementet med z = 1 ingen chance har for udvælgelse, mens
de øvrige elementer alle har samme chance (= 1/3) for udvælgelse. Så
får man:
■
9.8
Repræsentativ stikprøve
Målet med en stikprøve er (som regel) at få et retvisende billede a f po­
pulationen uden at behøve at undersøge hele populationen. I dette afsnit
præciserer vi, hvad vi forstår ved et retvisende billede.
I en virkelig population fortæller andelsfunktionen os, hvordan et
karakteristikum, x , optræder blandt elementerne. Dermed skal et retvi­
sende billede a f en virkelig population afspejle andelsfunktionen. Som
vi diskuterede i kapitel 4, kan vi lade andelsfunktionen repræsentere a f
en stokastisk variabel, X, med fordelingen f X(x). Tilsvarende kan vi
lade andelsfunktionen for vores udvælgelseskarakteristikum repræsen­
tere a f en stokastisk variabel, Z, med fordelingen f z (Z).
Vi vil nu definere, hvad vi forstår ved en repræsentativ stikprøve:12
Vi siger, at stikprøven er repræsentativ for X, hvis fordelingsfunktio­
nen, f Xi(x ), for hvert element i stikprøven er den samme som forde­
lingsfunktionen, f X(x), for X :
En stikprøve er repræsentativ for X, hvis f Xi (x) = f X (x ) for
i = l,...,n, hvor f X(x ) er lig med andelsfunktionen, hvis stikprø­
ven udtrækkes fra en virkelig population. H v i s X
if(x ) ≠ f X (x ) for
mindst ét i, er stikprøven ikke-repræsentativ.
I tilfældet med udtrækning fra en superpopulation kan vi fortolke f X (x )
som repræsenterende den eksisterende (eller faktiske) udvælgelsesme­
kanisme, som vi ønsker at lære noget om.
12 Bemærk, at der ikke er konsensus i litteraturen om en præcis definition a f en repræsentativ stikprøve,
og ofte bruges begrebet uden en konkret definition. Ovenstående definition er derfor vores forsøg på at
konkretisere betydningen af begrebet.
Eksempel 9.5: En Bernoullipopulation – del 2
Stikprøven fra en Bernoullipopulation foretaget med uafhængige ud­
træk er repræsentativ. Det ses, eftersom andelen a f 1’ere i populationen
er p, og andelen a f 0’ere er ( 1 – p ), hvilket svarer til sandsynlighederne
i både f Xi (x1) og f X2(x2).
■
Vi kan få et nærmere indblik i, hvornår stikprøven er repræsentativ, ved
at betragte modellen for stikprøveudtagning fra afsnit 9.7:
Stikprøven er automatisk repræsentativ, dvs. f Xi (x ) = f x (x ) , hvis:
(i)
(ii)
f zi (z ) er lig med f z (z) for alle værdier a f z , dvs. udvælgelsessand­
synlighederne for de forskellige værdier a f det anvendte udvæl­
gelseskarakteristikum er lig med disse værdiers andele i popula­
tionen; og
f X i|Zi (x |z ) er lig med f X│Z(x │z ) for alle værdier a f z og x , dvs. for
en given værdi af det anvendte udvælgelseskarakteristikum er
sandsynligheden for at udtrække en given værdi a f X i lig med
denne værdis andel blandt de elementer i populationen, som har
den givne værdi af det anvendte udvælgelseskarakteristikum.
I det følgende vil vi fokusere på, hvordan udvælgelsesmekanismen,
f Zi (z), kan forårsage ikke-repræsentative stikprøver. Vi antager derfor i
resten a f kapitlet, at punkt (ii) ovenfor er opfyldt. Dermed er fordelin­
gen a f X i givet ved:
Eksempel 9.6: Indkøbsture – del 1
Betragt en population med to karakteristika: x , som er det ugentlige
antal indkøbsture, og z, som er lig med 1, hvis man er på indkøb om
lørdagen, og ellers lig med 0. Antag, at følgende 10 elementer, (x , z ),
indgår i populationen: (8, 1), (3, 1), (4, 0), (8, 1), (4, 1), (5, 0), (8, 0),
(3,1), (8, 1), (5 ,0 ).
Populationsandelene er repræsenteret ved de simultane og margi­
nale sandsynligheder for de tilsvarende stokastisk variabler, X og Z, i
tabel 9.2:
Tabel 9.2:
fX(x)
Z = 0
Z = 1
X = 3
0,0
0,2
0,2
sandsynlig­
X=4
0,1
0,1
0,2
heder
X=5
0,2
0,0
0,2
X =8
0,1
0,3
0,4
0,4
0,6
1,0
Simultane
og marginale
Z
f (z)
I tabel 9.3 finder vi tilsvarende de betingede sandsynligheder for X
givet Z :
Tabel 9.3:
Betingede
X
fX│Z(x│0)
fX│Z(x│1)
3
0,00
0,33
4
0,25
0,17
5
0,50
0,00
8
0,25
0,50
1,00
1,00
sandsynlighe­
der for X
Antag nu, at man udtrækker element i til stikprøven via en udvælgelses­
mekanisme repræsenteret ved følgende sandsynlighedsfordeling for Z i:
Dvs. at der er 90 % sandsynlighed for, at den udtrukne person er en af
dem, der er på indkøb om lørdagen. Denne fordeling er forskellig fra
fordelingen a f vores udvælgelseskarakteristikum i populationen, som
fra tabel 9.2 er givet ved:
Udvælgelsesmekanismen giver altså en højere sandsynlighed for ud­
vælgelse a f personer, der er på indkøb om lørdagen (z = 1), end hvad
der svarer til deres andel i populationen. Konsekvensen a f dette for for­
delingen a f X i i stikprøven er:
Det ses, at f Xi (x ) ≠ f X(x). Fx er sandsynligheden for at få x = 8 højere i
denne ikke-repræsentative stikprøve end andelen a f personer med x = 8
i populationen.
■
Det er muligt at få en repræsentativ stikprøve, selvom udvælgelsesme­
kanismen er valgt anderledes end fordelingen a f vores udvælgelses­
karakteristikum i populationen. Det vigtigste tilfælde er den situation,
hvor X og Z er uafhængige. Det medfører, at f X│Z(x │
z ) = f X(x ) for alle
værdier a f z. Ved indsættelse i ovenstående formel fås:
Det ses, at f Xi (x ) = f X (x ), uanset hvilken fordeling for Z man anven­
der ved udtrækningen. Med andre ord: Når udvælgelseskriteriet er uaf­
hængigt a f det karakteristikum, man er interesseret i at undersøge, så
gør det ikke noget, at man anvender andre udvælgelsessandsynligheder
end dem, der svarer til populationsandelene.
Hvis fx indkøbsmønstret er det samme blandt jyder og sjællændere,
hvorved indkøbsmønstret er statistisk uafhængigt a f det at være jyde
eller sjællænder, kan man altså nøjes med at udtrække stikprøven blandt
den ene gruppe.
9.9
Konsekvenser af en ikke-repræsentativ stikprøve
Konsekvensen a f en ikke-repræsentativ stikprøve afhænger af, hvad
man undersøger. Generelt får man ved ikke-repræsentative stikprøver
misvisende resultater, fx i beregninger a f beskrivende mål.
Til at illustrere dette kan vi betragte middelværdien a f et karakteri­
stikum i en virkelig population. Denne populationsmiddelværdi er den
samme som middelværdien baseret på fordelingen a f den stokastiske
variabel, X, nemlig EX(Χ):
Middelværdien af det i’te udtrukne element til stikprøven er derimod
givet ved:
Hvorvidt EXi( X i) er forskellig fra ΕX(Χ), afhænger a f udvælgelsesme­
kanismen. Generelt vil de være forskellige, hvis stikprøven er ikke-re­
præsentativ. Det næste eksempel illustrerer dette.
Eksempel 9.7: Indkøbsture – del 2
I eksemplet med indkøbsture beregnede vi både f Xi(x) o g f X(x ) . Det
medfører følgende middelværdier:
EX ( X ) = 5,60
Ε Xi (Χ i) = 5,65
■
Hvis man kender fordelingen a f det anvendte udvælgelseskarakteristi­
kum i populationen, er det imidlertid muligt at korrigere en ikke-re­
præsentativ stikprøve, således at den kan bruges til at give retvisende
resultater. Når den mulighed er til stede, kan det faktisk være en fordel
at udtage en ikke-repræsentativ stikprøve. Et prominent eksempel på
dette er en stratificeret stikprøveudvælgelse, som vi kigger på i kapitel
11 . Men det kræver, at man præcist kan modellere, hvordan stikprøven
er ikke-repræsentativ.
9.10
Fejlkilder ved udvælgelsesmekanismen
I praksis får man en repræsentativ stikprøve, hvis man udtrækker ele­
menter i henhold til fordelingen a f det anvendte udvælgelseskarakteri-
stikum, z , i populationen. Det er imidlertid sjældent nemt at udtrække
ifølge denne fordeling.
Hvad værre er, tror man ofte fejlagtigt, at man udtrækker i henhold
til fordelingen a f z i populationen, selvom dette ikke er tilfældet. I det­
te afsnit ser vi på forskellige årsager til, at udvælgelsesmekanismen,
repræsenteret ved fordelingsfunktionen, f Zi (z ), er forskellig fra forde­
lingsfunktionen, f Z(z), og illustrerer betydningen af dette for stikprøvens
repræsentativitet ved hjælp a f modellen fra afsnit 9.7.
9.10.1
Fejl i stikprøveramme
Stikprøverammen specificerer de stikprøveenheder, som kan udtræk­
kes til stikprøven, og stikprøveenhederne kan som nævnt bestå af flere
elementer fra populationen. Stikprøverammen er i nogle tilfælde ikke
særlig præcis. En mulig fejl kan være, at dele a f populationen er ude­
ladt. Det næste eksempel viser, hvordan det kan medføre en ikke-repræ­
sentativ stikprøve.
Eksempel 9.8: Hybridbiler
En undersøgelse a f folks holdninger til hybridbiler foretages via mobil­
telefon. Lad z = 1 for en person, som har adgang til (og kan bruge) en
mobiltelefon, og lad z = 0 for en person, som ikke har adgang til (eller
ikke kan bruge) en mobiltelefon. Dermed kan udvælgelsesmekanismen
repræsenteres som:
Lad X være en binær stokastisk variabel, som er lig med 1, hvis den
udtrukne person er positiv over for hybridbiler, og lig med 0, hvis per­
sonen er neutral eller negativ. Antag, at populationen er således, at
f X│Z(1│1) = 0,6 og fX│Z(1│0)= 0,3. Fordelingen af X i ved en mobiltele­
fonbaseret udvælgelsesmekanisme følger da a f formlen fra afsnit 9.7:
Hvis 80 % a f befolkningen har mobiltelefon, fZ(1) = 0,8, så er forde­
lingen a f X (dvs. populationsandelene):
Stikprøven er derfor ikke-repræsentativ. Den vil have en tendens til at
overvurdere andelen i populationen, som er positivt stemt.
■
Generelt medfører fejl i stikprøverammen, at f zi (z) = 0 for elementer
i populationen med bestemte værdier, z , a f det anvendte udvælgelses­
karakteristikum. I ovenstående eksempel er stikprøven således kun re­
præsentativ, hvis f X(x) = f X│Z(x │1). Da Z er en binær variabel, er dette
også betingelsen for, at X og Z er statistisk uafhængige.
9.10.2
Ikke-respondenter
Det er ikke alle personer, som man kan træffe, eller som ønsker at del­
tage i en undersøgelse. Det kan også være, at en person ikke ønsker at
besvare visse spørgsmål. Disse personer kaldes ikke-respondenter. Hvis
der er en sammenhæng mellem svaret på et spørgsmål, som en person
skal besvare, og om hvorvidt personen er ikke-respondent, så vil det
generelt føre til en ikke-repræsentativ stikprøve.
Der er adskillige årsager til eksistensen a f ikke-respondenter. En
årsag kan være, at man stiller et følsomt spørgsmål. Hvis man fx vil
undersøge skattesnyd, kunne der være en sammenhæng mellem svar­
villigheden, og hvorvidt en person snyder i skat. En anden årsag kan
være, at en person ikke vil (eller kan) afse tid til at besvare spørgsmål.
Konsekvensen a f ikke-respondenter kan undersøges på samme
måde som fejl i stikprøverammen. Vi lader nu Z være en binær variabel,
som er lig 1, hvis man vil svare, og 0, hvis man er ikke-respondent.
Udvælgelsesmekanismen er da repræsenteret ved:
Dermed får vi som i eksempel 9.8 ovenfor, at:
f Xi(x ) = f X│Z(x │ 1)
Fordelingen a f X i er dermed lig med fordelingen a f X for de personer,
som vil svare. Fordelingsfunktionen, f Xi(x ), er derfor kun lig med for­
delingsfunktionen, f X(x), hvis der ikke er nogen sammenhæng mellem
X og svarvilligheden, Z .
Elementerne i modellen ovenfor er ikke-identificerede, da Z kun an­
tager to værdier. Vi valgte at bruge denne formulering, fordi den gør det
nemmere at se effekten af ikke-respondenter. Hvis elementerne er iden­
tificerede via fx deres cpr-nummer, når vi imidlertid til samme konklu­
sion ved at udpege de elementer, som er ikke-respondenter, og tilskrive
dem sandsynligheden 0 i udvælgelsesmekanismen.
Både i tilfældet med ikke-respondenter og i tilfældet med fejl i stik­
prøverammen medfører udvælgelsesmekanismen altså, at nogle ele­
menter har nul sandsynlighed for udvælgelse. Man kalder derfor også
fejl, som opstår i tilfælde a f elementer med nul udvælgelsessandsynlig­
hed, for ikke-observationsfej l.
9.10.3
Selvselektion i stikprøven
Selvselektion i stikprøven forekommer, hvis en persons adfærd påvirker
sandsynligheden for, at personen udtrækkes til stikprøven. Hvis man fx
undersøger personers holdning til økologi ved at interviewe kunder hos
økologiske grønthandlere, vil man højst sandsynligt få en stikprøve,
som viser en mere positiv holdning til økologi end hele populationens
holdning. Årsagen er, at der nok er en sammenhæng mellem, hvem der
er kunder hos de økologiske grønthandlere og disse kunders holdninger
til økologi.
Ikke-respondenter er et eksempel på ekstrem selvselektion i stikprø­
ven, hvor sandsynligheden for udvælgelse er nul for ikke-respondenter.
I mildere versioner manifesterer selvselektion i stikprøven sig ved, at
udvælgelsessandsynlighederne er anderledes end fordelingen af det an­
vendte udvælgelseskarakteristikum i populationen. Udvælgelsesmeka­
nismen bevirker med andre ord, at f Zi (z) > f Z (z) for de elementer, der
har en adfærd, som medfører, at de har en højere sandsynlighed for at
komme i stikprøven, end deres andel a f populationen retfærdiggør: De
„selvselekterer“ ind i stikprøven.
Eksempel 9.6 indeholdt et eksempel på selvselektion. Her følger et
andet:
Eksempel 9.9: Evaluering af lærere
Studerende i to forskellige fag skal evaluere to lærere, professor Hansen
og lektor Jensen. De kan give karaktererne god (=1), middel (=2) eller
dårlig (=3). Evalueringerne foretages i forbindelse med forelæsninger­
ne. Det er derfor kun de studerende, som kommer til forelæsningerne,
der deltager i evalueringerne. Lad X repræsentere en studerendes karak­
ter til professor Hansen og Y karakteren til lektor Jensen. En studeren-
des beslutning om at komme til en forelæsning er repræsenteret ved Z,
som er lig med 0 ved fravær og lig med 1 ved deltagelse. Fordelingen af
karakterer til professor Hansen i hele populationen a f studerende (både
de fremmødte og de ikke-fremmødte) er angivet i tabel 9.4, mens den
tilsvarende fordeling for lektor Jensen findes i tabel 9.5.
Tabel 9.4:
fX(x)
f (x .z )
Z= 0
Z= 1
X= 1
0,35
0,25
0,60
til professor
X=2
0,07
0,30
0,37
Hansen
X=3
0,03
0,00
0,03
0,45
0,55
f (y .z)
Z= 0
Z= 1
f Y(y )
Y= 1
0,01
0,08
0,09
Y =2
0,03
0,02
0,05
Y =3
0,86
0,00
0,86
m
0,90
0,10
Fordelingen
af karakterer
Z
f (z)
Tabel 9.5:
Fordelingen af
karakterer til
lektor Jensen
Evalueringsresultaterne for professor Hansen og lektor Jensen udtræk­
kes fra fordelingen a f fremmødte, dvs:
Lektor Jensen får altså en betydeligt bedre evaluering end professor
Hansen. 80 % a f de studerende giver lektoren karakteren god, hvorimod
dette tal ville falde til 9 %, hvis hele populationen evaluerede ham. Lek­
tor Jensen klarer sig altså bedre i evalueringerne end professor Hansen,
selvom Hansen ville ligge markant højere, hvis alle de studerende blev
tvunget til at deltage i evalueringen. De studerende, som synes, Jensen
er dårlig, har altså en tendens til at selektere sig selv ud a f stikprøven –
måske præcis fordi Jensens forelæsninger er de rene ørkenvandringer!
■
9.11
Observationsfejl
I dette afsnit betragter vi problemer med, at den observerede værdi a f et
karakteristikum ikke er den samme som den faktiske værdi. Det kan fx
være en vægt, som måler forkert. Vi opdeler sådanne observationsfejl i re­
sponsfejl og målefejl. Derefter viser vi, hvordan man kan opstille en mo­
del, som man kan bruge til at vurdere konsekvenserne af observationsfejl.
9.11.1
Typer af observationsfejl
Responsfejl opstår, hvis en respondent misforstår et spørgsmål eller
svaret rapporteres fejlagtigt i vores data. Det kunne være et spørgsmål,
som respondenten misforstår og dermed giver et forkert svar på i for­
hold til det, man gerne vil måle. Denne type responsfejl er kendt som
en spørgsmålsfej l. Intervieweren kan også påvirke respondenten til at
svare på en fejlagtig måde, hvilket kaldes en interviewerfejl. Endelig
kan et svar blive optaget eller kodet forkert. Disse fejl kaldes også op­
tage- og kodefejl.
Målefejl henføres som regel til fejl, som opstår, når det fysisk er
svært at opnå en præcis måling a f et karakteristikum. De fleste, om
ikke alle, måleinstrumenter er upræcise. På nogle måleinstrumenter er
måleusikkerheden endda angivet. Man kan også ved brug a f gentagne
målinger med forskellige måleinstrumenter selv finde ud af, hvor stor
måleusikkerheden er.
Overordnet modellerer vi konsekvenserne af observationsfejl ved at
antage, at den observerede værdi a f et karakteristikum er en funktion af
den korrekte værdi samt en observationsfejl. I denne sammenhæng kal­
der man den korrekte værdi for den latente værdi og betegner den med
toptegn *. Vi kan fx have udtrukket en person med et dagligt cigaretfor­
brug på 6 cigaretter (x * = 6), men ved en fejl skriver man på skemaet, at
cigaretforbruget er 16 (x = 16). I dette eksempel er der en observations­
fejl på 10 (= x – x *). Generelt er en observationsfejl, ε, givet ved:
observationsfejl = ε = X – X *
hvor X * er den latente variabel, o g X er den observerbare variabel. I det
følgende betragter vi konsekvenserne a f observationsfejl.
9 .11.2
Konsekvenser af observationsfejl
Antag, at man gerne vil måle den stokastiske variabel, X *, som er den
latente variabel. Uheldigvis forekommer der observationsfejl. Lad den
stokastiske variabel, ε, være observationsfejlen. Så kan den observerba­
re stokastiske variabel, X, skrives som
X = X*+ ε
Med andre ord vil vi gerne observere X *, men observerer i stedet X som
et resultat a f observationsfejlen.
Konsekvenserne a f målefejl afhænger af, hvad det er, man vil un­
dersøge, samt typen a f observationsfejl. Vi antager først, at observati­
onsfejlen har middelværdien nul, Ε (ε) = 0. Hvis vi er interesserede i
middelværdien af X * i populationen, ødelægger observationsfejlen altså
ikke muligheden for at udregne denne middelværdi. Årsagen er, at:
E ( X ) = E ( X *) + Ε(ε) = E ( X *)
Hvis observationsfejlen derimod systematisk trækker i en bestemt ret­
ning, som fx en forkert kalibreret vægt, således at Ε( ε ) = μ ε ≠ 0, så
er E ( X ) ≠ E ( X *)
Variansen a f den observerbare stokastiske variabel er påvirket an­
derledes af observationsfejlen. Hvis observationsfejlen er statistisk uaf­
hængig a f den størrelse, X *, som vi er interesserede i at måle, får man:
V ( X ) = V (X *) + V(ε )
Resultatet er, at man overvurderer variansen a f X *, når man bruger vari­
ansen af X, selv når observationsfejlen er uafhængig a f X *.
En vigtig populationsstørrelse til beskrivelse a f sammenhænge mel­
lem to stokastiske variabler er korrelationskoefficienten. Hvis vi skal
finde korrelationen mellem X *og en stokastisk variabel Y (uden obser­
vationsfejl), så er den:
Dette er korrelationen a f interesse. Den korrelation, man kan observere,
er i stedet givet ved:
Ovenfor fandt vi V( X) , når observationsfejlen var uafhængig a f X *.
Hvis vi endvidere antager, at observationsfejlen er uafhængig a f Y, så er
kovariansen mellem X og Y givet ved:
C o v ( X , Y ) = C o v(X * + ε , Υ ) = C o v ( X*,Y) + Cov(ε ,Y ) = C o v ( X*,Y)
Dermed er kovariansen upåvirket a f observationsfejlen i dette tilfælde.
Hvis vi indsætter i udtrykket for korrelationskoefficienten, fås:
Altså er korrelationen påvirket a f observationsfejlen. Den observerbare
korrelation, ρ (X, Y) , er kun lig med korrelationen a f interesse, ρ (X *, Y) ,
hvis der ikke forekommer observationsfejl, dvs. hvis V(ε ) = 0.
Lad os nu antage, at variansen af observationsfejlen udgør en andel,
s, a f variansen a f X *:
V(ε ) = s · V (X *)
Så gælder det, at:
Det ses, at den observerbare korrelation, ρ ( X, Y), er mindre end korre­
lationen a f interesse, ρ ( X *, Y ) . Observationsfej len virker med andre ord
som støj mellem X * og Y, og den får dermed sammenhængen mellem
dem til at virke mindre stærk. Hvis observationsfejlen fx udgør 20 % af
variationen i X *(hvilket ikke er en urealistisk observationsfejl i mange
sammenhænge), så er den målte korrelation godt 8 % lavere end korre­
lationen a f interesse.
Man kan opstille en række forskellige modeller for observationsfejl.
Ovenfor antog vi, at den forventede værdi a f observationsfejlen var nul,
og at den var uafhængig af den latente variabel. Man må ud fra den
praktiske situation bedømme, hvilke antagelser der bedst beskriver den
type målefejl, man mistænker er til stede. Vi kan fx ændre modellen
ovenfor ved at antage, at observationsfejlen er korreleret med den la­
tente variabel, således at en høj værdi a f den latente variabel også typisk
medfører en høj værdi a f målefejlen. Hvis vi bruger sådan en model, vil
kovariansen også være påvirket a f observationsfejlen.
Observerbare fraktiler kan også være påvirket a f observationsfejl.
Medianen er dog ikke påvirket, hvis vi antager, at medianen i fordelin­
gen a f observationsfejlen er nul.
Konsekvenserne af observationsfejl understreger, hvor vigtigt det er
at få præcise målinger. Det kan gøres ved påpasselighed og i forbin­
delse med udformningen a f spørgsmål. Fx er der typisk meget færre
observationsfejl, når man spørger til personers årsindkomst frem for
deres timeløn og antallet a f arbejdstimer.
9.12
Opgaver
1 . Repetitionsspørgsmål:
a) Gør kort rede for de fire hovedpunkter i en stikprøveundersøgelse.
b) Hvad er en pilotundersøgelse?
c) Forklar, hvad vi forstår ved målpopulationen, og hvorfor den kan
adskille sig fra den population, der undersøges.
d) Forklar, hvad en stikprøveenhed og en stikprøveramme er.
e) Forklar forskellen på statistisk og ikke-statistisk udtagning, og
hvad man forstår ved tilgængelig udtagning, bevidst udtagning,
kvotaudtagning og „snowballing“.
f) Forklar kort de forskellige typer a f målemetoder, herunder hvad
man forstår ved reliabilitet og validitet.
g) Forklar, hvornår en stikprøve er stokastisk, og hvad vi forstår ved
stikprøvefordelingen.
h) Forklar, hvad et udvælgelseskarakteristikum er, og hvornår et
element i en virkelig population er identificeret.
i) Hvad er en repræsentativ stikprøve?
j) Forklar, hvordan en ikke-repræsentativ stikprøve kan opstå som
følge af fejl i stikprøverammen, ikke-respondenter og selvselek­
tion.
k) Forklar kort de forskellige typer a f observationsfejl og hvilke
konsekvenser, de kan have.
2. Du skal til at lave en undersøgelse a f unge studerendes arbejdsvaner,
dvs. hvor mange timer om ugen de bruger på henholdsvis forelæs­
ninger og forberedelse.
a) Forklar, hvordan du vil vælge din population og de karakteristi­
ka, du vil fokusere på.
b) Forklar, hvordan du vil vælge dine stikprøveenheder, og skitsér,
hvordan en stikprøveramme kan opstilles.
c) Diskutér fordele og ulemper ved forskellige måder at udtrække
fra stikprøverammen på.
d) Diskutér også, hvordan de karakteristika, du valgte under a),
bedst og nemmest kan måles.
e) Diskutér, hvilke forhold der kan give anledning til en ikke-repræ­
sentativ stikprøve, og hvordan man evt. kan modgå dette.
3. Foreningen a f ambitiøse medicinstuderende er i gang med at lave
en undersøgelse af unges alkoholvaner. De har med lidt hjælp fået
opstillet deres stikprøveramme, så de faktisk har opnået en repræ­
sentativ stikprøve – tror de. For nu er de løbet ind i det problem, at
ikke alle de udtrukne elementer vil svare på spørgsmålet, de stil­
ler dem. I disse tilfælde udtrækker de en ny person, indtil de finder
en, der vil svare. De mener, det er problemfrit, men vil gerne lige
tjekke med dig. Lad X angive forbruget a f alkohol, og lad Z angive
svarvilligheden for en tilfældigt udtrukket person fra populationen.
Tabellen nedenfor angiver de simultane sandsynligheder for X og Z ,
som er givet ved populationsandelene. X = 1 ved moderat forbrug
(under 6 genstande om dagen) o g X = 2 ved højt forbrug (6 eller flere
genstande om dagen).
fX,Z(x,z )
Z=0
(vil ikke svare)
Z= 1
(vil gerne svare)
X= 1
(moderat forbrug)
0,1
0,6
X=2
(højt forbrug)
0,2
0,1
a) Beregn den marginale fordeling a f X (i populationen).
b) Beregn fordelingen a f X i. for det i’te udtræk til stikprøven.
c) Er stikprøven repræsentativ?
1 0
Skøn på middelværdi med
simpel tilfældig stikprøve
For at lære om en ukendt fordeling kan man bruge information fra en
stikprøve til at udarbejde skøn. Det er derfor vigtigt, at vi har effektive
metoder til at udvinde den relevante information fra stikprøven. Der
er mange forskellige aspekter a f den ukendte fordeling, man kan være
interesseret i at kende. Ofte er det et beskrivende mål som fx middel­
værdien a f forbruget a f en vare, som man ønsker at kende. Formålet
med dette kapitel er at vise, hvordan man kan konstruere et skøn på (en
estimator for) middelværdien i en fordeling ved hjælp a f en stikprøve,
og hvordan man kan vurdere kvaliteten a f skønnet.
Vores skruefabrikant fra kapitel 8 vil fx gerne kende middellængden
a f de skruer, der produceres. Længden a f en skrue kan repræsenteres
ved en stokastisk variabel, X. Sandsynlighedsfordelingen for denne,
f ( x ) , er imidlertid ukendt. Ved at tage en stikprøve a f de producerede
skruer håber fabrikanten, at han kan opnå et skøn på denne fordelings
middelværdi, μ.
I dette kapitel ser vi på skøn på en m iddelværdi, når vi har en sim­
pel tilfældig stikprøve. Man antager ofte, at en stikprøve er en simpel
tilfældigt udvalgt, fordi beregningerne er relativt enkle i dette tilfælde,
og fordi andre stikprøveudvælgelser ofte til dels benytter sig af simpel
tilfældig udvælgelse. I afsnit 10.1 ser vi på egenskaberne ved en simpel
tilfældig stikprøve. I afsnit 10.2 viser vi, hvordan man med en simpel
tilfældig stikprøve kan konstruere et skøn på middelværdien i en for­
deling. For at undersøge kvaliteten a f et skøn ser vi også på nogle a f de
egenskaber, som skøn kan have, i afsnit 10.3 og 10.4.
10.1
Simpel tilfældig stikprøve
En stikprøve er simpel tilfældigt udvalgt, hvis alle observationerne er
statistisk uafhængige, og de alle er fordelt som den fordeling, vi er inte­
resserede i, f X( x ) . Den næste boks sammenfatter.
Stikprøven ( X 1,...,X n er en simpel tilfældig stikprøve, hvis:
1. X l,..., X n er statistisk uafhængige
2. X 1,..., X n har samme (marginale) fordeling, f X( x ) , som er
fordelingen a f interesse.
En simpel tilfældig stikprøve er repræsentativ for X, fordi betingelse
2) er opfyldt (se definitionen a f en repræsentativ stikprøve i kapitel 9).
Fordelingen af en simpel tilfældig stikprøve, f (x 1,...,x n), kan man
skrive på en enkel form. Da X
1,.Xn er uafhængige ifølge 1), er den
simultane fordeling lig produktet a f alle de marginale fordelinger:
f (x 1, ...,xn) = fX 1 (x1) · fX 2 ( χ 2) · . ..· f Xn(xn)
Desuden medfører 2), at alle de marginale fordelinger er ens:
fX 1 (x i ) = f X (x i ) , i =1,..,n
Resultatet er opsummeret i følgende boks:
En simpel tilfældig stikprøve har fordelingen:
f (x 1,..., xn) = f X (x 1) · f X(x2) · . . . · f X(xn)
Eksempel 10.1: Endelave-ekspeditionen – del 1
Vi skal undersøge holdningen til tv-programmet „Endelave-ekspeditio­
nen“. Til dette formål vil vi gennemføre en markedsundersøgelse, hvor
vi spørger en række personer, om de synes, at programmet er „godt“
eller „skidt“. I statistiksprog har vi at gøre med en virkelig population
a f „godt“ og „skidt“-elementer, som udgøres a f alle dem, der har set
programmet. En sådan population med to mulige værdier kaldte vi for
en Bernoullipopulation i kapitel 6. Målet med markedsundersøgelsen er
at få et skøn på andelen, p, som synes, at programmet er godt.
Vi viste i kapitel 4, hvordan en virkelig population kan repræsente­
res ved en stokastisk variabel med en fordeling, som er lig med andels­
funktionen for populationen. Hvis man udvælger et element tilfældigt
i populationen og lader X være en stokastisk variabel, der angiver ved­
kommendes holdning til programmet:
så er X Bernoulli fordelt med parameteren p : X ~ Ber(p ). Derfor er mid­
delværdien a f X: E ( X ) = μ = p . Formålet med markedsundersøgelsen,
at finde et skøn på p, er derfor det samme som at finde et skøn på mid­
delværdien a f X.
For at holde beregningerne overskuelige antager vi, at man kun ud­
spørger tre personer om deres holdning til „Endelave-ekspeditionen“.
Stikprøven er altså tre stokastiske variabler: (X 1,X 2,X3). Den første sto­
kastiske variabel, X 1, er det svar, som den først adspurgte person giver.
Det kan enten være 1 (= godt) eller 0 (= skidt). De samme muligheder er
der for X 2 og X 3 Vi vil derfor som den realiserede stikprøve få én a f de
følgende 8 muligheder: (0,0,0), (0,0,1), (0,1,0), (0,1, 1), ( 1,0,0), (1,0,1),
(1,1,0), (1,1,1).
Antag, at stikprøven er en simpel tilfældig stikprøve (der trækkes
med tilbagelægning). Ved hjælp a f formlen i ovenstående boks kan vi
nu udregne sandsynlighederne for de forskellige realiserede stikprøver.
Sandsynligheden for, at den første observation bliver en „godt“-obser­
vation ( Χ 1 = 1), er p. Tilsvarende gælder for den anden og den tredje
observation. Sandsynlighederne for de forskellige stikprøver kan derfor
sammenfattes som i tabel 10.1:
Tabel 10.1:
Mulige stikprø­
Mulige
stikprøver
Sandsynlighed
(1 – p) · p · p
(1– p) · p · (1 – p)
(1 – p) · (1 – p) · p
(1 – p) · (1 – p) · (1 – p)
0,063
0,063
0,027
0,1,1)
P ·P ·P
heder
( 1,1,0)
P · P · (1 – p )
(1,0,1)
(1,0,0)
(0,1,1)
(0,1,0)
(0,0,1)
(0,0,0)
P = 0,7
0,343
0,147
0,147
0,063
0,147
sandsynlig­
ver og deres
Sandsynlighed hvis:
P · (1 – p ) · P
p· ( 1 – p) · ( 1 – p)
De forskellige mulige stikprøver har forskellige sandsynligheder for at
blive den realiserede stikprøve. Hvis vi forestiller os, at p = 0,7 (dvs.
70 % af populationen synes, at programmet er godt), så er sandsynlig­
heden for hver stikprøve udregnet i den tredje kolonne i tabel 10.1. Man
kan se, at stikprøven (1, 1, 1), hvor alle tre adspurgte svarer, at program­
met er godt, er den mest sandsynlige. Det er derimod væsentligt mere
usandsynligt at få en stikprøve, hvor alle tre svarer, at programmet er
skidt (0,0,0). I praksis kan vi dog ikke udregne disse sandsynligheder,
da andelen p er ukendt.
10.2
Konstruktion af en estimator for middelværdien
I dette kapitel er formålet at få et skøn på middelværdien, μ, for for­
delingen f X(x ) vha. en simpel tilfældig stikprøve. I en simpel tilfældig
stikprøve har de n observationer, Χ 1,..., X n, alle fordelingen f X( x ) . Der­
med har de også alle middelværdien μ. Dette antyder, at der er informa­
tion i hver enkelt observation til at få et skøn på μ. Vi ser i dette afsnit
på, hvordan man kan kombinere observationerne for at få et bedre skøn
på middelværdien.
Betragt først hver a f observationerne for sig. Da Χ 1 har middelvær­
dien μ, kan vi bruge den realiserede værdi a f X 1 som et skøn på mid­
delværdien μ. Men så kan vi ligeledes bruge den realiserede værdi af
X 2 som et skøn på μ, da X2 har samme fordeling som X 1 Vi kan derfor
bruge hver a f de n realiserede værdier a f X 1,..., X n som skøn på μ. Der­
med har vi n (forskellige) skøn på middelværdien. Dette antyder, at vi
ikke har en særlig god udnyttelse a f informationen i stikprøven, når vi
kun bruger én a f de realiserede værdier til at skønne på middelværdien.
Inspirationen til at konstruere et skøn, hvor vi inkluderer alle ob­
servationerne, kan man få fra et princip, som kaldes stikprøveanalog­
princippet. Dette princip siger, at man erstatter alle ukendte størrelser
med skøn i de formler, man ville bruge, hvis man kendte fordelingen,
f X( x). Hvis vi kendte f X( x ) , ville vi (for en diskret stokastisk variabel)
udregne middelværdien som:
hvor x1,..., x N i denne formel er de mulige værdier, som den stokastiske
variabel, X , kan antage, og f X(x) giver os sandsynligheden for hver af
disse værdier. Med en virkelig population er f X(x 1) andelen af popu­
lationen, som har en værdi lig med x1 I praksis kender vi ikke f X( x),
og måske kender vi heller ikke de mulige værdier a f X. I stedet giver
stikprøven os n værdier, x
,.x1 n, a f X, som hver udgør andelen 1/n af
stikprøven. Vi vil derfor bruge disse n værdier, x1,..., xn, i stedet for de
N mulige værdier a f den stokastiske variabel, X, og bruge deres vægt,
1/n, i stikprøven i stedet for sandsynlighederne, f X( x i) · Vi har dermed
fundet erstatninger for alle de ukendte størrelser i udregningen a f mid­
delværdien ovenfor. Skønnet sammensat på denne måde kalder man for
stikprøvegennemsnittet,
Stikprøvegennemsnittet,
er defineret som:
Eftersom stikprøven består a f n stokastiske variabler, X 1,...,Xn, er deres
også stokastisk. Vi kalder
for en estimator for μ. Det
gennemsnit,
er en stokastisk variabel, hvorimod μ er
er vigtigt at understrege, at
og det, den er en
en konstant. Denne forskel mellem estimatoren,
estimator for, nemlig middelværdien, er vigtig for forståelsen a f stati­
stiske metoder.
Når man indsætter den realiserede stikprøve i udtrykket ovenfor, får
Vi kalder også for esti­
man det realiserede stikprøvegennemsnit,
matet på μ. Vi viser i næste afsnit, at stikprøvegennemsnittet er et godt
skøn på middelværdien, og at det er bedre end kun at bruge en a f obser­
vationerne som skøn på middelværdien.
Eksempel 10.2: Endelave- ekspeditionen – del 2
Skønnet på middelværdien (andelen p) i eksempel 10.1 er i tabel
10.2 udregnet for hver mulig realiseret stikprøve. Hvis den realise­
rede stikprøve er (1,0,1), er vores skøn (estimat) på middelværdien:
( 1 + 0 + 1) / 3 = 0,67.
Tabel 10.2
Mulige stikprøver
Stikprøvegennemsnit,
Mulige stik­
prøver
(1,1,1)
1,00
(1,1,0)
0,67
(1,0,1)
0,67
(1,0,0)
0,33
(0,1,1)
0,67
(0,1,0)
0,33
(0,0,1)
0,33
(0,0,0)
0,00
Det ses a f tabellen, at tre a f de mulige stikprøver vil resultere i et skøn
på 0,67. Hvis den sande værdi a f p er fx 0,7, så vil ingen a f de mulige
stikprøver derfor resultere i et skøn, som er præcis lig med den sande
værdi.
■
Vi afslutter dette afsnit med formelt at definere en estimator. En estima­
tor er en funktion a f stikprøven, dvs. en funktion a f X 1,..., Χ n. Generelt
definerer man en estimator som følger:
En estim ator, Y, for en parameter, θ, er en stokastisk variabel,
som er en funktion h( ) a f stikprøven:
Y = h ( X 1, . . . , X n)
En realiseret værdi a f estimatoren kaldes et estimat på θ.
Når man har en realiseret stikprøve, har man også en realiseret værdi af
estimatoren. Denne realiserede værdi a f estimatoren kaldes et estimat.
Estimatet er vores skøn på den ukendte parameter, som i dette kapitel er
middelværdien a f fordelingen f X( x ) .
10.3
Egenskaber ved estimatorer
Hvad er en god estimator? Da estimatoren er en stokastisk variabel, ved
vi, at den nogle gange må resultere i et bedre skøn end andre gange.
Dette vil afhænge a f den realiserede stikprøve som illustreret i eksem-
pel 10.2. For at kunne sige noget mere konkret om estimatorens evne til
at ramme rigtigt må vi undersøge dens egenskaber.
10.3.1
Central estimator
Hvis vi kunne gentage eksperimentet med at udtage en stikprøve og be­
regne et estimat mange gange, ville det være ønskeligt, at vores estima­
tor i „gennemsnit“ ville ramme plet. For at undersøge, om den gør dette,
skal vi finde estimatorens middelværdi (forventede værdi). Hvis denne
er lig med den parameter, vi prøver at estimere, så siges estimatoren at
være central eller unbiased.
ved en simpel tilfældig stikprøve
Middelværdien a f estimatoren
kan udregnes på følgende måde:
idet vi udnytter, at middelværdien a f en sum blot er lig med summen af
middelværdierne, som alle er μ i dette tilfælde. Estimatorens middel­
værdi svarer altså til den værdi, den er sat til at skønne på.
Stikprøvegennemsnittet,
i en simpel tilfældig stikprøve er
en central (unbiased) estimator for middelværdien, μ, i forde­
lingen a f interesse:
Da estimatoren er en stokastisk variabel, har den en fordeling omkring
denne middelværdi. Her er det vigtigt at huske, at selvom estimatorens
middelværdi er μ , kan skønnet baseret på en given realiseret stikprøve
ligge milevidt fra μ. Dette er ikke en fejl ved metoden, men blot en
naturlig konsekvens af, at stikprøven kun består af et udsnit af popula­
tionen.
Hvis estimatorens fordeling er spredt vidt omkring middelværdien, er
estimatoren ikke så præcis, som hvis dens fordeling havde været kon­
centreret omkring middelværdien. Variansen a f estimatoren,
ved en
simpel tilfældig stikprøve kan udregnes på følgende måde:
hvor V ( X 1) = ... = V ( X n) = σ 2. Her er det udnyttet, at stikprøvens
observationer er uafhængige, således at variansen a f deres sum er lig
med summen af deres varianser.
Variansen af stikprøvegennemsnittet,
stikprøve er:
i en simpel tilfældig
hvor σ2 er variansen i fordelingen a f interesse.
Variansen a f en estimator kan hjælpe os til at vælge mellem flere esti­
matorer for den samme størrelse. I afsnit 10.2 påpegede vi, at man kun­
ne bruge den første observation X 1som et skøn på middelværdien. Der­
med bruger man ikke de øvrige observationer, X 2,. ..,X n. Men hvorfor
er dette mindre smart end at bruge gennemsnittet
Vi har allerede
vist, at
så begge estimatorer er centrale.
Men de har ikke samme varians! Vi udledte ovenfor, at
hvorimod V ( X 1) = σ 2. Hvis stikprøven således består a f 100 obser­
vationer, så er variansen 100 gange mindre, når gennemsnittet bruges
som estimator. Generelt siger vi, at en estimator er mere efficient end en
anden estimator, hvis den har mindre varians end denne.
Estimatoren
har altså den egenskab, at den er mere præcis, hvis
stikprøvens størrelse øges. Det ses a f formlen for variansen, at man skal
dividere med stikprøvestørrelsen, n. Kunne vi derfor lade stikprøve­
størrelsen vokse i det uendelige, ville variansen nærme sig 0. Derved
samler fordelingen for
sig omkring middelværdien, μ. Det betyder,
at skønnet med stor sandsynlighed vil ramme tæt på middelværdien.
Generelt siger vi, at en estimator er konsistent, hvis dens fordeling er
samlet omkring dens middelværdi, når stikprøvestørrelsen er tilstræk­
kelig stor.
Vi slutter dette afsnit med at opsummere de forskellige egenskaber,
som en estimator, Y, kan have:
Egenskaber ved estimatorer
En estimator, Y, for en parameter, θ, er:
1. central (unbiased), hvis E (Y) = θ .
2. konsistent, hvis E ( Y ) → θ og V ( Y ) → 0 når n → ∞ 13
3. mere efficient end estimatoren Z, hvis V ( Y ) < V ( Z ), og Y
og Z begge er centrale.
10.4
Fordeling af estimatoren
Stikprøvens gennemsnit i en simpel tilfældig stikprøve er altså en cen­
tral og konsistent estimator for fordelingens middelværdi. Ovenfor ud­
regnede vi estimatorens middelværdi, μ, og dens varians, σ2/n. Mere
generelt kunne vi dog være interesserede i at kende hele dens fordeling
og ikke blot m iddelværdien og variansen.
Ved hjælp a f den simultane sandsynlighedsfunktion, f ( x 1,...,xn), for
de n stokastiske variabler i stikprøven kan man udregne sandsynlighe­
derne for alle de forskellige realiserede stikprøver, man kan opnå. Ved
en simpel tilfældig stikprøve kan man bruge formlen i afsnit 10.1 til at
udregne fordelingen af estimatoren. Næste eksempel illustrerer dette.
Eksempel 10.3: Endelave-ekspeditionen – del 3
Vi kan udregne sandsynlighederne for de forskellige realiserede stik­
prøvegennemsnit i eksempel 10.2 ved at kombinere dem med sand­
synlighederne for at få en bestemt stikprøve udregnet i eksempel 10.1.
Tabellerne 10.1 og 10.2 er samlet i følgende tabel:
13
Symbolet
læses„→“går imod“. Det betyder her, at E(Y) går imod θ, hvis n går imod uendelig.
Tabel 10.3:
Realiserede
stikprøvegen­
nemsnit og
deres sand­
synligheder
Mulige
stikprøver
(1,1,1)
(1,1,0)
(1,0,1)
(1,0,0)
(0,1,1)
(0,1,0)
(0,0,1)
(0,0,0)
Stikprøvegennemsnit,
1,00
0,67
0,67
0,33
0,67
0,33
0,33
0,00
Sandsynlighed
p · p ·p
p · p · (1– p)
p · (1 – p) · p
p· (1 – p) · (1 – p)
(1– p) · p · p
(1 – p) · p · (1 – p)
(1– p) · (1– p) · p
(1 – p) · (1– p) · p)
(1–
Sandsynlighed
hvis p = 0,7
0,343
0,147
0,147
0,063
0,147
0,063
0,063
0,027
A f tabel 10.3 ses det, at skønnet 0,67 er estimatet ved tre forskellige
realiserede stikprøver. Den samlede sandsynlighed for et skøn på 0,67,
når vi udtager en simpel tilfældig stikprøve, er derfor summen a f sand­
synlighederne for at få hver a f disse realiserede stikprøver:
I tilfældet, hvor p = 0,7, er denne sandsynlighed lig med: 3 · 0,147 = 0,441.
Tilsvarende kan vi finde sandsynligheden for alle de andre mulige vær­
dier a f stikprøvegennemsnittet,
Dette er estimatorens sandsynlighedsfunktion (dens fordeling), som
altså afhænger a f den ukendte parameter p, som er den, vi prøver at
estimere.
■
Det er ikke altid så ligetil at udlede fordelingen a f en estimator. Et vig­
tigt specialtilfælde er dog, når man har en simpel tilfældig stikprøve,
hvor observationerne er normalfordelte. Dette tilfælde er gennemgået i
det næste eksempel.
Eksempel 10.4: En normalfordelt stikprøve
Lad os antage, at længden a f en produceret skrue er normalfordelt med
middelværdi μ og varians σ2. Vi udtrækker nu en simpel tilfældig stik­
prøve på n skruer: X 1, Χ 2,...,Χ n. De enkelte stokastiske variabler i stik­
prøven er da uafhængige normalfordelte variabler med middelværdi μ
og varians σ2: X i ~ Ν ( μ , σ 2), i = 1,...,n Estimatoren for middelværdien,
μ, er stikprøvegennemsnittet:
Når en stokastisk variabel, X, er normalfordelt, X ~ Ν ( μ , σ 2), vil den
stokastiske variabel Y =k · X, hvor k er en konstant, også være normal­
fordelt med middelværdi k · μ og varians k 2 · σ2. Deraf følger det, at:
er en sum a f sådanne uafhængige
idet Xi ~ Ν ( μ , σ 2) . Gennemsnittet,
normalfordelte variabler, X i / n. En sådan sum vil også være normalfor­
delt med en middelværdi, der er lig med summen a f middelværdierne
af de enkelte led og en varians, der er lig med summen a f varianserne:
idet summen af middelværdierne er μ, og summen a f varianserne er
σ2/n. Vi bemærker, at middelværdien og variansen af
naturligvis er.
som vi fandt i det generelle tilfælde. Det ekstra, vi nu har set, er, at
desuden er normalfordelt, når elementerne i stikprøven er normalfor­
delte.
■
Eksemplet ovenfor er et specialtilfælde, hvor observationerne i stik­
prøven er normalfordelte. I dette tilfælde viser det sig, at stikprøvens
gennemsnit,
også er normalfordelt. Ofte ved vi dog ikke, hvilken
fordeling stikprøvens observationer følger. Selvom fordelingen a f ob­
servationerne ikke er kendt, er det alligevel muligt at finde en approk­
simation til fordelingen af stikprøvegennemsnittet, som er tæt på den
korrekte fordeling a f stikprøvegennemsnittet, når stikprøvestørrelsen,
n, er stor. Her kan man gøre brug a f følgende resultat:14
Den centrale græ nsevæ rdisæ tning:
Antag, at vi har en simpel tilfældig stikprøve på n elementer,
X 1X2,...,Xn, hvo r E (X i) = μ og V ( X i) = σ 2, i = 1 ,...,n .Stik­
prøvegennemsnittet,
vil da være approksimativt normalfordelt
med middelværdi μ og varians σ2/n, når n er stor:
hvor ~A betyder approksimativt fordelt.
Den centrale grænseværdisætning ovenfor fortæller os, at uanset hvil­
ken fordeling hver observation fra en simpel tilfældig stikprøve følger,
er stikprøvegennemsnittet approksimativt normalfordelt, når blot stik­
prøven er tilstrækkelig stor. Dette er et meget brugbart resultat, som vi
vil anvende ofte i de efterfølgende kapitler. Det viser samtidig, hvorfor
normalfordelingen er en vigtig fordeling.
10.5
Opgaver
1 . Repetitionsspørgsmål:
a) Hvad skal vi bruge stikprøver til, og hvorfor er dette relevant?
b) Forklar forskellen på en stikprøve og en realiseret stikprøve.
c) Hvad forstår vi ved en simpel tilfældig stikprøve?
d) Forklar med dine egne ord, hvad en simpel tilfældig stikprøve
dækker over i tilfældet med en virkelig population. Hvilken sam­
menhæng er der mellem populationens fordeling og fordelingen
a f stikprøvens observationer?
e) Hvad er en estimator? Og hvad er et estimat?
f) Hvad forstår vi ved en central (unbiased) estimator?
g) Hvad vil det sige, at en estimator er efficient? Og konsistent?
h) Forklar kort indholdet a f den centrale grænseværdisætning.
14 Formelt siger den centrale grænseværdisætning, at det standardiserende stikprøvegennemsnit er
asymptotisk standardnormalfordelt:
2. Politiet ønsker at bestemme andelen a f gæster, p, på et diskotek, som
er under 18 år. Til dette formål beslutter de sig for at udtage en sim­
pel tilfældig stikprøve på 5 personer blandt diskotekets 235 gæster.
a) Hvad er sandsynligheden for, at samtlige personer i stikprøven er
18 år, eller derover?
Lad X i antage værdien 1, hvis den i’te person i stikprøven er under
18 år, og værdien 0, hvis han/hun ikke er det.
Find
b) Find den forventede værdi af stikprøvegennemsnittet,
(Hint:
Hvad
er
variansen
a
f
en
Bernoulliogså variansen af
fordelt variabel?)
c) Udregn den forventede værdi og variansen fra spørgsmål b) i det
tilfælde, hvor p = 0,3.
d) Diskutér eventuelle problemer, der kan være forbundet med at
skulle sikre sig, at stikprøven er simpelt tilfældigt udvalgt.
3. En sundhedsplejerske udtager en simpel tilfældig stikprøve på 200
børnehøjder på en skole med en population på 2000 børn. Antag, at
denne (ukendte) populations middelværdi er μ = 140 cm, og at dens
varians er σ2 = 64.
a) Forklar, hvorledes stikprøven skal udtages, for at den bliver sim­
pel tilfældig.
b) Hvad er den forventede værdi a f stikprøvegennemsnittet, Χ
c) Hvad er variansen af
d) Bestem den approksimative fordeling a f stikprøvegennemsnittet.
e) Brug fordelingen i d) til at udregne sandsynligheden for at få en
stikprøve med et gennemsnit på mindre end 136 cm.
f) Find også sandsynligheden for, at stikprøvens gennemsnit ikke
ligger mere end 2 cm fra populationens middelværdi.
g) Hvis sundhedsplejersken med 90 % sandsynlighed skal have en
stikprøve, hvis gennemsnit ligger mindre end én cm fra popula­
tionens middelværdi, hvor stor en stikprøve skal hun da vælge?
1 1
Skøn på middelværdi med
stratificeret stikprøve og
klyngeudvælgelse
Ofte kender vi andre karakteristika ved en virkelig population end det
karakteristikum, vi gerne vil undersøge. Hvis dette er tilfældet, kan det
være muligt at udtage en stikprøve på en måde, som giver os mere in­
formation om det ukendte karakteristikum, vi vil undersøge, end hvis
vi blot udtager en simpel tilfældig stikprøve. I dette kapitel vil vi vise,
hvordan vi kan forbedre skønnet på en virkelig populations middelvær­
di i forhold til skønnet fra kapitel 10 ved at bruge vores kendskab til
andre karakteristika ved populationen.
I afsnit 11.1 definerer vi det stratificerede stikprøvegennemsnit, som
er en estimator a f populationens middelværdi med en stratificeret stik­
prøve. I afsnit 11.2 gennemgår vi egenskaber ved det stratificerede stik­
prøvegennemsnit. Der er typisk mange måder, man kan stratificere på,
og i afsnit 11.3 diskuterer vi nogle af disse måder. Vi slutter kapitlet af
med at diskutere klyngeudvælgelse, som man tit bruger i praksis.
11.1
Stratifikation
Stratifikation er en metode til at opnå større præcision a f et skøn på fx
middelværdien, end hvis man udtrækker en simpel tilfældig stikprøve.
Man kan anvende stratifikation, hvis man har et forhåndskendskab til
fordelingen af et karakteristikum i en population. Antag, at hvert ele­
ment i populationen har mindst to karakteristika. Ét af karakteristika­
ene er det karakteristikum, for hvilket vi gerne vil kende fordelingen.
Fordelingen a f det andet karakteristikum (eller de andre karakteristika)
kender vi. Det kunne for eksempel være en aldersfordeling eller køns­
fordeling. Ved stratifikation opdeles populationen i grupper, også kaldet
strata, baseret på det karakteristikum, vi kender. Fra hvert stratum udta­
ger vi en simpel tilfældig stikprøve. Vi får derfor brug for en model, der
kan binde informationen i stikprøverne fra de forskellige strata sammen
til information om den samlede population.
Som i kapitel 10 vil vi lade den stokastiske variabel, X , repræsentere
det karakteristikum, vi er interesserede i at undersøge. Derudover vil
vi lade det kendte karakteristikum være repræsenteret ved variablen, Y.
Stratifikation:
Stratifikation er mulig, hvis elementerne i den virkelige popula­
tion har mindst ét kendt karakteristikum, Y.
Et stratum, j, består a f alle elementer med samme værdi af
Y: Y - y j.
A f boksen følger det, at alle elementer i populationen, som har samme
værdi a f Y, grupperes i det samme stratum. Hvis Y derfor antager m for­
skellige værdier i populationen, vil der være m forskellige strata.
Eksempel 11.1: Markedsføring i butikker– del 1
En større dansk producent markedsfører sine produkter i 400 mindre
danske butikker. I den forbindelse ønsker producenten at gennemføre
en undersøgelse af, hvor mange kvadratmeter de enkelte forretninger
tild e le r p ro d u k tern e. D e tte er d e t u k e n d te k a r a k te r istik u m a f in te r e s s e ,
som vi kan lade repræsentere ved den stokastiske variabel, X. Da det
er for dyrt for producenten at undersøge alle 400 forretninger i popu­
lationen, vil producenten i stedet forsøge at estimere middelværdien
a f X ved hjælp a f en stikprøve. Producenten kender den geografiske
placering a f hver butik. Den geografiske placering a f butikkerne lader
vi repræsentere af variablen, Y, fx kan Y = 0 betyde, at butikken ligger
i Jylland. Producenten håber at få et bedre skøn på middelværdien af
de anvendte kvadratmetre ved at udnytte den geografiske information i
stikprøveudtagelsen.
■
11.1.1
Stratificeret stikprøvegennemsnit
Ved stratifikation skal man være i stand til at finde middelværdien a f X
i populationen ud fra middelværdierne a f X i de forskellige strata. Dette
gøres ved hjælp af følgende formel, som også kaldes loven om itererede
forventninger:15
μ = E X ( X ) = E X│Y( X \ Y = y 1)· f Y( y 1)+ ... + E ( X │Y = y m) · f Y(ym)
hvor μ er middelværdi a f X i populationen, m er antallet a f udfald
for Y (her antal strata), f Y(yj ) er sandsynlighedsfunktionen for Y, og
EX│Y(X │Y = y j ) er middelværdien a f X i stratum j , som svarer til den
betingede middelværdi af X givet Y = y j Til at vægte stratummiddelvær­
dierne sammen i ovenstående formel bruger vi andelene a f de forskel­
lige strata i populationen (som også er givet ved sandsynlighedsfunkti­
onen for Y i det tilfælde, hvor alle elementer har samme sandsynlighed
for udvælgelse):
f Y( y j) = N j/N pop = w j
hvor N. er antallet a f elementer i stratum j , dvs. antallet af elementer
med Y =y j, og N po er det totale antal elementer i populationen. Dermed
er wj andelen a f elementer i stratum j i forhold til hele populationen. Vi
opsummerer i boksen:
15 Man kan eftervise formlen med regneregler for simultane og betingede sandsynligheder på følgende
måde for diskrete stokastiske variabler, X og Y:
Det sidste udtryk kan man desuden skrive som:
Det gælder derfor, at EX(X) = Ε Y(ΕX│Y(X│Y)). Dette resultat kaldes loven om itererede forventninger.
Populationsm iddelvæ rdien, E(X) = μ, kan udregnes som en
vægtet sum a f de m stratummiddelværdier:
hvor μj = E ( X │Y = y j ) er middelværdien a f X i stratum j (ele­
menter med Y = y j) , og w j = N j / Npop er stratum ƒ s andel a f den
samlede population.
Eksempel 11.2: Markedsføring i butikker – del 2
Producenten fra eksempel 11.1 regner med, at de butikker, der ligger
i Jylland, minder om hinanden. Tilsvarende regner han med, at butik­
kerne på Øerne er relativt ens. Derimod formoder producenten, at der
er en generel forskel mellem jyske butikker og ikke-jyske butikker.
Producenten definerer derfor et „Jylland“-stratum, hvori alle butikker
i Jylland indgår, og et „Øerne“-stratum med alle butikkerne på Øerne.
Lad variablen, Y, indikere, om en butik ligger i Jylland eller på Øerne:
Der er i alt N po = 400 butikker med henholdsvis N jyl = 160 butikker i
Jylland og Nøer = 240 butikker på Øerne. Heraf følger, at:
wJyl = NJyl/N pop =160/400 = 0,4
wøer = N øer/N pop = 240/400 = 0,6
hvor wJyl og wøer er de andele a f populationen, som tilhører henholdsvis
stratum „Jylland“ og stratum „Øerne“. Dermed kan middelværdien a f X
i den samlede population skrives som:
μ = μjyl · wjyl + μøer · wøer = μjyl · 0,4 + μøer · 0,6
hvor μjyl = E X│Y( X │Y = 0 ) er middelværdien a f X i Jylland, og
■ μ = EX│Y(X│Y=1) er middelværdien a f X på Øerne.
I praksis kan vi finde et skøn (estimat) på middelværdien, μ, ved at
erstatte alle ukendte størrelser i formlen ovenfor med skøn baseret på
stikprøver fra hvert stratum. Det var en tilsvarende tilgang til estimati­
on, som vi i kapitel 10 kaldte stikprøveanalogprincippet. Populations­
andelene, w j antager vi er kendte, så vi mangler kun skøn på middel­
værdierne a f X i de forskellige strata.
Vi udtrækker en simpel tilfældig stikprøve fra hvert stratum. Derfor
kan vi bruge teknikkerne fra kapitel 10 til at få et skøn på middelværdi­
erne i hvert a f disse strata. Hvis vi således udtrækker en simpel tilfældig
stikprøve (X 1,j,X 2,J,...,X nj,j) a f størrelsen n j fra stratum j , da er et skøn
på middelværdien, μ j = E X|Y( X │Y = y j) , i dette stratum givet ved stik­
prøvegennemsnittet:
Skønnet på middelværdien, μ, i den samlede population finder vi ved
i formlen for populationens middelværdi ovenfor:
at erstatte μ j med
Stratificeret stikprøvegennemsnit:
Det anvendes som en estimator for populationsmiddelværdien,
er stikprøvegennemsnittet fra stratum j , m er antallet
μ , hvor
a f strata, og w j. er stratum j s andel af den samlede population.
Det ses, at
er en vægtet sum a f de m stratas stikprøvegennemsnit.
Eksempel 11.3: Markedsføring i butikker – del 3
Producenten fra de foregående eksempler udtrækker en stikprøve fra
hvert a f de to strata af størrelserne njyl og nøer. Ud fra disse kan produ­
centen konstruere følgende to estimatorer for henholdsvis middelvær­
dien i Jylland, μjyl, og middelværdien på Øerne, μ øer.
Estimatoreme
kan derefter sammenvejes til en estimator for
populationens samlede middelværdi, μ :
Hvis de realiserede stikprøver resulterede i, at
så er
■
11.2
Egenskaber ved stratificeret stikprøvegennemsnit
I dette afsnit undersøger vi egenskaber ved det stratificerede gennem­
snit, og vi sammenligner det med det simple stikprøvegennemsnit.
Generelt er stratificerede stikprøver ikke repræsentative. Dette gæl­
der, hvis n j/n ≠ N j/N pop, og hvis der er afhængighed mellem det karak­
teristikum, Y, som man bruger til at definere strata, og det karakteristi­
kum, X, man undersøger.
En konsekvens a f en ikke-repræsentativ stikprøve er, at det simple
stikprøvegennemsnit ikke er en central estimator a f populationsmiddel­
værdien. Dette ses nemmest ved et eksempel.
Eksempel 11.4: En biased estimator
Betragt to strata med lige mange elementer: N 1/N pop = N 2/N pop = 1/2.
Antag, at middelværdierne er μ 1= 10 og μ 2 = 20. Dermed er populatio­
nens middelværdi μ = 15. Hvis vi vælger stikprøvestørrelserne således,
at n 1/n = 3/4 og n2/n = 1/4, da er den forventede værdi a f det simple
stikprøvegennemsnit:
er stikprøvegennemsnittet ikke en
central estimator. Problemet er, at stikprøvegennemsnittet ikke korri­
gerer for, at stikprøven ikke er repræsentativ, da elementer i stratum 1
har tre gange så høj sandsynlighed for udvælgelse som elementer fra
stratum 2.
■
Man bør derfor ikke anvende det simple stikprøvegennemsnit som en
estimator for populationens middelværdi, hvis man har en stratificeret
stikprøve.
er konstrueret således,
Det stratificerede stikprøvegennemsnit,
at det korrigerer den ikke-repræsentative stikprøve, så man kan få et
centralt skøn på populationsmiddelværdien. Dette kan ses således:
hvor det sidste lighedstegn følger a f den første boks i afsnit 11.1.1. Det
stratificerede stikprøvegennemsnit er altså en central estimator.
Et vigtigt formål med at stratificere er, at man med en given stikprø­
vestørrelse kan få større præcision end med en simpel tilfældig stikprø­
ve. Effekten af stratificering kan ses på variansen a f det stratificerede
som er sammensat af varianserne på stikprø­
stikprøvegennemsnit,
fra de forskellige strata:
vegennemsnittene,
Her er det udnyttet, at stikprøvegennemsnittene fra de forskellige strata
er uafhængige, og derfor er variansen a f deres (vægtede) sum lig med
en sum af deres varianser. Vi mangler dog et udtryk for
de samme karakteristika, som stikprøve­
Som et skøn på μj har
gennemsnittet,
havde som et skøn på μ i kapitel 10. Dette er ikke så
mærkeligt, hvis vi tænker på et stratum som en underpopulation, hvor­
fra vi udtrækker en simpel tilfældig stikprøve a f størrelsen n j. Vi ved da
er:
fra kapitel 10, at variansen af
hvor V (X │Y = y j ) er variansen af X, givet Y antager værdien y j (kaldet
den betingede varians a f X, givet Y). Den er lig med σ j2, som er varian­
sen a f X i stratum j.
Den samlede varians a f det stratificerede stikprøvegennemsnit,
er derfor:
Det ses, at variansen af
afhænger a f stikprøvestørrelsen i hvert stra­
tum,
nj,andelen a f elementer i hvert stratum i forhold til hele populati­
onen, wj, samt variansen a f X i hvert stratum, σ j2. Den samlede stikprø­
vestørrelse er: n 1 + n 2 + ...+ nm = n.
Som et alternativ til det stratificerede stikprøvegennemsnits skøn på
μ kunne vi have udtrukket en simpel tilfældig stikprøve med n obser­
vationer fra hele populationen og brugt stikprøvegennemsnittet,
fra
kapitel 10 som et skøn på μ. Dette skøn er også centralt, men har ofte en
anden varians end
Variansen af
fandt vi i kapitel 10 til at være:
Dette skal sammenlignes med det ovennævnte udtryk
for
Det bedste skøn vil være skønnet med mindst varians. Det­
te afhænger a f størrelserne af
og nj og dermed af, hvordan strata er
defineret. Hvis stratumvarianserne,
er små i forhold til populationsvariansen, σ2, vil det stratificerede stikprøvegennemsnit være et bedre
(et mere præcist) skøn. Vi siger også, at det stratificerede stikprøvegen­
nemsnit da er mere efficient end det simple stikprøvegennemsnit.
Eksempel 11.5: Markedsføring i butikker – del 4
I undersøgelsen a f butikker er varianserne af
dvs. henholdsvis
og
det stratificerede stikprøvegennemsnit og det simple stikprøvegennem­
snit, givet ved:
hvor n = n + nøer, idet vi antager, at der anvendes den samme samlede
stikprøvestørrelse ved de to fremgangsmåder. Her er
en mere „præcis“ estimator end
hvis
er
små
sammenlignet
med
og
Dette kunne være tilfældet, hvis der var en stor generel forskel på bu­
tikker i Jylland og på Øerne, fx fordi jyske butikker generelt anvender
mere plads til produkterne i butikkerne og derfor klumper sig sammen
om en middelværdi, μjyl, som er noget større end den, som butikker på
Øerne fordeler sig omkring, μ øer. Tankegangen er illustreret i figur 11.1.
Figur 11.1
Population og
strata
For populationen som helhed vil der i figur 11.1 være en høj varians,
hvorimod der inden for hvert a f de to strata er en relativt lille varians.
De to estimater på stratummiddelværdierne bliver derfor relativt præ­
cise, og dette giver også et mere præcist estimat på den samlede po­
pulationsmiddelværdi, når man bruger de rigtige vægte: wjyl = N jyl/N po
og wøer = N øer/N pop. Hvis man i stedet trækker tilfældigt fra hele popu­
lationen, er der stor sandsynlighed for at få „for mange“ observationer
fra et a f de to strata, og estimatet bliver følgelig trukket imod dette
stratums middelværdi. Der er dog tale om naturlig variation, da en til­
fældigt udtrukket stikprøve fra hele populationen sjældent indeholder
elementer fra de to strata i præcis det forhold, som de to strata udgør i
populationen.
■
Som eksemplet illustrerer, skal det karakteristikum, man kender, Y,
være korreleret med det karakteristikum, X, man ønsker at undersøge,
hvis stratifikationen skal kunne øge præcisionen a f skønnet på mid­
delværdien. Rent matematisk kan man se dette i formlen for
som afhænger a f V (X │Y = y j ). Hvis der ingen sammenhæng er mel­
lem X og Y (X og Y er uafhængige), er variansen a f X uafhængig af,
hvilket stratum vi ser på. Det medfører, at V ( X │Y = y j ) = σ 2 for alle
j = 1 ,...,m . Hvis vi indsætter dette i formlen, bliver
hvilket også er variansen på stikprøvegennemsnittet med simpel til­
fældig udvælgelse. Eksemplerne illustrerer også, at stratificering er tæt
knyttet til begrebet „betinget forventning“. Årsagen til, at man stratifi­
cerer, er netop, at man forventer, at de betingede middelværdier (i stra­
ta) er anderledes end den ubetingede middelværdi (i hele populationen).
Egenskaber for stratificeret stikprøvegennemsnit:
Estimatoren
har følgende egenskaber:
hvor
er variansen a f X i stratum j, w jer stratum j s andel a f den
samlede population, og n j er størrelsen af stikprøven fra stratum j.
Når man i en undersøgelse har defineret de forskellige strata, skal man
bestemme, hvor stor en stikprøve man vil udtage fra hvert stratum. I det
ovenstående antog vi blot, at der var nogle givne størrelser a f stikprø­
verne: n1,n2,...,nm. I det følgende skal vi se på nogle forskellige metoder
til at bestemme disse størrelser.
11.3
Valg af stratumstikprøvestørrelse
Der er mange måde at bestemme stikprøvestørrelsen fra hvert stratum
på. Der findes en måde, kaldet optimal allokering, som er optimal i den
henseende, at det stratificerede stikprøvegennemsnit får mindst mulig
varians. En anden måde, som er nemmere at implementere i praksis, er
proportional allokering.
11.3.1
Optimal allokering
A f ovenstående boks fremgår det, at variansen a f den stratificerede esti­
afhænger a f både
mator,
og
Hvis man kender varianserne i de
forskellige strata,
kan man udlede de stikprøvestørrel­
ser, (n 1,n2,...,nm,) som for en given samlet stikprøvestørrelse, n, sikrer, at
variansen af
bliver mindst mulig. Disse optimale stikprøvestørrelser
er givet ved:
hvor nævneren er en vægtet sum a f standardafvigelserne i de forskellige
strata. Intuitionen i dette udtryk er, at hvis variansen,
i et stratum j
er høj, tager man en relativt stor stikprøve, n*j fra dette stratum. Tilsva-
rende tager man en stor stikprøve fra stratum j , hvis andelen, w j, af dette
stratum i populationen er stor.
Når der anvendes den optimale stikprøvestørrelse, n*j for hvert stra­
tum, kan det vises, at variansen a f det stratificerede stikprøvegennem­
snit,
er givet ved:
Sammenligner man dette med variansen a f stikprøvegennemsnittet,
så følger det, at det stratificerede stikprøvegennemsnit ved optimal allo­
Dette
kering,
har mindre varians end
hvis
vil altid være tilfældet, hvis varianserne i de enkelte strata er mindre
end i populationen som helhed.
Eksempel 11.6: Rødvin og indkomststrata
En vinimportør vil gerne undersøge middelforbruget a f rødvin fra Haut
Medoc-distriktet. For at undersøge forbruget vil vinimportøren hyre
et analyseinstitut, som skal tage ud til private hjem for at foretage in­
terviews. Analyseinstituttet tager 500 kr. per interview. Vinimportøren
regner med, at der skal foretages en simpel tilfældig stikprøve, og at
man derfor skal interviewe 1000 personer for at få en tilfredsstillende
præcision. Den totale omkostning ved denne undersøgelse vil derfor
blive 500.000 kr.
Analyseinstituttet vurderer imidlertid, at forbruget a f Haut
Medoc-rødvin afhænger kraftigt a f husstandsindkomsten. Jo højere ind­
komst, desto højere forbrug. Instituttet foreslår derfor, at man opdeler
populationen i to strata. Ét stratum for husstande med en indkomst over
400.000 kr. og ét for dem med en indkomst under 400.000 kr. De regner
også med, at standardafvigelsen i hvert stratum er halvt så stor som stan­
dardafvigelsen for hele populationen: σlavindkomst = σ højidkomst = ½ · σ
Hvis husstande med en indkomst under 400.000 kr. udgør 40 % a f po­
pulationen, er variansen a f det stratificerede gennemsnit med optimal
allokering a f stikprøvestørrelserne på strata givet ved:
Sammenlignet med variansen a f stikprøvegennemsnittet,
er
fire gange mindre. For at få den samme præcision a f esti­
matoren er det derfor kun nødvendigt at interviewe 1000/4 = 250 per­
soner, hvilket „kun“ koster 125.000 kr. Vinimportøren kan altså spare
375.000kr. ved at foretage en stratifikation.
■
For at anvende optimal allokering skal man kende variansen a f X i hvert
stratum. Det gør man som regel ikke. I stedet kan man forsøge at få et
skøn på variansen i hvert stratum (som vi skal se i næste kapitel) ved
at lave en forundersøgelse (også kaldet en pilotundersøgelse). Derefter
kan man bruge formlen for n*j med σ j erstattet med skønnet på σ j Dette
kaldes også optimal allokering.
Den optimale stikprøvestørrelse fra stratum j er:
hvor n er den samlede stikprøvestørrelse, σ j er standardafvigelsen
af X i stratum j , og w j er andelen af stratum j i populationen. Va­
riansen af den stratificerede estimator ved optimal allokering er:
11.3.2
Proportional allokering
Selvom man ikke bruger de optimale stratumstikprøvestørrelser, kan
det ofte godt betale sig at stratificere alligevel. En mulig allokering er
at vælge stikprøvestørrelserne for de forskellige strata således, at de
er proportionale med størrelserne a f strataene: nj /n = N j/N po = w j.
I dette tilfælde er det stratificerede stikprøvegennemsnit lig med gen­
nemsnittet a f alle de observationer, som udtrækkes fra de m strata.
Årsagen er, at stikprøverne allerede er fordelt i forhold til de enkelte
stratas størrelse. Der er derfor ikke brug for en yderligere vægtning af
observationerne. Dette kan vises formelt på følgende måde:
Selvom dette er et gennemsnit af alle observationerne, er det ikke det
samme som stikprøvegennemsnittet uden stratifikation. Årsagen er, at
antallet a f udtrukne elementer i hvert stratum er fastsat på forhånd ud
fra, hvor stor en del a f hele populationen et stratum udgør. Ved en sim­
pel tilfældig stikprøve kan vi i princippet risikere at udtrække alle ob­
servationerne i stikprøven fra det samme stratum.
Ved proportional allokering er stikprøvestørrelsen fra stratum j :
hvor n er den samlede stikprøvestørrelse, og wj er andelen af
stratum j i populationen. Variansen a f den stratificerede estimator
ved proportional allokering er:
11.3.3
Ikke-kontrolleret stratifikation
Indtil nu har vi fokuseret diskussionen a f stratifikation på den situation,
hvor vi har kontrol over stikprøvestørrelsen i hvert stratum. Hvis man
derimod køber en allerede udtrukket stratificeret stikprøve fra fx Dan­
marks Statistik, er stikprøvestørrelserne for hvert stratum givet. For at
kunne bruge sådan en undersøgelse er det altså strengt nødvendigt, at
man kender både stikprøvestørrelsen, n j for hvert stratum samt ande­
len, wj, af populationens elementer i hvert stratum. Derefter kan man
bruge formlen fra afsnit 11.1.1 til at konstruere det stratificerede skøn
på hele populationens middelværdi.
11.3.4
Stratifikation uden tilbagelægning
Hidtil har vi antaget, at man udtager en simpel tilfældig stikprøve fra
hvert stratum. Fordi vi har med virkelige populationer at gøre, betyder
dette, at der udtrækkes med tilbagelægning. I de fleste virkelige situatio­
ner vil man dog udtrække uden tilbagelægning. Det betyder, at de enkelte
observationer i en stikprøve fra et stratum ikke vil være uafhængige.
Estimatorerne for middelværdierne udregnes dog på den samme
måde som tidligere. Ændringen består i, at deres varianser (og forde­
ling) er anderledes. Hvis man således trækker en simpel tilfældig stik­
prøve fra hele populationen uden tilbagelægning, vil stikprøvegennem­
have variansen:
snittet,
Variansen a f det stratificerede stikprøvegennemsnit,
ændres til­
svarende, og det samme gør udtrykket for de optimale stikprøvestørrel­
ser, idet disse skal minimere estimatorens varians. Den følgende boks
giver de nødvendige formler:
Ved stratificeret udvælgelse uden tilbagelægning er variansen
på den stratificerede estimator givet ved:
og den optimale stikprøve fra stratum j er:
Hvis stikprøvestørrelsen, n j, er lille i forhold til stratumstørrelsen, N j,
er den praktiske betydning a f disse korrektioner imidlertid ikke ret stor.
Ofte er en stor del a f omkostningen ved at gennemføre en undersøgelse
bestemt af, hvor besværligt det er at opnå informationen om de udvalgte
elementer. Hvis elementerne er geografisk meget spredt, og informatio­
nen opnås ved, at man foretager interviews med de udvalgte elementer,
kan transportomkostningerne hurtigt blive meget store. Det kan også
være, at man vil undersøge et produkt ved hj ælp a f et laboratorieforsøg.
I så fald er det typisk billigere at undersøge mange elementer på én
gang end at opstille forsøget mange gange. Derfor kan det nogle gange
være praktisk (billigere) at samle elementer i grupper, kaldet klynger
på statistiksprog, og så udtrække én eller flere klynger i stedet for at
udtrække enkelte elementer.
Efter at en virkelig population er blevet inddelt i klynger, anvender
man simpel tilfældig udvælgelse til at udtrække nogle af klyngerne.
Inden for de udtrukne klynger bruger man da alle elementerne (ét-trins
metoden) eller udvælger nogle a f elementerne ved simpel tilfældig ud­
vælgelse (to-trins metoden). Dette kaldes klyngeudvælgelse.
Bemærk, at med klyngeudvælgelse udvælger man kun nogle klyn­
ger, hvorimod man ved stratificering udtrak fra alle strata. Derfor er
fokus ved inddelingen i klynger også anderledes end ved inddelingen i
strata. Hvor man ved stratifikation søger at opdele populationen i homo­
gene grupper (strata), er det ved klyngeudvælgelse bedst at opdele i
heterogene grupper (klynger), således at den enkelte klynges sammen­
sætning er repræsentativ for populationens sammensætning.
Figur 11.2
Homogene
strata vs.
heterogene
klynger
Eksempel 11.7: Markedsføring i butikker – del 5
Hvis producenten fra eksempel 11.5 opfatter Jylland og Øerne som to
klynger i stedet for to strata og udvælger nogle elementer fra den ene
klynge (fx Jylland) til at udgøre stikprøven (to-trins metoden), så vil
dette give et skævt estimat på populationsmiddelværdien, jf. figur 11.1
Årsagen er, at de to klynger hver for sig ikke giver et repræsentativt
billede af populationen. Hvis producenten ønsker at anvende klyngeud­
vælgelse, skal han derfor opdele sin population anderledes.
K lyngeudvælgelse anvendes med fordel, når det er dyrt at ud­
vælge eller undersøge elementer enkeltvis, og når de enkelte
klynger er heterogene.
Ved stratifikation stræber man efter at gøre hvert stratum så homogent
som muligt, således at variansen a f X i hvert stratum er lav. Derved
nedsættes variansen for det stratificerede skøn på middelværdien. Ho­
vedmotivationen for at lave klyngeudvælgelse er, at det er billigere. Det
er altså en omkostningsmotivering snarere end en statistisk motivering,
der ligger til grund for klyngeudvælgelse, selvom en billigere under­
søgelse a f et element naturligvis betyder, at man kan undersøge flere
elementer for de samme penge.
Hvis populationen er opdelt i K klynger a f samme størrelse,
og antallet af udvalgte klynger er k, så er klyngeestirnato­
ren for populationsmiddelværdien, μ , givet ved:
er gennemsnittet i klynge j. Dette er et simpelt gennemsnit af
hvor
alle de udtrukne elementer.
11.5
Opgaver
1 . Repetitionsspørgsmål:
a) Hvad er den grundlæggende idé med at stratificere en populati­
on?
b) Hvad skal vi vide om populationen for at kunne foretage en stra­
tifikation, og hvordan er et stratum defineret?
c) Hvad er sammenhængen mellem populationsmiddelværdien og
stratumm iddelværdierne?
d) Forklar, hvordan det stratificerede stikprøvegennemsnit udreg­
nes.
e) Hvad er det stratificerede stikprøvegennemsnit en estimator for?
Og hvilke egenskaber har det som estimator?
er en
f) Hvad afgør, om det stratificerede stikprøvegennemsnit,
bedre estimator end det simple stikprøvegennemsnit,
g) Forklar, hvad der forstås ved optimal allokering a f stikprøvestør­
relserne.
h) Forklar også, hvad der menes med proportional allokering, og
kan udregnes i dette
hvordan den stratifi cerde estimator,
tilfælde.
i) Hvorfor ændres den optimale allokering af stikprøvestørrelserne,
når der trækkes uden tilbagelægning?
j) Hvordan foregår klyngeudvælgelse a f en stikprøve?
k) Hvornår er klyngeudvælgelse fordelagtig sammenlignet med
stratificeret udvælgelse?
2. I en stratificeret population er der fire strata. Størrelserne a f disse
strata, middelværdierne og varianserne a f X i de forskellige strata er
som følger:
Stratum
1
N j
μj
σ 2j
105
6,5
4,34
2
76
8,4
2,33
3
57
12,4
3,52
4
89
3,6
2,12
a) Bestem middelværdien a f X i hele populationen.
Variansen af X i hele populationen er lig med 11,86 (kan du eftervise
dette?). Antag, at den samlede stikprøvestørrelse er n = 40.
b) Find variansen a f stikprøvegennemsnittet, hvis der anvendes
simpel tilfældig udvælgelse fra hele populationen.
c) Bestem stikprøvestørrelserne fra de forskellige strata, hvis der
anvendes proportional allokering og simpel tilfældig udvælgelse
fra de enkelte strata. Bestem også variansen a f det stratificerede
stikprøvegennemsnit i dette tilfælde.
d) Bestem stikprøvestørrelserne, hvis der i stedet anvendes optimal
allokering. Bestem også variansen af det stratificerede stikprøve­
gennemsnit i dette tilfælde.
e) Sammenlign varianserne fra spørgsmål b)-d).
f) Udregn de optimale stikprøvestørrelser fra de forskellige strata,
hvis der i stedet trækkes uden tilbagelægning. Bestem også va­
riansen af det stratificerede stikprøvegennemsnit i dette tilfælde.
3. En dansk virksomhed vil gerne undersøge, hvor meget der købes
a f dens produkter i 347 forretninger i Danmark. Forretningerne kan
klassificeres som henholdsvis: små (238 stk.), mellemstore (90 stk.)
og store (19 stk.). Da virksomheden regner med, at salget a f dens
produkter vil være positivt korreleret med størrelsen a f forretningen,
ønsker den at anvende en stratificeret stikprøveudvælgelse med til­
bagelægning.
a) Find stikprøvestørrelserne for de forskellige strata ved proportio­
nal allokering a f en samlet stikprøvestørrelse på n = 30.
b) Find de optimale stikprøvestørrelser, hvis variansen blandt de
store forretninger antages at være fire gange så stor som blandt
de små og dobbelt så stor som blandt de mellemstore:
c) Forklar forskellen på resultaterne i a) og b).
12
Skøn på andre
beskrivende mål
I kapitel 10 kiggede vi på stikprøvegennemsnittet som en estimator for
middelværdien i en fordeling, når vi har en simpel tilfældig stikprøve. I
kapitel 11 udvidede vi dette til andre typer af stikprøveudvælgelse, som
ofte anvendes ved udvælgelse fra virkelige populationer. I dette kapitel
antager vi igen, at vi har en simpel tilfældig stikprøve, men undersøger
også estimatorer for andre beskrivende mål for en fordeling.
I kapitel 5 inddelte vi beskrivende mål i momenter, fx middelværdi­
en, og i fraktiler, fx medianen. I dette kapitel betragter vi estimatorer for
disse beskrivende mål, som alle er motiveret a f stikprøveanalogprincippet. Dette princip, som vi omtalte i kapitel 10 og 11, siger kort fortalt,
at man tager definitionen af et beskrivende mål og erstatter ukendte
værdier med skøn fra stikprøven.
I afsnit 12.1 kigger vi på en estimator for variansen, og i afsnit 12.2
udvider vi dette til momenter mere generelt. Estimation a f beskrivende
mål for sammenhænge mellem to stokastiske variabler er emnet i afsnit
12.3. Inden vi i afsnit 12.5 behandler estimatorer for fraktiler, gennem­
går vi i afsnit 12.4, hvordan man kan estimere hele fordelingen af et
karakteristikum.
12.1
Estimator for variansen
I dette afsnit præsenterer vi en estimator for variansen af en fordeling.
Da estimatoren er udledt på samme måde som stikprøvegennemsnittet,
starter vi med at opsummere idéen bag stikprøvegennemsnittet.
I kapitel 10 viste vi, at man kan anvende stikprøvegennemsnittet,
som en estimator for middelværdien, μ. Motivationen for denne estima­
tor er stikprøveanalogprincippet: Vi udregner estimatoren for middel­
værdien ved hjælp af stikprøven ved at udskifte ukendte størrelser med
skøn i udtrykket for middelværdien for en diskret stokastisk variabel.
Middelværdien for en diskret stokastisk variabel, X, er:
hvor man summerer over alle de værdier, x i, som X kan antage, og væg­
ter dem med deres sandsynligheder, f X(x i) . Når vi anvender stikprøven,
summerer vi over alle elementer i stikprøven og udskifter sandsynlig­
hedsfunktionen, fX ( x ), med den vægt, som hver observation har i stik­
prøven, nemlig 1/n. Dermed får vi, at stikprøvegennemsnittet er:
Vi går frem på nøjagtig samme måde, når vi skal motivere en estimator
for variansen, σ2. Variansen for en diskret stokastisk variabel, X, er:
Når vi skal udregne en estimator for denne, erstatter vi derfor igen
f X(x )i med vægten 1/n og summerer over alle elementerne i stikprøven.
Desuden erstatter vi den ukendte middelværdi, μ, med stikprøvegen­
nemsnittet,
Man kan vise, at E (b2) = σ 2 · (n – 1)/n. Da E (b2) ≠ σ 2, er b2 ikke en
central estimator for variansen. Eftersom n er en kendt konstant stør­
relse, kan vi korrigere b2 og dermed få en ny estimator, som er central.
Denne estimator kaldes stikprøvevariansen, og den er givet ved:
Det gælder, at E (S 2) = σ 2, og dermed er S 2 en central estimator f o r σ2.
I praksis er der dog ikke stor forskel på b 2 og S 2, når stikprøvestørrel­
sen, n, er stor.
Som estimator for standardafvigelsen, σ, kan man bruge
Denne er dog ikke en central estimator for σ, men den er konsistent.
Eksempel 12.1: Colaforbrug - del 1
I en undersøgelse af unges forbrug a f cola har man udvalgt en simpel
tilfældig stikprøve på 9 personer blandt 10. klasse-eleverne i en kom­
mune og spurgt dem om deres ugentlige forbrug a f ½-liters colaer. Re­
sultatet a f undersøgelsen bliver den realiserede stikprøve:
2 , 3, 1 , 1 , 4, 1 , 4, 6 , 2
Stikprøvegennemsnittet og stikprøvevariansen for stikprøven er:
Derfor bliver stikprøvestandardafvigelsen: S = √ 3.
■
Stikprøvevariansen er en estimator, og den har derfor en fordeling, da
forskellige stikprøver resulterer i forskellige estimater. Det viser sig,
at man lettere kan finde en approksimativ fordeling for den stokastiske
variabel, Y, der er defineret som:
Når vi kender fordelingen for Y, kan vi bruge den på følgende måde til
at finde sandsynligheder for S 2:
Y er approksimativt X2-fordelt (udtales: „chi i anden-fordelt“) med n – 1
frihedsgrader. X2-fordelingen med n – 1 frihedsgrader kommer ud a f en
hel familie a f fordelinger: X2-fordelingen med 1 frihedsgrad, X2-forde­
lingen med 2 frihedsgrader osv. I tabel 4 bagerst i bogen har vi tabuleret
de mest brugte fraktiler for forskellige X2-fordelinger. For at illustrere
X2-fordelingen er tæthedsfunktionen med henholdsvis 4 og 10 friheds-
grader afbildet i figur 12.1. Det ses, at i modsætning til normalforde­
lingen er X2-fordelingen ikke symmetrisk. Det næste eksempel viser,
hvordan man bruger ovenstående resultat.
Figur 12.1:
X2-fordelingen
med henholds­
vis 4 og 10
frihedsgrader
Eksempel 12.2: Præcision af stikprøvevarians
Vi ønsker at vurdere præcisionen af en estimator for variansen. For at
lave dette tankeeksperiment antager vi, at den sande værdi a f variansen
er σ2 = 5.
Antag, at vi har en simpel tilfældig stikprøve med n = 30 observatio­
ner fra denne population. Sandsynligheden for, at vi estimerer en værdi
a f σ2, som er mindre end 6, kan udregnes som:
Det sidste tal få r vi på følgende måde: Den stokastiske variabel Y er
approksimativt X2-fordelt med (n – 1) = 29 frihedsgrader. I tabel 4 med
fraktiler for X2-fordelingen kan man under 29 frihedsgrader finde værdi­
erne 32,5 og 35,1. Da 34,8, som vi fandt ovenfor, ligger tættest på 35,1,
bruger vi sandsynligheden i denne søjle, som er 0,8.
■
Stikprøvevariansen:
Stikprøvestandardafvigelsen :
Egenskaber af stikprøvevariansen ved en simpel tilfældig stik­
prøve:
E ( S 2) = σ 2
12.2
Estimatorer for højere ordens momenter
Ud over middelværdien og variansen undersøger man nogle gange to
andre centrale momenter. Det tredje centrale moment giver et mål for
skævheden a f fordelingen, mens det fjerde centrale moment giver et
indtryk a f fordelingens haler (se afsnit 5.2.5).
Vi kan motivere estimatorer for højere ordens momenter på samme
måde som estimatorerne for middelværdien og variansen. I afsnit 5.2.5
definerede vi det k ’te centrale moment som:
Hvis X er diskret, kan man udregne det k ’te centrale moment som:
Stikprøveanalogprincippet fører frem til følgende estimator for det k’te
centrale moment:
Man kan tilsvarende estimere det k ’te moment, mk = E (X k ), med føl­
gende estimator:
Momenterne afhænger af skaleringen a f variablen. Hvis man fx går fra
kr. til at måle i 1000 kr., ændrer momenterne værdi. Derfor rapporterer
man nogle gange koefficienter, som er normaliseret således, at skalaen
ikke er vigtig. Til skævheden a f fordelingen bruger man skævhedsko­
efficienten givet ved:
Som før er estimatoren motiveret a f stikprøveanalogprincippet:
Den normaliserede koefficient for det fjerde moment er:
Denne koefficient kaldes også for kurtosiskoefficienten. Estimatoren er
igen foranlediget a f stikprøveanalogprincippet:
Man kan bruge skævhedskoefficienten og kurtosiskoefficienten til at
vurdere, om en fordeling ligner en normalfordeling. For en normalfor­
deling er skævhedskoefficienten lig 0, og kurtosiskoefficienten er lig
med 3. Man kan således udregne skævhedskoefficienten og kurtosisko­
efficienten for en stikprøve og undersøge, hvor tæt disse er på henholds­
vis 0 og 3.
Eksempel 12.3. Aktieafkast
Når man undersøger fx det månedlige afkast på aktier, finde man ofte,
at kurtosiskoefficienten er betydeligt højere end 3, hvilket ville have
været værdien, hvis afkastet havde været normalfordelt. En højere
kurtosiskoefficient betyder i praksis, at der er større sandsynlighed for
ekstreme udfald a f afkastet, end hvis afkastet er normalfordelt. I teore­
tiske modeller for afkast og porteføljesammensætning bruger man tit
normalfordelingen til at modellere afkastet. Dermed vil sådanne mo­
deller typisk undervurdere sandsynligheden for ekstreme afkast, hvilket
selvfølgelig er problematisk, måske især når man oplever et ekstremt
negativt afkast.
■
12.3
Estimatorer for kovarians og korrelationskoeffcient
I kapitel 5 præsenterede vi kovariansen og korrelationskoefficienten
som beskrivende mål for sammenhængen mellem to stokastiske varia­
bler. I dette afsnit bruger vi igen stikprøveanalogprincippet til at udlede
estimatorer for disse mål.
Kovariansen mellem to stokastiske variabler, X og Y, er:
Cov(X , Y ) = E ((X – µX) · (Y – μ Y))
For to diskrete stokastiske variabler, X og Y, udregner man kovariansen
som (se afsnit 5.5.2):
Ifølge stikprøveanalogprincippet kan man udskifte x i og y j med obser­
vationerne, X i og Yi, sandsynligheden f (x i,y j ) med 1/n og middelværdi­
erne med stikprøvegennemsnittene. Dermed får man følgende estima­
tor for kovariansen:
Denne estimator kaldes også for stikprøvekovariansen.
Vi bruger ofte korrelationskoefficienten, ρ (X , Y) , til at vurdere styr­
ken a f en sammenhæng mellem X og Y. Korrelationskoefficienten er (se
afsnit 5.5.3):
Da vi ovenfor har set på estimatorer for hver af de størrelser, som indgår
i udtrykket for korrelationen, kan vi blot substituere disse estimatorer
ind i udtrykket og dermed få en estimator for korrelationskoefficienten:
Denne estimator kaldes også stikprøvekorrelationskoefficienten.
For at vurdere kvaliteten a f estimatoren for korrelationskoefffienten
er det nødvendigt at kende dens fordeling. Som ovenfor kan vi kun fin­
de en approksimativ fordeling, som er god, når stikprøvestørrelsen er
stor. En approksimativ fordeling er:
Den approksimative varians af er således
Det ses, at hvis den sande værdi af p er tæt på 1, er variansen a f estima­
toren mindre, end hvis den sande værdi a f p er tæt på 0.
12.4
Estimator for en fordeling
Et skøn på fordelingen a f et karakterisikum kan også være interessant.
Fordelingen a f et karakteristikum er beskrevet ved fordelingsfunktio­
nen, f X(x ) . Man kan også beskrive fordelingen med den kumulative
fordelingsfunktion, F X(x ) . Vi fokuserer her på den kumulative forde­
lingsfunktion, fordi den altid eksisterer, uanset om X er diskret eller
kontinuert.
Baseret på stikprøven kan vi få et skøn på den kumulative forde­
lingsfunktion, FX(x ) . Antag, at vi har en simpel tilfældig stikprøve,
(X 1 ...,Xn), a f det karakteristikum, x, vi vil undersøge. Den kumulati­
ve fordelingsfunktion er defineret som FX(x) = P(X ≤ x ) (se afsnit
4.2.2). Vi vil nu bruge stikprøveanalogprincippet. Sandsynligheden for
at få udfald a f X, som er mindre end eller lig med x, svarer i stikprøven
til andelen af observationer, som er mindre end eller lig med x. Dermed
får vi følgende estimator,
for den kumulative fordelingsfunkti­
on, FX (x), som kaldes den empiriske fordelingsfunktion:
Empirisk fordelingsfunktion:
Eksempel 12.4: Colaforbrug – del 2
I eksempel 12.1 var den realiserede stikprøve:
2 , 3, 1 , 1 , 4, 1 , 4, 6 , 2
Estimatet a f den empiriske fordelingsfunktion er da:
Den empiriske fordelingsfunktion er illustreret i figur 12.2:
Figur 12.2:
Empirisk for­
delingsfunktion
og stikprøve­
median
■
Man kan finde egenskaber for den empiriske fordelingsfunktion, lige­
som vi fandt egenskaber for stikprøvegennemsnittet. Dette er vigtigt for
at vurdere kvaliteten a f estimatet. Den empiriske fordelingsfunktion er
en central og konsistent estimator for den kumulative fordelingsfunkti­
on. Med brug a f den centrale grænseværdisætning kan man også vise, at
den empiriske fordelingsfunktion for en bestemt værdi a f x er normal­
fordelt. Den næste boks opsummerer disse egenskaber.
Egenskaber for empirisk fordelingsfunktion. Ved en simpel
tilfældig stikprøve er:
Det ses, at jo større stikprøven er (større n), desto mindre er variansen,
og dermed får man en højere præcision.
Eksempel 12.5. Selvangivelser
I en skatteregion er man interesseret i at undersøge, hvor lang tid bor­
gerne bruger på at udfylde den almindelige selvangivelse. Lad X angive
tiden (målt i timer), det tager at udfylde selvangivelsen. Dermed er den
kumulative fordelingsfunktion, FX(x ), den andel a f populationen, som
bruger højst x timer.
For at vurdere kvaliteten a f den kommende undersøgelse opstil­
ler man forskellige scenarier. Ét scenarium er at vurdere kvaliteten af
en undersøgelse, hvor man udtager en simpel tilfældig stikprøve med
n = 100 observationer. Hvis det virkelig forholder sig således, at 60 %
af borgerne højst bruger en time på at udfylde selvangivelsen, ønsker
skatteregionen at vide, med hvilken sandsynlighed undersøgelsen vil
finde et estimat, som højst er 5 procentpoint fra sandheden.
Vi kan udregne denne sandsynlighed ved brug a f den approksimati­
ve fordeling. Man ønsker at finde
Dette kan
omskrives til:
Da scenariet forudsætter, at FX(1) = 0,6, kan man med standardisering
finde, at:
hvor Z ~ AN (0, 1) ifølge punkt 3 i boksen ovenfor. Tilsvarende kan man
finde, at:
Dermed får vi, at:
Konklusionen er, at med en sandsynlighed på lidt over 0,69 vil under­
søgelsen resultere i et estimat, som ligger mellem 55 og 65 %, der højst
bruger en time på at udfylde selvangivelsen.
■
12.5
Estimatorer for fraktiler
Den anden type a f meget anvendte beskrivende mål for en fordeling er
fraktiler. En p -fraktil er en værdi, således at sandsynligheden for at få
et udfald mindre end p -fraktilen højst er p, mens sandsynligheden for
at få et udfald højere end p -fraktilen højst er ( 1 – p ). Definitionen af en
p -fraktil for en fordeling blev givet i afsnit 5.3. For at bruge definitionen
a f en p -fraktil skal man kende den kumulative sandsynlighedsfunktion,
FX(x ) . Da denne er ukendt, kan man i praksis bruge den empiriske for­
som vi i afsnit 12.4 viste er et skøn på FX ( x ),
delingsfunktion,
til at skønne på værdien a f en p -fraktil.
Lad os starte med at illustrere tankegangen i forbindelse med den
mest anvendte fraktil: Medianen. Stikprøveanalogprincippet fortæller
os, at vi skal gøre det samme med stikprøven, som vi ville gøre med en
diskret stokastisk variabel. Her ville vi finde medianen som den vær­
di, q0,5, hvor grafen for den kumulative sandsynlighedsfunktion, FX(x),
rammer (eller springer over) linjen 0,5. Da grafen for FX(x) er en trap-
pefunktion, som illustreret i figur 5.4, kan den enten springe over linjen
0,5 i ét punkt eller være lig med 0,5 over et helt trin. I det sidste tilfælde
vælges medianen ofte som værdien a f x ud for midten a f trinnet, selvom
alle værdier ud for dette trin i princippet er medianværdier.
For at finde stikprøvemedianen erstatter vi den ukendte kumulative
sandsynlighedsfunktion, F X(x), med den empiriske fordelingsfunktion,
som vi præsenterede i afsnit 12.4. Vi kan da finde stikprøveme­
dianen og andre stikprøvefraktiler ved hjælp af
på præcis samme
måde, som vi finder medianen og andre fraktiler ved hjælp a f F X(x).
Hvis stikprøven består a f et ulige antal elementer, vil grafen for
springe over linjen 0,5 ved præcis den midterste observation i
stikprøven. Denne er derfor stikprøvemedianen. H v is der derimod er
et lige antal observationer i stikprøven, vil
være lig med 0,5
for alle værdier mellem de to midterste værdier i stikprøven. Vi bruger
derfor gennemsnittet a f disse som vores stikprøvemedian. Eksempel
12.6 illustrerer dette.
Eksempel 12.6: Colaforbrug – del 3
For stikprøven i eksempel 12.1 var den empiriske fordelingsfunktion:
Denne blev illustreret i figur 12.2. I dette tilfælde ses stikprøvemedia­
nen at være lig med 2.
Hvis der havde været en ekstra observation i stikprøven med fx vær­
dien 6, ville den empiriske fordelingsfunktion i stedet have haft følgen­
de udseende:
Figur 12.3:
Empirisk for­
delingsfunktion
og stikprøve­
median
Denne er illustreret i figur 12.3. Her er stikprøvemedianen lig med 2,5.
■
Der er en anden metode til at estimere en p -fraktil, som giver samme
resultat. I kapitel 2.3.2 definerede vi e n p -fraktil for en virkelig popula­
tion. I denne definition sorterede vi værdierne a f et karakterisikum efter
deres størrelser. Den værdi, som skiller de største og mindste værdier
i to lige store grupper, er medianen. Vi kan gøre noget tilsvarende for
stikprøven. Til brug for dette definerer vi først en ordensstatistik.
Den k ’te ordensstatistik er den k 'te mindste observation i stik­
prøven. Den skrives som X (k)
Den første ordensstatistik er den mindste observation i stikprøven, og
den n'te ordensstatistik er den største observation i stikprøven.
Eksempel 12.7: Ordensstatistikker
Antag, at den realiserede stikprøve er: (3 , 8 , 5 , 9 , 5 , 1). Så er de realiserede
ordensstatistikker x(1) = 1, x(2) = 3, x(3) = 5, x(4) = 5, x(5) = 8, x(6) = 9.
Bemærk, at flere ordensstatistikker kan antage den samme værdi.
■
Vi kan bestemme stikprøvefraktiler ved hjælp a f ordensstatistikker.
Boksen nedenfor giver formlerne. Det efterfølgende eksempel illustre­
rer udregningerne.
Estimatorer for fraktiler vha. ordensstatistikker. Ved en sim­
pel tilfældig stikprøve er en estimator,
for e n p -fraktil:
hvor [n · p + 1] er heltalsværdien a f n · p + 1 .
Estimatoren,
for medianen er således:
Som boksen viser, er det derfor ikke nødvendigt at finde
finde en estimator for en p -fraktil.
for at
Eksempel 12.8: Colaforbrug – del 4
I stikprøven på 9 observationer fra de foregående eksempler er den sor­
terede stikprøve:
1 , 1, 1 , 2, 2 , 3 , 4, 4 , 6
Lad os finde estimatoren for 0,25-fraktilen. Eftersom n · p = 9 · 0,25
= 2,25, er heltalsværdien a f n · p lig med 2. Dermed skal vi bruge ob­
servation nummer [n · p + 1] = [3,25] = 3 i den sorterede stikprøve som
estimator for 0,25-fraktilen, dvs. værdien 1. Tilsvarende er 9 · 0,5 = 4,5,
hvorved estimatoren for medianen bliver den femte (den midterste) ob­
servation i den sorterede stikprøve.
■
Man kan udlede en approksimativ fordeling for estimatoren for en
p -fraktil. Resultatet gælder kun for 0 < p < 1, og hvis X er kontinuert.
Hvis f X(x ) er tæthedsfunktionen for X, så er:
Det ses, at variansen generelt er størst, når man vil estimere medianen,
hvor p = 0,5.
12.6
Opgaver
1. Repetitionsspørgsmål:
a) Redegør kort for stikprøveanalogprincippet.
b) Hvad er stikprøvevariansen, og hvad er den en estimator for?
c) Hvad er egenskaberne ved stikprøvevarianten?
d) Hvordan estimerer vi højere ordens momenter?
e) Hvordan estimerer vi kovariansen og korrelationskoefficienten?
f) Forklar hvordan vi finder den empiriske fordelingsfunktion
g) Hvordan kan vi bruge den empiriske fordelingsfunktion til at
estimere fraktiler?
2. Kontrolafdelingen på en sodavandsfabrik udtager en simpel tilfæl­
dig stikprøve på 18 flasker og måler indholdet a f disse i centiliter. De
får følgende resultater:
24,82
25,12
25,15
25,09
24,98
25,03
25,23
25,11
25,38
25,19
24,87
25,04
24,89
24,96
25,03
25,10
25,03
24,94
a) Afbild stikprøven i et histogram med intervalbredde 0,1 cl.
b) Beregn stikprøvegennemsnittet.
c) Bestem også stikprøvevariansen.
d) Beregn stikprøvemedianen og sammenlign med stikprøvegen­
nemsnittet. Er der forskel?
e) Beregn også stikprøvekvartilerne.
3. Et dagblad har afholdt en afstemning om holdningen til et forbud
mod rygning på danske uddannelsesinstitutioner. 634 personer del­
tog i undersøgelsen, der blev foretaget som en afstemning over in­
ternettet. 429 svarede, at de var for, mens resten var imod.
a) Hvad er den relevante population i dette eksempel?
b) Hvilken type population er der tale om? (Hint: se afsnit 6 .1)
c) Diskutér, hvad der skal til, for at vi med rimelighed kan betragte
de deltagende som en simpel tilfældig stikprøve fra denne popu­
lation.
d) Hvad bliver stikprøveestimatet på andelen af modstandere af
rygning i populationen?
4. I en forestående undersøgelse vil man undersøge korrelationen mel­
lem to stokastiske variabler, X og Y. Antag, at man har en simpel
tilfældig stikprøve med n = 20 observationer. Man ønsker at finde
sandsynligheden for at estimere en korrelationskoefficient mellem
-0,10 og 0 ,10, hvis den sande værdi a f korrelationskoefficienten er 0.
a) Beregn ovenstående sandsynlighed ved hjælp a f den approksi­
mative fordeling for estimatoren a f korrelationskoefficienten gi­
vet i afsnit 12.3.
b) Man har undersøgt andre approksimationer til fordelingen af
estimatoren for korrelationskoefficienten. En a f disse er baseret
på følgende resultat:
Denne skulle give en bedre approksimation end approksimatio­
nen fra afsnit 12.3, når stikprøvestørrelsen er lille. Beregn oven­
stående sandsynlighed med denne approksimation og sammen­
lign med resultatet fra a).
13
Konfidensintervaller
I kapitel 10-12 så vi, hvordan man kunne konstruere skøn på ukendte
størrelser ved hjælp af en stikprøve. For eksempel bruger man stik­
som et skøn på middelværdien, μ. Da skøn er
prøvegennemsnittet,
baseret på en stikprøve, og forskellige stikprøver kan give forskellige
skøn, er der en naturlig variation, som medfører, at et skøn er behæftet
kun sjældent være lig med μ. Håbet er,
med usikkerhed. Således vil
at er tæt på μ. Sandsynligheden for, at er tæt på μ, kan man vurdere
Idéen med et konfidensinterval er at
ved hjælp af fordelingen for
som på en simpel måde fortæller
medtage aspekter fra fordelingen af
om usikkerheden på skønnet.
er et skøn i form af et enkelt tal, er et konfidensinterval et
Hvor
skøn i form af et interval af tal. Årsagen til at bruge et interval som skøn
er, at man kan konstruere intervallet, således at det også siger noget om
usikkerheden på skønnet. Det er derfor mere informativt. I princippet
da denne indeholder al
kunne man rapportere hele fordelingen af
Det kan imidlertid være svært at
informationen om usikkerheden på
danne sig et overblik over usikkerheden ved at se på fordelingen. Det
var af samme årsag, at vi i kapitel 5 definerede forskellige beskrivende
mål, som gør det lettere at forholde sig til de mest relevante aspekter
af en fordeling. For at konstruere et konfidensinterval for en ukendt
størrelse, fx en middelværdi, finder man den nedre og øvre grænse for
intervallet, således at den ukendte størrelse med en vis sandsynlighed
befinder sig inden for disse grænser.
Vi konstruerer konfi densintervallerne i dette kapitel ved hjælp af re­
sultaterne for skønnene og deres fordelinger, som vi har fundet i kapitel
10- 12. I afsnit 13.1 gennemgår vi konfidensintervaller for en middel­
værdi ved en simpel tilfældig stikprøve. Dette afsnit bruger vi også til
at illustrere den generelle idé bag konfidensintervaller. Tilfældet med
en stratificeret stikprøveudvælgelse behandler vi i afsnit 13.2. I afsnit
13.3 kigger vi på konfidensintervaller for variansen, mens afsnit 13.4
og 13.5 omhandler konfidensintervaller for forskelle mellem henholds­
vis to middelværdier og to varianser. Endelig skal vi i afsnit 13.6 se,
hvordan man kan vælge stikprøvestørrelse baseret på en ønsket bredde
af et konfidensinterval, hvilket svarer til et ønske om en bestemt præci­
sion af et skøn.
13.1
Konfidensinterval for middelværdi ved simpel tilfældig stikprøve
I dette afsnit vil vi vise, hvordan man konstruerer et konfidensinterval
for middelværdien, μ, når stikprøven er simpel tilfældig. Afsnittet tje­
ner samtidig til at illustrere det generelle princip i konstruktionen af
et konfidensinterval. Et konfidensinterval består af en nedre grænse,
Wned, og en øvre grænse, Wop, inden for hvilke den ukendte størrelse, vi
undersøger, ligger med en vis sandsynlighed. Vi skal altså konstruere
et interval, Î = [Wned; Wop]. Spørgsmålet er, hvordan man skal vælge
grænserne Wned og Wop. Vi besvarer spørgsmålet i dette afsnit i tilfældet
med et konfidensinterval for middelværdien.
Vi ved, at stikprøvegennemsnittet,
er et centralt skøn på middel­
værdien, μ. Det er derfor oplagt at tage udgangspunkt i
når vi skal
konstruere intervallet. Da den approksimative fordeling af er en nor­
malfordeling, som er symmetrisk, vil vi også gøre konfidensintervallet
symmetrisk omkring
Det kan man skrive på følgende vis:
hvor k er et positivt tal. Fordi
er stokastisk (skønnet er usikkert), vil
konfidensintervallet ikke altid indeholde den sande middelværdi, μ. Det
afhænger af, hvor meget
rammer forbi μ. Ved hjælp af fordelingen
for
kan vi udregne sandsynligheden for, at intervallet vil indeholde
μ. Næste eksempel viser hvordan.
Eksempel 13.1: Et konfidensinterval
Antag, at vi har udtrukket en simpel tilfældig stikprøve med 10 normal­
fordelte observationer med ukendt middelværdi, μ , og kendt varians,
σ2= 16.1 dette specielle tilfælde ved vi fra kapitel 10, at stikprøvegennem­
snittet,
er eksakt normalfordelt:
Vi konstruerer nu følgende konfidensinterval for middelværdien, μ, ved
at vælge k= 1:
Vi kan udregne sandsynligheden for at få en værdi af
indeholder μ :
så intervallet
hvor „∈“ betyder „tilhører“. Denne sandsynlighed kan omskrives til:
til at be­
er normalfordelt,
Vi kan nu benytte, at
stemme denne sandsynlighed ved hj ælp af regnereglerne for normalfor­
delingen i afsnit 6.5:
= 0,79 – 0 ,21 = 0,58
Konfidensintervallet vil altså med 58 % sandsynlighed indeholde den
ukendte middelværdi, μ. Intervallet kaldes derfor et 0,58-konfidensin­
terval.
■
I eksempel 13.1 startede vi med at fastlægge konfidensintervallet som
stikprøvegennemsnittet plus/minus én:
Vi udregnede derefter sandsynligheden for at få en værdi af stikprøve­
indeholder middelvær­
så intervallet,
gennemsnit,
dien, μ. Det er i denne forbindelse vigtigt at huske på, at det er interval­
let, der er stokastisk, hvorimod middelværdien, μ, ligger fast – den er
blot ukendt.
Modsat eksempel 13.1 fastsætter man som regel sandsynligheden
for konfidensintervallet på forhånd og udregner i stedet den nedre og
den øvre grænse, som er nødvendige for at opnå denne sandsynlighed.
Derfor: Hvis vi ønsker, at konfidensintervallet skal indeholde den sande
middelværdi, μ, med sandsynligheden 1 – α, skal vi finde den konstant,
k, som løser:
Med andre ord skal vi bestemme k, så sandsynligheden for, at den sto­
kastiske variabel
antager en værdi mellem μ – k og μ + k, er 1 – α.
Man kalder 1 – α for konfidensniveauet.
13.1.1
Det generelle tilfælde med simpel tilfældig stikprøve
For at kunne beregne k skal vi kende fordelingen af
Det gør vi kun i
specielle tilfælde som i eksempel 13.1, hvor observationerne i stikprø­
ven er normalfordelte. Vi ved imidlertid fra den centrale grænseværdi­
sætning, at er approksimativt normalfordelt, når stikprøvestørrelsen,
n, er tilpas stor:
Dermed er det standardiserede gen­
nemsnit approksimativt standardnormalfordelt:
Dette kan vi udnytte i jagten efter k ved at omskrive den ovenstående
sandsynlighed til et udtryk for Z :
Vi har nu fået omskrevet vores konfidensinterval til et udtryk for den
stokastiske variabel Z, hvor vi kan benytte, at den approksimative for­
deling for Z er kendt.
Vi skal da finde den værdi af a, hvor:
Lad a =
1 – α = Ρ ( –α ≤ Z ≤ α)
Da Z ~AN (0, 1), er løsningen at sætte a lig med ( 1 – α/2)-fraktilen for
standardnormalfordelingen og –a lig med (α/2)-fraktilen: a = Z 1–α/2 og
– a = Zα/2 = –Z 1–α/2. At dette er løsningen kan ses ved at indsætte:
P (–a ≤ Z ≤ a ) =A Φ ( a) – Φ ( – a ) = Φ ( Ζ1–α/2) – Φ ( Ζα/2)
= 1 – α /2 – α /2 = 1 – α
hvor =Aindikerer, at resultatet kun er approksimativt, fordi Z er approk­
simativt normalfordelt.
Figur 13.1:
Zα/2
ogZ1–α/2
Efter at have fastlagt a = Z1_α/2 kan vi løse for k :
Indsætter vi dette udtryk i
densintervallet:
bliver ( 1 – α)-konfi-
Dette konfidensinterval kan man imidlertid kun bruge, hvis man kender
variansen, σ2. I praksis er variansen ikke kendt, men man kan estimere
den med stikprøvevariansen, S 2.1 det generelle tilfælde har vi derfor, at
man kan approksimere (1 – α)-konfi densintervallet for middelværdien
med følgende interval:
Konfidensinterval for m iddelværdi – det generelle tilfælde:
Med en simpel tilfældig stikprøve, (X 1, . . . X n), hvor E ( X i) = μ
og V(Xi) = σ 2, er det approksimative ( 1 – α)-konfi densinterval
for middelværdien, μ :
hvor Z 1–α/2 er ( 1 – α/2)-fraktilen fra standardnormalfordelingen,
og S 2 er estimatoren for σ2. Hvis σ2 er kendt, erstattes S 2 blot med
σ2.
Forskellen mellem konfidensintervallet for middelværdien og stikprø­
vegennemsnittet er, at konfidensintervallet giver information om usik­
kerheden på stikprøvegennemsnittet frem for kun ét tal. Man kalder
også estimatorer, som leder frem til et enkelt tal som estimat, for punkt­
estimatorer, hvorimod konfidensintervallet er en intervalestimator.
Konfidensintervallet er approksimativt, fordi vi ikke har forudsat
noget om fordelingen af observationerne i stikprøven. Der findes en
række specialtilfælde, hvor man kan udnytte information om observa­
tionernes fordeling til at udlede eksakte konfidensintervaller. Nogle af
disse specialtilfælde gennemgås i de følgende underafsnit.
13.1.2
Simpel tilfældig stikprøve af normalfordelte observationer med kendt varians
Hvis stikprøveobservationerne er normalfordelte med kendt varians, σ2,
ved vi, at det standardiserede stikprøvegennemsnit, Z, er eksakt stan­
dardnormalfordelt. Dermed er konfidensintervallet ovenfor også ek­
sakt, da det er fundet på baggrund af fordelingen af Z :
Konfidensinterval for middelværdi – normalfordelte obser­
vationer og kendt varians:
Med en simpel tilfældig stikprøve, (X1,...,Xn), hvor X i ~ Ν(μ,σ2)
og σ2 er kendt, er det eksakte ( 1 – α)-konfidensinterval for mid­
delværdien, μ :
hvor Z 1–α/2 er ( 1 – α/2)-fraktilen fra standardnormalfordelingen.
13.1.3
Simpel tilfældig stikprøve af normalfordelte observationer med ukendt varians
Hvis stikprøveobservationerne er normalfordelte med ukendt varians,
følger en såkaldt t-fordeling med
kan man vise, at
n – 1 frihedsgrader. Man skriver det på følgende måde:
fordelingen med n – 1 frihedsgrader minder en del om normalforde­
lingen. Den har lidt højere sandsynligheder for ekstreme værdier. Gra­
fen for tæthedsfunktionen har derfor „tykkere haler“. Faktisk er t-for­
delingen en hel familie af fordelinger: t-fordelingen med 1 frihedsgrad,
t-fordelingen med 2 frihedsgrader osv. Jo større antallet af frihedsgra­
der bliver, desto tættere kommer t-fordelingen på standardnormalforde­
lingen, som det også fremgår af figur 13.2.
Figur 13.2:
Standard­
normal­
fordelingen og
to t-fordelinger
Fordi sandsynlighederne afhænger af antallet af frihedsgrader, er det
for omfangsrigt at tabulere alle de kumulative sandsynligheder i den­
ne bog. I stedet indeholder tabel 3 de vigtigste fraktiler for en ræk­
ke forskellige frihedsgrader. For eksempel er 0,975-fraktilen i en
t-fordeling med 15 frihedsgrader 2,13. Dermed er 0,025-fraktilen
i en t-fordeling med 15 frihedsgrader lig -2,13, fordi alle t-fordelin­
ger er symmetriske omkring 0. Hvis antallet af frihedsgrader over­
stiger 50, anvendes fraktilerne fra standardnormalfordelingen, da
t-fordelingen med mange frihedsgrader næsten er identisk med stan­
dardnormalfordelingen.
Vi kan nu opskrive det eksakte konfidensinterval i dette tilfælde. Det
ligner tilfældet ovenfor, blot er Z 1–α/2 erstattet med ( 1 – α/2)-fraktilen fra
t-fordelingen med n – 1 frihedsgrader: t1–α/2 (n – 1) :
Konfidensinterval for m iddelværdi – norm alfordelte ele­
menter og ukendt varians:
Ved en simpel tilfældig stikprøve, (X 1,...,X n), hvor X i ~ Ν (μ ,σ 2)
og σ2er ukendt, er det eksakte (1 – α)-konfi densinterval for mid­
delværdien, μ :
hvor t1–α/2(n – 1) er ( 1 – α/2)-fraktilen fra t-fordelingen med
n – 1 frihedsgrader, og S 2 er estimatoren for σ2.
Selvom dette resultat adskiller sig fra det generelle tilfælde i afsnit
13.1.1, betyder det ikke, at resultatet i afsnit 13.1.1 er forkert. Årsa­
gen til forskellen er, at resultatet i 13.1.1 kun er approksimativt, mens
ovenstående resultat er eksakt. Når n er stor, ligner t-fordelingen nemlig
standardnormalfordelingen, og dermed forsvinder forskellen mellem de
to konfidensintervaller.
Eksempel 13.2: Mælk i daginstitutioner – del 1
Til at bestemme den forventede ugentlige efterspørgsel efter mælk
i en dansk daginstitution udspørges 31 børnehaver om deres indkøb
af mælk i den seneste uge. Stikprøvegennemsnittet viser sig at være
= 117,43 liter og stikprøvevariansen S 2 = 125,21. Man antager, at
man har en simpel tilfældig stikprøve med normalfordelte observado-
ner. Dermed er det eksakte 0,95-konfidensinterval (α = 0,05) for den
forventede efterspørgsel (middelværdien) givet ved:
= [117,43– 4,06 ; 117,43 + 4,06]
= [113,37 ; 121,49]
idet vi anvender 97,5 %-fraktilen fra t-fordelingen med 31 – 1 = 30
frihedsgrader, som er 2,02. Er man derimod i tvivl om, hvorvidt obser­
vationerne er normalfordelte, kan man i stedet anvende den approksi­
mative formel fra afsnit 13.1.1. Man skal da anvende standardnormal­
fordelingen i stedet for t-fordelingen. I standardnormalfordelingen er
97,5 %-fraktilen lig med 1,96:
= [117,43 – 3,94 ; 117,43 + 3,94]
= [113,49; 121,37]
Dette resultat er kun approksimativt, men til gengæld behøver man ikke
fæste lid til, at observationerne er normalfordelte. Det ses dog, at for­
skellen er relativt lille.
■
1 3.1 .4
Simpel tilfældig stikprøve af Bernoullifordelte observationer: konfidensinterval
for andel
For nogle fordelinger kan man skrive variansen som en funktion af mid­
delværdien. Dette er tilfældet for en Bernoullifordelt stokastisk variabel,
X ~ Ber(p ), hvor p er sandsynligheden for, at X = 1. Som vi viste i
kapitel 6.1, er E ( X ) = μ = p og V ( X ) = p · (1 – p ) . Det gør, at
man kan bruge estimatoren for middelværdien til at estimere variansen
i stedet for at estimere variansen med stikprøvevariansen. Det har nem­
lig vist sig, at man typisk får en mere præcis estimator af variansen på
denne måde, fordi man bruger mere information om fordelingen, end
hvis man anvender stikprøvevariansen.
Når observationerne er Bernoullifordelte, bruger man
som estimator for variansen i stedet for S2, hvor
er stikprøvegen­
nemsnittet, dvs. skønnet på den ukendte sandsynlighed eller andel, p.
Dermed er konfidensintervallet for middelværdien, som også er lig med
andelen p, givet ved:
Konfidensinterval for andel – Bernoullifordelte observationer:
Med en simpel tilfældig stikprøve, (Χ 1,..,Χ n), hvor X i~ Ber(p)
er det approksimative ( 1 – α)-konfi densinterval for middelvær­
dien (andelen), p :
hvor Z 1–α/2 er ( 1 – α/2)-fraktilen fra standardnormalfordelingen,
er stikprøvegennemsmttet.
og
Eksempel 13.3: En supermarkedskæde – del 1
En supermarkedskæde ønsker at opstille et 0,95-konfidensinterval for
den ukendte andel af befolkningen i en region, der handler hos dem. Ud
af en simpel tilfældig stikprøve på 400 personer handlede 116 hos kæ­
Det approksimative konfidensinterval
den, dvs.
er dermed:
= [0,29– 0 ,044 ; 0,29 + 0,044]
= [0,246 ; 0,334]
idet Z1–α/2 = Z1–0,05/2=Z0,975 = 1,96.
1 3 .1.5
Konfidensintervaller for middelværdi ved simpel tilfældig stikprøve – en oversigt
Tabellen nedenfor opsummerer det generelle tilfælde fra afsnit 13.1.1
samt specialtilfældene fra afsnit 13.1.2 til 13.1.4:
Tabel 13.1: Konfidensintervaller for middelværdi ved simpel tilfældig stikprøve
Det generelle tilfælde: Stor stikprøvestørrelse (afsnit 13.1.1)
σ2 kendt:
σ2 ukendt:
Normalfordelte elementer (afsnit 13.1.2 og 13.1.3)
σ2kendt:
ukendt:
Konfidensinterval for en andel: X i ~ Ber(p ) og stor stikprøvestørrelse (afsnit 13.1.4)
σ2ukendt:*
N o ter :
1 . Z1–α/2 er (1 – α/2)-fraktilen fra standardnormalfordelingen.
2. t 1 _α/2 (n – 1) er (1 α/2)-fraktilen fra t-fordelingen med n – 1 frihedsgraden.
3. 1 – α er konfi densniveauet.
*Hvis σ2er kendt i dette tilfælde, vil p også være kendt.
13.2
Konfidensinterval for middelværdi ved stratificeret udvælgelse
I kapitel 11 gennemgik vi stratificeret udvælgelse. Idéen er, at man ved
at opdele den virkelige population i m homogene strata og derefter ud­
vælge simpelt tilfældigt fra hvert af de m strata kan opnå et mere præ­
cist estimat på den ukendte middelværdi, μ, end med en simpel tilfældig
stikprøve af samme størrelse. Til at udregne konfidensintervallet for μ i
dette tilfælde skal man anvende det stratificerede stikprøvegennemsnit
samt variansen af dette, som vi fandt i kapitel 11.
Det stratificerede stikprøvegennemsnit er:
hvor w j er andelen af stratum j i hele populationen, og
gennemsnittet for stratum j:
er stikprøve­
hvor n j er stikprøvestørrelsen fra stratum j. Variansen af det stratificere­
er:
de gennemsnit,
typisk er ukendt, kan vi estimere
hvor σ 2 er variansen i stratum j. Da
med stikprøvevariansen,
variansen af
ved at erstatte
hvor stikprøvevariansen for stratum j er:
Til at opstille et konfidensinterval for den ukendte middelværdi, μ, ud­
er approksimativt normalfordelt med
nyttes det, at estimatoren,
når stikprøvestørrelsen er stor. Derfor
middelværdi μ og varians
få r konfidensintervallet også nøjagtig det samme udseende som tidli­
gere:
K onfidensinterval for middelværdi – stratificeret udvælgelse:
Ved stratificeret stikprøveudvælgelse fra en population opdelt i
m strata er det approksimative (1 – α)-konfi densinterval for mid­
delværdien, μ :
hvor Z 1–α/2 er ( 1 – α/2)-fraktilen fra standardnormal fordel ingen.
er det stratificerede stikprøvegennemsnit med estimeret
og
varians:
hvor
er stikprøvegennemsnittet i stratum j med stikprøvestør­
relse nj, og wj = N j /N pop er andelen af stratum j i populationen.
Hvis stratumvarianserne er kendte, erstattes
blot med
Eksempel 13.4: Markedsføring i butikker
Producenten fra eksempel 11.1 –11.3 opdelte populationen i to strata (bu­
tikker i Jylland og butikker på Øerne), som indeholdt henholdsvis 160
og 240 elementer. Han har nu udtrukket en stikprøve på 8 observationer
fra Jylland og 12 observationer fra Øerne. Resultatet blev følgende:
= 1,5
= 1,73
= 1,1
= 1,32
Det stratificerede stikprøvegennemsnit er:
Hvis udvælgelsen fra de enkelte strata er simpel tilfældig, er den esti­
merede varians:
og dermed er 0,95-konfidensintervallet givet ved:
■
hvis udvælgelsen fra de
Som vi så i kapitel 11, ændres variansen af
enkelte strata foregår uden tilbagelægning. I så fald skal man i ovenstå­
ende boks i stedet anvende følgende udtryk for den estimerede varians
af
13.3
Konfidensinterval for varians
Man kan også konstruere et konfidensinterval for en ukendt varians,
σ2. Udledningen af konfidensintervallet følger samme mønster som for
middelværdierne ovenfor. Vi skal finde et interval:
Î = [ Wned; Wop]
hvor Wned er den nedre grænse, og Wop er den øvre grænse.
Som ved middelværdien tager konstruktionen af konfidensinterval­
let udgangspunkt i skønnet på den ukendte størrelse (her variansen)
samt fordelingen af dette skøn. Skønnet er stikprøvevariansen, S2. En
væsentlig forskel mellem en middelværdi og en varians er imidlertid,
at en varians aldrig kan være negativ. Derfor vil vi ikke som ved mid­
delværdien lave et symmetrisk konfidensinterval omkring skønnet, S 2,
fordi vi da vil kunne risikere, at konfidensintervallet inkluderer nega­
tive værdier, som vi på forhånd ved, at variansen, σ2, ikke kan antage.
Til at finde den nedre og den øvre grænse kan vi bruge resultatet fra
kapitel 12 om den approksimative fordeling af stikprøvevariansen, S 2.
Resultatet var, at:
er approksimativt χ2-fordelt med n – 1 frihedsgrader. χ2-fordelingen er
også beskrevet i kapitel 12. Vi udnytter ovenstående udtryk til at opstil­
le et konfidensinterval for den ukendte varians, σ2. Hvis
og
er henholdsvis α/2- og 1 – α/2 -fraktilen fra χ2-fordelingen
med n – 1 frihedsgrader, så ved vi, at der må være (approksimativt)
sandsynligheden 1 – α for at få en værdi af (n – 1) · S 2/ σ 2, der ligger
mellem
Bemærk, hvordan dette nøjagtigt svarer til fremgangsmåden i afsnit
13.1.1, hvor vi også startede med at få udtrykt konfidensintervallet som
et interval for den stokastiske variabel, Z, hvis approksimative fordeling
vi kendte. Nu har vi tilsvarende et interval for størrelsen, (n – 1) · S 2/σ2,
hvis approksimative fordeling vi kender. Vi mangler da blot at omskrive
dette til et interval for den ukendte varians, σ2. Dette sker på følgende
måde:
Dette udtryk giver henholdsvis en nedre og en øvre grænse for et ap­
proksimativt (1 – α)-konfi densinterval for variansen. Bemærk, at i det
tilfælde, hvor observationerne i stikprøven er normalfordelte, er konfi­
densintervallet eksakt. Resultaterne er opsummeret i boksen nedenfor.
Konfidensinterval for varians:
Med en simpel tilfældig stikprøve, (Χ 1,...,Χ n) hvor E (X i) = μ
og V(Xi) = σ2, er det approksimative ( 1 – α)-konfidensinterval
for variansen, σ2:
er
hvor S 2 er estimatoren for σ2, og
og
henholdsvis α/2- og ( 1 – α/2)-fraktilen fra χ2-fordelingen med
n – 1 frihedsgrader.
Hvis observationerne er normalfordelte, X i ~ Ν ( μ , σ 2), er
konfidensintervallet eksakt.
Konfidensintervallet er ikke symmetrisk om S 2, fordi χ2-fordelingen
ikke er symmetrisk. Dette er i tråd med, at vi ikke ønsker negative vær­
dier inkluderet i konfidensintervallet, fordi vi på forhånd kan udelukke
en negativ varians.
Eksempel 13.5: En aktieanalytiker
En aktieanalytiker ønsker at opstille et konfidensinterval for variansen
på aktieudbytter fra virksomheder i servicebranchen og har derfor ud­
trukket en simpel tilfældig stikprøve på 51 aktieudbytter. Han har be­
regnet værdien af variansestimatoren til: S2 = 59,6. Et approksimativt
0,95-konfidensinterval for den ukendte varians bliver dermed:
idet 2,5 %-fraktilen og 97,5 %-fraktilen fra χ2-fordelingen med 50 fri­
hedsgrader er henholdsvis 32,4 og 71,4.
■
13.4
Konfidensinterval for forskel mellem to middelværdier
Man er nogle gange interesseret i at undersøge forskellen mellem to
forskellige grupper i en population. For eksempel kan man være in­
teresseret i at undersøge forskellen i middeluddannelseslængden for
henholdsvis kvinder og mænd. I dette afsnit betragter vi konfidensinter­
valler for forskellen mellem to middelværdier, μ1 og μ2, for to grupper
i en population.
13.4.1
Det generelle tilfælde
Som i de øvrige tilfælde i dette kapitel tager konstruktionen af konfi­
densintervallet udgangspunkt i et skøn på den ukendte størrelse. Den
ukendte størrelse er her μ 1– μ2, hvor μ 1er middelværdien af en fordeling
(en gruppe i populationen), og μ2 er middelværdien af en anden fordel­
ing (en anden gruppe i populationen). Vi antager, at vi har en simpel til­
fældig stikprøve fra hver fordeling, samt at de to stikprøver er uafhæn­
gige af hinanden: (X 1,1,...,X1,n1) og (X2,1,...,X2,n2) hvor E ( X 1,i) = μ 1
V ( X1,i) = σ 1 2,E(X2,i ) = μ2 og V ( X 2,i) = σ 22. Skønnet på μ 1 – μ2
er
dvs. forskellen mellem stikprøvegennemsnittene fra de to
stikprøver.
Tricket til at konstruere konfidensintervallet er som tidligere at finde
en størrelse, hvis approksimative fordeling vi kender. Vi ved fra den
centrale grænseværdisætning, at både
er approksimativt nor­
og
malfordelte, og idet stikprøverne er uafhængige, er også deres diffe­
rens,
approksimativt normalfordelt med middelværdi:
og varians:
Dermed er den standardiserede størrelse:
approksimativt standardnormalfordelt. Sandsynligheden for at få en
værdi af denne størrelse, der ligger mellem Zα/2 og Z1_α/2, dvs. α/2- og
( 1 – α/2)-fraktilen fra standardnormalfordelingen, er 1 – α.
Figur 13.3:
Zα/2 og Z1–α/2
På grund afsymmetrien i standardnormalfordelingen er Zα/2 = – Z 1–α/2,
og vi kan derfor skrive denne sandsynlighed som:
Dette kan man omskrive til et konfidensinterval for den ukendte forskel,
μ1– μ2 Da varianseme, σ12 og σ22, som regel er ukendte, kan man erstat­
te dem med stikprøvevarianserne, S12 og S22. Resultatet er opsummeret
i boksen.
Konfidensinterval for forskel mellem to m iddelværdier – det generelle til­
fælde:
Med to uafhængige simple tilfældige stikprøver, (X1,1,...,Χ 1,n1) og ( X2,2,...,Χ2,n2)
hvor E (X 1,i ) = μ 1, V ( X 1,i) = σ 12, E ( X 2,i) = μ 2 og V ( X 2,i) = σ 22, er det ap­
proksimative (1 – α )-konfidensinterval for forskellen mellem middelværdierne,
μ 1– μ2, givet ved:
er stik­
hvor Z1–α/2 er ( 1 – α/2)-fraktilen fra standardnormalfordelingen,
prøvegennemsnittene, og S12 og S22 er stikprøvevarianseme. Hvis σ 12 og σ22 er
kendte, erstatter de S12 og S22.
Eksempel 13.6: Efteruddannelse– del 1
En virksomhed har to typer af ansatte i deres produktionsafdeling: an­
satte, der har fået et efteruddannelseskursus, og ansatte, der ikke har.
I forbindelse med ansættelse af nye medarbejdere er virksomheden i
tvivl om, hvorvidt den skal ansætte folk med eller uden efteruddannel­
se. Den hyrer derfor et konsulentfirma til at undersøge, om der er en
gennemsnitlig produktivitetsforskel på de to typer af arbejdere. Kon­
sulentfirmaet har udtrukket to simple tilfældige stikprøver på 30 og 50
observationer blandt personer henholdsvis med og uden efteruddan­
= 22,54 og
nelse. Firmaet beregner de to stikprøvegennemsnit til:
= 19,34 og stikprøvevarianseme til: S 12 = 19,13 og S22 = 22,25.
Et 0,95-konfidensinterval for forskellen mellem de to middelværdier
kan da beregnes til:
idet Z 1–0,05/2 = Z0,975 = 1,96. Det ses, at 0,95-konfidensintervallet ikke
inkluderer 0, hvilket tyder på, at der er forskel på de to typer af ansatte.
■
I det tilfælde, hvor man mener at vide, at de to varianser, σ 12 og σ22, er
ens, kan man opnå et mere præcist estimat på variansen af
ved
at anvende den såkaldte „poolede“ variansestimator. Den er givet som:
Dermed kan man skrive konfidensintervallet:
Eksempel 13.7: Efteruddannelse – del 2
I eksempel 13.6 er den poolede variansestimator:
og konfidensintervallet dermed:
13.4.2
Konfidensinterval for forskel m ellem to middelvæ rdier – en oversigt
Som ved konfidensintervaller for en enkelt middelværdi findes der en
række specialtilfælde, hvor man kan udregne mere præcise konfidens­
intervaller end det approksimative resultat fra afsnit 13.4.1.
Det første tilfælde er, når de to stikprøver består af normalfordelte
observationer med kendt varians. Da kan man vise, at konfidensinter­
vallet fra afsnit 13.4.1 er eksakt og ikke kun approksimativt.
Et andet specialtilfælde opstår, når observationerne er normalfordel­
te med ukendt varians. Man kan da opnå et mere præcist konfidensinter­
val ved at udskifte fraktilen fra standardnormalfordelingen, Z 1_α/2, med
den tilsvarende fraktil fra t-fordelingen med n1 + n2 – 2 frihedsgrader,
t1–α/2 (n1 + n2 – 2).
Det sidste specialtilfælde, vi vil nævne, er, når observationerne i
stikprøverne er Bernoullifordelte. Her beregnes S 12 og S22 som hen­
hvor
er de to stikprø­
holdsvis
vegennemsnit (eller stikprøveandele). Resultaterne for disse specialtil­
fælde er opsummeret i den følgende boks sammen med det generelle
tilfælde fra afsnit 13.4.1.
Eksempel 13.8: Eksamen
En handelsskole ønsker at undersøge, om sandsynligheden for at bestå
en eksamen afhænger af, hvilken lærer der har undervist i faget. Lad
sandsynligheden
være sandsynligheden for at bestå med lærer' 1 og
for at bestå med lærer 2. Handelsskolen udtager nu to simple tilfældi­
ge stikprøver uafhængigt af hinanden på henholdsvis 25 og 36 elever
fra de to læreres eksamener. Den finder, at andelen af de udtagne, der
bestod med den første lærer, var 7/25 = 0,28, mens andelen, der bestod
med den anden, var 14/36 = 0,389. Ved hjælp af formlen fra ovenstå­
ende boks kan vi nu opstille et 0,95-konfi densinterval for forskellen
mellem de sande, men ukendte sandsynligheder,
= [–0,346 ; 0,128]
Bemærk, at intervallet inkluderer værdien 0, så med et konfidensniveau
på 0,95 kan man ikke udelukke, at sandsynligheden for at dumpe ved
de to lærere er lige stor.
■
Tabel 13.2: Konfidensinterval for f orskel mellem to middelværdier, μ1– μ 2, ved to uafhængige simple
tilfældige stikprøver
Det generelle tilfælde: Store stikprøvestørrelser (afsnit 13.4.1)
σ 12 og σ22kendte:
σ12 og σ22 ukendte:
σ12 og σ22 ukendte, men ens:
Normalfordelte observationer:
σ12 og σ22 ukendte:
σ12 og σ22 ukendte, men ens:
Konfidensinterval for forskel mellem to andele: X i ~ Ber(p ) og store stikprøvestørrelser
σ12 og σ22 ukendte:
Noter:
1. Z1–α/2 er (1 – α/2)-fraktilen fra standardnormalfordelingen.
2. t1–α/2 (n1 + n2 – 2) er (1 – α/2)-fraktilen fra t-fordelingen med n1 + n2 – 2 frihedsgrader.
3 . 1 – α er konfidensniveauet.
13.5
Konfidensinterval for forhold mellem to varianser
Den sidste type af konfidensintervaller, vi gennemgår, er for en forskel
mellem to varianser. Som i afsnit 13.4 antager vi, at vi har to uafhængi­
ge simple tilfældige stikprøver: (X 1,1,...,X 1,n1) og (X2,1,...,X2,n2) . Vi vil
dog også antage, at observationerne i de to stikprøver er normalfordel­
te: X 1,1 ~ Ν (μ 1,σ 12) og X2,1 ~ Ν (μ2,σ22) Vi kan da opstille et kon­
fidensinterval for forholdet mellem de to ukendte varianser, σ 22/σ 12,
ved hjælp af skønnene på varianserne, S 12 and S22.
Udgangspunktet for dette konfidensinterval er, at man kan vise, at
størrelsen:
er F-fordelt med (n1 – 1, n2 – 1) frihedsgrader, hvor n1 og n2 er stør­
relserne af de to stikprøver. Som t-fordelingen og χ2-fordelingen er
F-fordelingen en familie af fordelinger. I modsætning til de to andre
fordelinger er F-fordelingen karakteriseret ved to parametre eller to sæt
af frihedsgrader. Vi har illustreret en fordeling i figur 13.4. Endvidere
kan man finde udvalgte fraktiler for F-fordelingen i tabel 5 og 6 bagerst
i bogen.
Figur 13.4:
F -fordelingen
med (5,9)
frihedsgrader
Hvis Fα/2(n1 – 1,n2 – 1) og F1–α/2( n1 – 1,n2 – 1) er henholdsvis α/2
og 1 – α/2-fraktilen fra F-fordelingen med (n1 – 1, n2 – 1) frihedsgra­
der, så er sandsynligheden for at observere en værdi af ovenstående
størrelse mellem disse to værdier lig med 1 – α:
Figur 13.5:
Fα/2(n1 – 1,n2 – 1)
og
F1–α/2(n1–1, n2– 1)
Dette kan man omskrive til et konfidensinterval ved at isolere σ22 /σ12.
Resultatet er opsummeret i boksen:
Konfidensinterval for forhold mellem to varianser:
Med to uafhængige simple tilfældige stikprøver (X1,1,...,X1,n1) og
( X2,1,...,X2,n2), hvor X 1,i ~ Ν ( μ 1,σ 12) og X2, ~ Ν(μ2,σ22)
er det eksakte ( 1 – α)-konfi densinterval for forholdet mellem de
to varianser, σ 2/σ 12
i
hvor Fα/2(n1 – l,n2 – 1) og F1–α/2(n1 – l,n2 – 1) er henholdsvis
α/2- og 1 – α/2-fraktilen fra F-fordelingen med (n1 – l,n2 – 1)
frihedsgrader, og S 21 og S22 er stikprøvevarianserne.
Eksempel 13.9: Efteruddannelse – del 3
Lad os opstille et konfidensinterval for de to varianser fra eksempel
13.7. Stikprøvevarianserne var her S12 = 19,13 og S22 = 22,25. Et
0,95-konfi densinterval får da følgende udseende:
idet 2,5 %-fraktilen og 97,5 %-fraktilen fra F-fordelingen med (29, 49)
frihedsgrader er henholdsvis 0,50 og 1,88.
■
13.6
Valg af stikprøvestørrelse baseret på konfidensintervaller
Stikprøvestørrelsen har direkte indflydelse på en estimators præcision
og dermed på bredden af et konfidensinterval. Hvis man ønsker en vis
præcision af estimatoren og samtidig selv kan beslutte stikprøvestør­
relsen, kan man bruge konfidensintervallet til at fastlægge, hvor stor
stikprøven skal være for at opnå den ønskede præcision. Fx kan man
beregne, hvor stor en stikprøve der er nødvendig, for at 0,95-konfidens­
intervallet (og dermed usikkerheden på skønnet) højst er 2 enheder
bredt. Vi vil i dette afsnit illustrere denne teknik i tilfældet med estima­
tion af en middelværdi.
Konfidensintervallet for en middelværdi med kendt varians fra af­
snit 13.1.1 er:
Hvis vi ønsker, at
Bredden af konfidensintervallet er
intervallet maksimalt skal have bredden 2 · K, skal vi vælge stikprøve­
størrelsen, n, således, at:
hvilket er det samme som:
Den nødvendige stikprøvestørrelse, n*, som sørger for, at vi kan opnå
den ønskede bredde 2 · K af konfidensintervallet, er opskrevet i den
følgende boks:
Konfidensintervalbaseret stikprøvestørrelse for estimation
a f middelværdi:
For at opnå et ( 1 – α)-konfi densinterval for middelværdien med
en maksimal bredde på 2 · K, skal man bruge en stikprøvestør­
relse på mindst:
Det ses, at hvis vi ønsker et smalt konfidensinterval (en lille værdi af K),
kræver det en stor stikprøve, n*. Tilsvarende vil en stor varians, σ2, af
observationerne i stikprøven eller et højt konfi densniveau, 1 – α, kræve
en stor stikprøve.
For at kunne udregne n*. er det imidlertid nødvendigt at kende vari­
ansen, σ2, eller et skøn på denne fra en anden undersøgelse. Derfor laver
man nogle gange en pilotundersøgelse. I en pilotundersøgelse udtræk­
ker man en mindre stikprøve til at skønne på variansen, σ2.
Eksempel 13.10: Mælk i dag-institutioner – del 2
I eksempel 13.2 udtog man en stikprøve på 31 børnehaver og beregnede
stikprøvevariansen til S 2 = 125,21. Det følgende år ønsker man at gen­
tage undersøgelsen og vil anvende det eksisterende estimat på varian­
sen til at bestemme den stikprøvestørrelse, der sikrer, at 0,95-konfiden­
sintervallet får en bredde på 5 (liter), dvs. 2 · K = 5. Hvis vi anvender
97,5 %-fraktilen fra standardnormalfordelingen, som er 1,96, kan n*
beregnes til:16
Der skal altså udtrækkes en stikprøve på 77 børnehaver for at opnå den
ønskede præcision.
■
Hvis stikprøveelementerne er Bernoullifordelte, ved vi, at variansen er
σ2 = p · ( 1 – p), hvor p er den sandsynlighed (eller andel), vi gerne vil
undersøge. Den nødvendige stikprøvestørrelse er her:
hvor p naturligvis er ukendt. Man kan dog vise, at n* er størst, når
p = 0.5. Man er derfor på den sikre side, hvis man vælger:
16 H vis m an som i eksem pel 13.2 antager, at elem enterne i stikprøven e r norm alford elte, burde m an
egentlig anven de 97,5 % -fraktilen fra den relevante t-fordeling. D a denne im idlertid afh æ n g er a f den nu
uken dte n , e r d et lidt besvæ rligt, og vi b ru g er derfo r blot standardnorm alfordelingen.
Eksempel 13.11: En supermarkedskæde – del 2
Supermarkedskæden fra eksempel 13.3 ønsker et 0,95-konfidensinter­
val med maksimal bredde på 0,1. Da skal den vælge en stikprøve af
størrelsen:
Den kan altså spare 15 interviews i forhold til stikprøven fra eksempel
13.3.
■
13.7
Opgaver
1. Repetitionsspørgsmål:
a) Hvad forstår vi ved et konfidensinterval?
b) Forklar kort, hvordan et konfidensinterval for en middelværdi
opstilles.
c) Hvilke forskellige typer af konfidensintervaller anvender vi i for­
bindelse med en middelværdi? Forklar, hvornår de forskellige
konfidensintervaller skal bruges.
d) Hvordan ser konfidensintervallet ud, hvis der er tale om en stra­
tificeret stikprøve?
e) Hvordan opstiller man et konfidensinterval for en varians? Hvil­
ke antagelser ligger til grund for dette?
i) Forklar de forskellige konfidensintervaller, der anvendes for en
forskel på to middelværdier.
g) Hvordan ser et konfidensinterval for forskellen mellem to vari­
anser ud?
h) Forklar, hvordan man kan finde den nødvendige stikprøvestørrel­
se for at opnå en given bredde af et konfidensinterval.
2. Sodavandsfabrikken fra opgave 2 i kapitel 12 ønsker at opstille et
konfidensinterval for middelindholdet af en sodavand baseret på den
udtrukne stikprøve.
a) Opstil et 0,95-konfidensinterval, når det antages, at indholdet i
en tilfældig udvalgt sodavand er normalfordelt med en varians
på 0,02.
b) Opstil et 0,95-konfidensinterval, når variansen er ukendt, og
sammenlign med resultatet fra spørgsmål a).
3 . I undersøgelsen fra opgave 3 i kapitel 12 svarede 429 personer ud
af 634, at de var imod rygning på danske uddannelsesinstitutioner.
a) Opstil et 0,95-konfi densinterval for andelen af modstandere mod
rygning i populationen.
b) Opstil også et 0,90- og et 0,99-konfidensinterval.
4. En sundhedsplejerske udtog en simpel tilfældig stikprøve på 100
børnehøjder i en kommune med 3431 børn. Stikprøvegennemsnittet
= 138,4 cm og stikprøvevariansen S 2 = 62,32.
var
a) Opstil et 0,95-konfi densinterval for middelhøjden i populationen.
b) Ligger højden 140 cm inden for dette interval?
c) Ændres din konklusion fra spørgsmål b), hvis sundhedsplejer­
sken i stedet anvender et 0,90- eller et 0,99-konfidensinterval?
5. En aktieanalytiker har to simple tilfældige stikprøver med hen­
holdsvis 50 og 43 observationer. I den første stikprøve er stikprø­
= 11,43 og stikprøvevariansen til
vegennemsnittet udregnet til
= 14,47 og
S12 = 86,8, mens de i den anden er henholdsvis
S22 = 142,7.
a) Opstil 0,95-konfi densintervaller for hver af de to ukendte varian­
ser. Hvilke forudsætninger ligger til grund for disse intervallers
udseende?
b) Er de to intervaller overlappende? Hvordan vil du fortolke dette?
c) Opstil også to 0,95-konfidensintervaller for middelværdierne.
Hvad er de nødvendige forudsætninger i dette tilfælde?
d) Er intervallerne fra spørgsmål c) overlappende?
e) Opstil også et 0,95-konfidensinterval for forskellen mellem de to
middelværdier.
f) Opstil endelig et 0,95-konfidensinterval for forholdet mellem de
to varianser.
6. Et analyseinstitut fandt, at henholdsvis 74 % og 72 % var imod re­
klamer for alkohol på tv i 1997 og 2002. Stikprøvestørrelsen var på
957 i 1997 og 1012 i 2002.
a) Opstil et 0,90-, 0,95- og 0,99-konfidensinterval for forskellen
mellem de to ukendte andele i 1997 og 2002.
b) Indgår værdien nul i disse intervaller?
c) Hvor højt/lavt skal signifikansniveauet være, for at værdien nul
akkurat ikke indgår i intervallet?
7. En bank ønsker at sammenligne middelomsætningen blandt er­
hvervskunderne i to af dens filialer. Derfor udtrækker den to stikprø­
ver, én fra hver filials kundekreds. Resultaterne af de to stikprøver
er:
n
(1 0 0 0 k r.)
S
F ilia l 1:
25
1 2 6 7 ,7
2 1 0 ,8
F ilia l 2:
30
1 4 4 3 ,4
2 7 8 ,0
a) Opstil et 0,95-konfidensinterval uden anvendelse af den poolede
variansestimator.
b) Gør som i a), men anvend den poolede estimator.
8. I en undersøgelse af danske forbrugeres forbrug af spansk rødvin
valgte man at inddele den voksne befolkning i fire indkomststrata.
Resultaterne af undersøgelsen er opsummeret i nedenstående tabel.
Stratum
Nj
nj
1105
67
6 ,5
3 ,3 4
2
676
61
8 ,4
6 ,3 3
3
957
73
1 2 ,4
4 ,5 2
4
389
22
3 ,6
2 ,1 2
1
a) Opstil 0,95-konfi densintervaller for hver af de 4 ukendte stra­
tummiddelværdier, når det antages, at der er tale om simple til­
fældige stikprøver fra de fire strata.
b) Opstil også et 0,95-konfidensinterval for middelværdien i den
samlede population.
Betragt nu de fire stikprøver som én simpel tilfældig stikprøve fra
hele populationen.
c) Udregn stikprøvegennemsnittet.
d) Opstil et 0,95-konfi densinterval for populationsmiddelværdien i
dette tilfælde.
e) Sammenlign dine resultater i spørgsmål b) og d).
14
Hypotesetest
I kapitel 10 til 13 brugte vi vores stikprøve til at konstruere skøn på
forskellige beskrivende mål. Disse skøn bruger vi i dette kapitel til at
teste de teorier, som måske i første omgang fik os til at udtrække stik­
prøven. Vi kunne fx have en teori om, at voksne danskere i gennemsnit
motionerer mere end 2 timer om ugen. Hvis vores stikprøve giver os et
skøn på 2 ,1 timer per uge, er dette så nok til at konkludere, at danskerne
faktisk motionerer mere end 2 timer om ugen?
Fordi man kun har en stikprøve fra populationen til rådighed, kan
man ikke umiddelbart be- eller afkræfte en teori. Så for at svare på det
ovenstående spørgsmål skal vi kunne vurdere usikkerheden, der skyl­
des stikprøven, og vi skal beslutte os for, hvor stor en risiko vi er villige
til at løbe med hensyn til at drage en forkert konklusion. Alt dette fører
til en procedure, som man kalder for en hypotesetest.
For at foretage en hypotesetest skal man formulere sin teori som hy­
poteser, hvor den ene hypotese bekræfter teorien, og den anden forka­
ster den. Til implementeringen a f hypotesetesten vælger man en såkaldt
teststatistik, som med en enkelt talværdi opsummerer den information
i stikprøven, der er relevant for vurderingen a f hypoteserne. Til sidst
vælger man en beslutningsregel, som fører til den endelige beslutning
om, hvilken hypotese man vil acceptere.
I dette kapitel fokuserer vi primært på test a f hypoteser om en mid­
delværdi, dels fordi det er nyttigt i praksis, dels fordi disse test kan illu­
strere, hvordan man generelt konstruerer en hypotesetest. I afsnit 14.1
viser vi, hvordan man opstiller hypoteser, og vi diskuterer de mulige
konklusioner og fejlkonklusioner, man kan drage på baggrund a f en
hypotesetest. I afsnit 14.2 gennemgår vi hovedelementerne i konstruk­
tionen a f en hypotesetest med udgangspunkt i et simpelt eksempel. I
afsnit 14.3 til 14.5 ser vi på forskellige situationer, hvor man anvender
hypotesetest. I afsnit 14.6 introducerer vi en alternativ formulering af
en beslutningsregel. I afsnit 14.7 forsøger vi at give et overblik over hy­
potesetest a f en middelværdi, mens valget a f stikprøvestørrelse disku­
teres i afsnit 14.8. I afsnit 14.9 tester vi hypoteser om variansen, mens
afsnit 14.10 og 14.11 forklarer forskellen mellem statistisk signifikans
og reel signifikans samt sammenhængen mellem hypotesetest og kon­
fidensintervaller.
14.1
Hypoteser og fejltyper
Motivationen for at lave en undersøgelse bunder som regel i en mere
eller mindre præcist formuleret teori. For at teste om teorien er rigtig,
ender man ofte med at udtage en stikprøve. Da man kun har en stikprø­
ve til rådighed, kan man ikke med sikkerhed be- eller afkræfte teorien
ud fra denne. Der er altså en mulighed for, at man drager en forkert
konklusion. Vi skal i dette afsnit se på det begrebsapparat, man bruger
til at håndtere denne situation.
1 4.1 .1
Opstilling af hypoteser
Først formulerer man sin teori i to hypoteser - én, som støtter teori­
en, og én, som går imod den. Den ene hypotese benævner man nul­
hypotesen, betegnet H0, og den anden kalder man alternativhypotesen,
betegnet H 1 Hvilken a f hypoteserne man vælger som nulhypotese, og
hvilken man vælger som alternativhypotese, afhænger af den givne si­
tuation samt af den risiko og de omkostninger, som er forbundet med
en forkert konklusion.
Eksempel 14.1 : Anklaget – del 1
En mand er anklaget for tyveri og skal for retten, hvor han skal døm­
mes. Nulhypotesen er, at manden er uskyldig, mens alternativhypotesen
er, at han er skyldig:
H0 : uskyldig
H 1 : skyldig
Dommeren skal enten acceptere nulhypotesen, dvs. frifinde personen,
eller forkaste nulhypotesen (dvs. acceptere alternativhypotesen), i hvil­
ket tilfælde manden skal idømmes en straf. Dommeren skal træffe den­
ne beslutning uden at vide med sikkerhed, om nulhypotesen er sand,
men alene ud fra indicier.
■
På samme måde som i dette eksempel skal vi i en statistisk undersø­
gelse træffe beslutning om, hvorvidt en hypotese kan accepteres eller
må forkastes ud fra indicier. Indicierne er i vores tilfælde en stikprøve.
Så både for dommeren og for os eksisterer det problem, at beslutninger
skal træffes ud fra en viden, som er ufuldstændig.
I statistik betragter man typisk hypoteser om populationsstørrelser.
Fx kan man være interesseret i at teste, om middelværdien, μ , i en po­
pulation er lig med μ 0 eller μ 1 Det fører til de to hypoteser H0: μ = μ 0
og Η 1: μ = μ 1 I et andet tilfælde kunne man være interesseret i at teste,
om middelværdien μ er lig μ0, eller om μ ikke er lig med μ 0. I denne
situation er de to hypoteser: H0: μ = μ0 og Η 1: μ ≠ μ 0. Man kan måske
også være interesseret i at sammenligne to forskellige grupper i popula­
tionen. Fx kan man teste, om middelindkomsten blandt mænd, μ mand, er
lig med middelindkomsten blandt kvinder, μ kvinde· Det leder frem til de
to hypoteser H0: μkvinde =
μm
andog Η 1: μkvinde ≠ μ mand
Man skal beslutte, hvilken a f de to hypoteser man gør til nulhypote­
sen. Der er tradition for, at man gør den hypotese, der understøtter den
teori, man efterprøver, til alternativhypotesen, og at man kun accepte­
rer denne, hvis der er overvældende indicier imod nulhypotesen. I ek­
sempel 14.1 er nulhypotesen „uskyldig“. I et retssamfund er en person
uskyldig, indtil det modsatte er bevist eller godtgjort med meget stor
sandsynlighed. Det vil sige: Først når der er overvældende bevis for
manglende uskyld, forkaster man nulhypotesen til fordel for
alterna­tivhypotesen og konkluderer, at personen er skyldig. Ved en statistisk
test a f fx manglende ligeløn mellem mænd og kvinder lader man ty­
pisk nulhypotesen være, at der er ligeløn (H0: μkvinde = μmand) Kun med
overvældende bevis på manglende ligeløn forkaster man nulhypotesen
og accepterer, at der ikke er ligeløn. Hvis man således ender med at ac­
ceptere alternativhypotesen, står man altså med en overbevisende sag,
fordi man kun har forkastet nulhypotesen efter et massivt bevis på, at
den er forkert.
14.1.2
Konklusioner og fejltyper
Eftersom man ikke kender sandheden, er der en risiko for, at man begår
fejl. Eksemplet ovenfor kan bruges til at illustrere dette:
Eksempel 14.2: Anklaget – del 2
For dommeren gælder det om at idømme den anklagede mand en straf,
hvis han er skyldig, og frifinde ham, hvis ikke han er det. Fordi bevis­
materialet er usikkert, er der en risiko for, at dommeren begår to typer
a f fejl. For det første kan dommeren idømme manden en straf (forkaste
nulhypotesen), selvom han er uskyldig. Man kalder en sådan fejl for en
type-I-fejl. Dommeren kan også frifinde personen (acceptere nulhypo­
tesen), selvom han i virkeligheden er skyldig. En sådan fejl kalder man
en type-II-fejl.
■
En type-I-fejl forekommer, hvis man forkaster en nulhypotese, som er
sand. En type-II-fejl forekommer, hvis man accepterer en nulhypotese,
som er falsk. Så længe bevismaterialet eller beslutningsgrundlaget ikke
er komplet, er der altid en risiko for at begå en a f disse fejl. Tabel 14.1
opsummerer de mulige konklusioner og fejl, man kan begå ved en test
a f en hypotese.
Tabel 14.1:
Konklusioner
og fejltyper ved
hypotesetest
Nulhypotese sand
Nulhypotese falsk
Nulhypotese accepteret
K orrekt konklusion
Type-II-fejl
Nulhypotese forkastet
Type-I-fejl
K orrekt konklusion
I statistiske undersøgelser kan man vurdere sandsynligheden for en fejl,
fordi beslutningen er baseret på en stikprøve. Dette gøres ved først at
opskrive en beslutningsregel, som for ethvert tænkeligt udfald a f stik­
prøven fortæller, om man skal acceptere eller forkaste nulhypotesen.
Man kan således opfatte en beslutningsregel som en stokastisk variabel,
som for ethvert udfald af det statistiske eksperiment (stikprøven) udsty­
rer os med en konklusion omkring nulhypotesen. Vi skal i de følgende
afsnit se, hvordan man konkret opstiller en sådan beslutningsregel i for­
skellige situationer.
Antag, at man allerede har fastsat en beslutningsregel. Så kan man
opstille sandsynlighederne for type-I- og type-II-fejl. Disse sandsynlig­
heder karakteriserer testens egenskaber. Sandsynligheden for at begå
en type-I-fejl benævner vi a, og den er defineret som en betinget sand­
synlighed:
P (Type-I-fejl) = P(forkaste H 0|H 0 sand) = α
Det læses som: „Sandsynligheden for at forkaste H0, givet at H0 er sand,
er lig med α“. Sandsynligheden for at begå en type-II-fejl benævner vi
β , og den er også defineret som en betinget sandsynlighed:
P (Type-II-fejl) = P (acceptere H0|H 0 falsk) = β
En tests styrke er lig med 1 – β. En høj styrke af en test, dvs. en styrke
tæt på 1 og dermed en sandsynlighed for en type-II-fejl tæt på nul, be­
tyder, at testen med stor sandsynlighed forkaster en falsk nulhypotese.
Det er værd endnu en gang at understrege, at den beslutning, man
træffer, er stokastisk, da den afhænger af, hvilken stikprøve der er til rå­
dighed for beslutningen. Derimod er det ikke stokastisk, om hypotesen
er sand eller falsk.17
Sandsynlighederne for type-I- og type-II-fejl er udtryk for testens
egenskaber: Lave sandsynligheder er lig med en god test. I de følgende
afsnit bruger vi sandsynlighederne for type-I- og type-II-fejl som basis
for konstruktion af beslutningsregler.
14.2
Konstruktion af hypotesetest
Vores fremgangsmåde ved konstruktion a f en hypotesetest er følgende:
Først definerer vi et mål, som med et enkelt tal peger på, om nul- eller
alternativhypotesen er sand. Vi bruger dette mål til at definere en test­
statistik, som har den samme fortolkning som målet, men med mere
hensigtsmæssige statistiske egenskaber. Beslutningen om at acceptere
eller forkaste nulhypotesen er baseret på værdien a f teststatistikken. Da
teststatistikken har en fordeling, udregner vi sammenhængen mellem
beslutningsreglen og sandsynlighederne for type-I- og type-II-fejl. Det
er denne sammenhæng og vores ønske om at kontrollere sandsynlig­
hederne for de to typer a f fejl, som afgør den endelige udformning af
beslutningsreglen.
Vi illustrerer i dette afsnit konstruktionen a f en hypotesetest med et
simpelt eksempel. Hypoteserne er:
H0: μ = μ 0H
:μ=
1
17 I udtrykkene for type-I- og type-II-fejl ovenfor betinger vi på, om hypotesen er sand eller falsk. Strengt
taget er dette ikke i overensstemmelse med definitionen af en betinget sandsynlighed, hvor man betinger
på en stokastisk variabel. Det giver dog sjældent grund til misforståelser, og det bidrager til at synliggøre,
under hvilke forudsætninger man udregner sandsynlighederne.
hvor μ er middelværdien, og μ 0 og μ 1 er kendte værdier (og de eneste
mulige værdier af μ ). Antag desuden, at μ 0 < μ 1, og at vi har en simpel
tilfældig stikprøve med n observationer, ( X 1, ..., X n) , hvor hver obser­
vation, X i, er normalfordelt med middelværdi μ og varians σ2:
X i ~ Ν (μ , σ 2), i = 1,.n
For at holde eksemplet så simpelt som muligt antager vi i dette afsnit,
at variansen, σ2, er kendt.
14.2.1
Hypotesemål
Den første ingrediens, vi bruger til konstruktionen a f en hypotesetest,
er et mål, som med et enkelt tal peger på, om nulhypotesen er sand eller
falsk. Vi kalder et sådant mål for et hypotesemål.18 Hypotesemålet skal
entydigt udpege den korrekte hypotese, hvis man anvender den sande
middelværdi i udregningen a f hypotesemålet. I praksis kender man ikke
den sande middelværdi, men baseret på stikprøven kan man udregne et
estimat på hypotesemålet.
Et hypotesemål er en funktion, hvis værdi fremkommer, når man
indsætter værdier for de ukendte størrelser. Et hypotesemål kan fx være
h (μ ) = μ – μ0, hvor h (μ) er hypotesemålet, som er en funktion a f den
eller de ukendte størrelser (her μ ). Hvis nulhypotesen er falsk, er μ = μ 0,
og hypotesemålet er dermed h (μ 0) = 0. Hvis nulhypotesen er sand, er
μ = μ 1, og dermed er hypotesemålet h(μ1 ) = μ 1 – μ 0. Da vi antog, at
μ 0 < μ 1, så er h(μ1 ) > 0. Baseret på hypotesemålets værdi er man altså
ikke i tvivl om, hvorvidt nul- eller alternativhypotesen er sand, når man
indsætter den sande middelværdi.
I praksis udskifter vi de sande (men ukendte) værdier med estimater.
Vi ved fra kapitel 10, at stikprøvegennemsnittet:
er en estimator for μ. Indsat i hypotesemålet får man det estimerede
hypotesemål:
18 I litteraturen har målet ikke noget navn. Vi fremhæver (og navngiver) målet for at synliggøre dette
skridt i konstruktionen af en hypotesetest.
Man kan fortolke det estimerede hypotesemål som et estimat på, hvil­
er et skøn på μ , så er værdien af ty­
ken hypotese der er sand. Da
pisk forskellig fra μ . Deraf følger, at det estimerede hypotesemål,
også typisk er forskelligt fra hypotesemålet, h (μ ), udregnet ved hjælp
a f den sande middelværdi. I vores eksempel er det estimerede hypotes­
emål altså typisk forskelligt fra 0, selvom μ = μ 0, og det vil typisk også
være forskelligt fra μ 1,– μ 0, selvom μ = μ 1. I praksis kan man risikere at
få den samme realiserede stikprøve og dermed den samme værdi af de
estimerede hypotesemål, uanset om μ = μ 0 eller μ = μ 1. Forskellen på de
to situationer ligger i sandsynligheden for at få bestemte værdier a f det
estimerede hypotesemål. Fx er det mere sandsynligt at få værdier af det
estimerede hypotesemål, som er tæt på 0, når μ = μ 0, end når μ = μ 1. Det
er dette faktum, vi benytter i den videre konstruktion af en hypotesetest.
14.2.2
Teststatistik
Nogle værdier a f det estimerede hypotesemål er mere sandsynlige, hvis
nulhypotesen er sand, end hvis den er falsk. Det leder os frem mod en
beslutningsregel, som accepterer nulhypotesen for bestemte værdier af
det estimerede hypotesemål og forkaster den for andre. Det viser sig
imidlertid, at det er uhensigtsmæssigt at bruge det estimerede hypotese­
mål og dets fordeling til at danne beslutningsreglen. I stedet omskriver
vi det estimerede hypotesemål til en såkaldt teststatistik. Fordelen ved
at bruge en teststatistik frem for hypotesemålet er dels, at man nemmere
kan udlede fordelingen a f teststatistikken, dels at teststatistikken har
bedre statistiske egenskaber.19
Det estimerede hypotesemål for vores test af en middelværdi om­
skriver vi til en teststatistik, Z , på følgende måde:
Som vi skal se, har Z en fordeling, der er nemmere at arbejde med end
fordelingen af
uden at Z af den grund rummer mindre informati­
Når stikprøvegennemsnittet er tæt på μ0, hvilket antyder,
on end
at μ0 er den sande værdi, så er Z ligesom
tæt på 0. Og når stik­
prøvegennemsnittet er tæt på μ 1, så er Z ligesom
større end nul.
Som vi forklarede i kapitel 10, vil
i dette tilfælde også være normalfordelt med middelværdi μ og varians
Fra kapitel 10 ved vi desuden, at hvis vi ganger en normalfordelt vari19
I denne bog kommer vi dog ikke nærmere ind på, hvorfor de statistiske egenskaber er bedre.
abel med en konstant, så vil den resulterende variabel stadis være nor­
så får vi
malfordelt. Hvis vi derfor dividerer med konstanten
en ny normalfordelt variabel, denne gang med middelværdi
og varians 1 ifølge regnereglerne for middelværdier og varianser:
er en konstant. Hvis vi trækker en konstant fra
Størrelsen
en normalfordelt stokastisk variabel, vil den nye variabel stadig være
normalfordelt. Det påvirker kun middelværdien. Dermed fås:
Teststatistikken, Z , er altså normalfordelt med en middelværdi, som af­
hænger a f den sande middelværdi, μ, og en varians, som er lig med 1.
Især det sidste er meget praktisk!
Vi er specielt interesserede i at kende fordelingen a f Z , når nulhypo­
tesen er sand. En sand nulhypotese er det samme som, at μ = μ 0, og der­
med at Z ~ N (0, 1). Det vil sige, at Z er standardnormalfordelt under
H0. En falsk nulhypotese, dvs. en sand alternativhypotese, er det samme
som, at μ = μ 1 og dermed er
under H 1
Eksempel 14.3: Stikprøve fra normalfordeling – del 1
Antag, at vi har en simpel tilfældig stikprøve med 12 observationer, som
er normalfordelte med middelværdi μ og varians σ2 = 16. Hypoteserne
er Η0: μ = 1 imod Η : μ = 3. Vi anvender hypotesemålet, h (μ ) = μ – 1,
som estimator for μ.
og vi bruger stikprøvegennemsnittet,
Vi kan finde sandsynligheden for, at teststatistikken, Z , er mindre
end eller lig med 1,5. Under nulhypotesen er sandsynligheden:
P (Z ≤ 1,5 | H 0 sand) = Φ(1,5) = 0,9332
Under alternativhypotesen er
er derfor:
og sandsynligheden
■
14.2.3
Beslutningsregel
Vi kan nu opstille en beslutningsregel og udregne dens konsekvenser
for sandsynlighederne for type-I- og type-II-fejl. Da μ 0 < μ 1, så er store
værdier af
og dermed Z en indikation af, at alternativhypotesen er
sand og nulhypotesen falsk. Små værdier af og dermed Z er derimod
en indikation af, at nulhypotesen er sand. Vi definerer derfor en beslut­
ningsregel således:
accepter
H 0 hvis Z ≤ cv
forkast H 0 hvis Z > cv
hvor cv er en talværdi, der adskiller de værdier a f Z, for hvilke man
accepterer nulhypotesen, fra de værdier, hvor man forkaster nulhypote­
sen. A f den årsag kalder man cv for en kritisk værdi („critical value“).
Det er værd at understrege, at fordi man accepterer eller forkaster en
hypotese, så gør det den ikke sand eller falsk. Der er altid en risiko for
at begå en typr-I- eller type-II-fejl.
Men givet beslutningsreglen kan man udregne sandsynligheden for
at begå henholdsvis en type-I- og en type-II-fejl. Sandsynligheden for
at begå en type-I-fejl er sandsynligheden for at forkaste nulhypotesen,
når den er sand. Det vil sige:
P (type-I-fejl) = P (Z > cv | H 0 sand)
Sandsynligheden for at begå en type-II-fejl er sandsynligheden for at
acceptere nulhypotesen, når den er falsk, dvs. forkaste alternativhypo­
tesen, når den er sand. Det vil sige:
P (type-II-fejl) = P (Z ≤ cv | H0 falsk)
Eksempel 14.4: Stikprøve fra normalfordeling – del 2
I eksempel 14.3 udregnede vi sandsynligheden for, at Z er mindre end
1,5. Hvis den kritiske værdi i beslutningsreglen sættes til 1,5, så er be­
slutningsreglen:
accepter
H 0 hvis Z ≤ 1,5
forkast H 0 hvis Z > 1,5
I eksempel 14.3 fandt vi, at P(Z ≤ 1,5 | H0 sand) = P(Z ≤ 1,5 | μ = 1)
= 0,9332. Det medfører, at:
P (type-I-fejl) = P (Z > 1,5 | μ = 1) = 1 – P (Z ≤ 1,5 | μ = 1) = 0,0668
Vi fandt også, at P (Z ≤ 1,5 | H 0 falsk) = P(Z ≤ 1,5 | μ = 3) = 0,4090.
Det medfører, at:
P (type-II-fejl) = P (Z ≤ 1,5 | μ = 3) = 0,4090
■
14.2.4
Valg af kritisk værdi baseret på type-I-fejl
Der er tradition for, at man fokuserer på størrelsen a f type-I-fejlen, når
man skal vælge sin kritiske værdi. Man beslutter typisk, at sandsynlig­
heden for en type-I-fejl ikke må overstige 0,05. En årsag til at fokusere
udelukkende på type-I-fejlen er, at man som regel opstiller den teori,
man ønsker at teste, som alternativhypotesen. Og man vil kun konklu­
dere, at denne teori er korrekt, hvis der er tungtvejende indicier for det­
te, hvilket svarer til en lille sandsynlighed for at begå en type-I-fejl.
For at illustrere denne tilgang, kan vi antage, at vi ønsker en test,
som maksimalt begår en type-I-fejl med sandsynlighed a. I denne sam­
menhæng kalder man a for signifikansniveauet. Så kan vi regne os bag­
læns til den kritiske værdi, cv. Denne skal opfylde følgende betingelse:
accepter
H 0 hvis Z ≤ cv
forkast H 0 hvis Z > cv
således at:
P(type-I-fejl) = P (Z > cv | H0 sand) = α
Eftersom Z er standardnormalfordelt under H0, må cv være lig med
(1 – α )-fraktilen i standardnormalfordelingen, Z 1–α. Den endelige be­
slutningsregel bliver da:
accepter H0 hvis Z ≤ Z 1–α
forkast H0 hvis Z > Z 1–α
Bemærk, at det kun er sandsynligheden for en type-I-fejl (signifikans­
niveauet, α), som indgår i bestemmelsen a f den kritiske værdi her. Det
er en a f fordelene ved at bruge den valgte teststatistik frem for det esti­
merede hypotesemål.
Eksempel 14.5: Stikprøve fra normalfordeling – del 3
Antag, at der i eksempel 14.3 udtrækkes en stikprøve, som medfører et
= 2,85. Den realiserede teststati­
realiseret stikprøvegennemsnit på
stik bliver da:
Hvis man vælger et signifikansniveau på α = 0,05, er den kritiske værdi
cv = Z0,95 = 1,6449. Da z ≤ cv, accepterer vi altså nulhypotesen. Valget
a f α = 0,05 medfører i øvrigt, at sandsynligheden for en type-II-fejl er:
= Φ ( –0,0872) = 0,4641
■
14.2.5
Trade-off mellem type-I- og type-II-fejl
Kunne man fastsætte sandsynlighederne for type-I- og type-II-fejl uaf­
hængigt a f hinanden, skulle man sætte dem begge lig med 0. Dette er
desværre ikke muligt. Man er tvunget til at afveje ønsket om en lav
sandsynlighed for en type-I-fejl mod ønsket om en lav sandsynlighed
for en type-II-fejl. Det er dette trade-off mellem sandsynlighederne for
type-I- og type-II-fejl, som man bør vurdere, når man fastsætter en be­
slutningsregel.
En mindre risiko for at begå en type-I-fejl betyder en højere risiko
for at begå en type-II-fejl, og omvendt. Hvis vi vil være sikre på ikke
at dømme en uskyldig mand, så er beviserne nødt til at være så stærke,
før vi dømmer ham, at vi i mange tilfælde kommer til at lade en skyldig
mand gå fri (en type-II-fejl).
Eksempel 14.6: Stikprøve fra normalfordeling – del 4
Vi kan se trade-off’et mellem type-I- og type-II-fejl i eksemplerne 14.4
og 14.5. I eksempel 14.4 antog vi, at den kritiske værdi var 1,5. Det
medførte, at P (type–I–fejl) = 0,0668 og P (type–II–fejl) = 0,4090. I ek­
sempel 14.5 valgte vi P(type–I–fejl) = 0,05, som medførte en kritisk
værdi på 1,6449 og P (type–II–fejl) = 0,4641. Den lavere sandsynlighed
for en type-I-fejl i eksempel 14.5 i forhold til eksempel 14.4 medførte
altså til gengæld en højere sandsynlighed for en type-II-fejl.
■
Valget a f α og β bør i princippet baseres på en vurdering a f konse­
kvenserne a f at drage fejlagtige konklusioner, hvilket igen afhænger af
undersøgelsens formål. Men som forklaret ovenfor, så er der en tradi­
tion for at fokusere udelukkende på risikoen for at begå en type-I-fejl.
Typisk sætter man a lig med en lav værdi som 0 ,10, 0,05 eller 0,01 og
finder de tilhørende kritiske værdier – præcis som vi gjorde i eksempel
14.5 ovenfor. Bagsiden a f dette er, at man i mange tilfælde ikke vil få
forkastet en falsk nulhypotese. I eksempel 14.5 er der således næsten
50% chance for en type-II-fejl. Med andre ord, hvis nulhypotesen er
falsk, vil vi kun ”opdage” det halvdelen a f gangene.
Beslutningsreglen ovenfor antyder, at vi kan betragte beslutningen
som, at “vi accepterer nulhypotesen” eller “vi forkaster nulhypotesen”,
og vi vil også bruge disse formuleringer her. Men hvis man følger den
traditionelle tilgang med at vælge en lav værdi a f α, så foretrækker
mange at sige ”vi kan ikke forkaste nulhypotesen” snarere end ”vi ac­
cepterer nulhypotesen”, fordi den første formulering understreger den
(ofte høje) risiko, der er for at begå en type-II-fejl.
Når man fokuserer udelukkende på risikoen for at begå en type-I-fejl
og helt ignorerer risikoen for at begå en type-II-fejl, så får man ofte ikke
en god balance mellem de to fejltyper, og derfor heller ikke mellem de
to hypoteser. En mere fornuftig tilgang vil være at vælge en kombina­
tion a f α og β, som er både mulig og bedst understøtter undersøgelsens
formål. Eftersom der er en sammenhæng mellem α og β , er det faktisk
muligt at beregne konsekvenserne for β a f at vælge forskellige værdier
a f α.
I tilfældet med H0: μ = μ 0 over for
μ = μ 1 kan sammenhængen
mellem α og β skrives på følgende måde: Da cv = Z1–α, så er sandsyn­
ligheden for en type-II-fejl:
β = P (type-II-fejl) = P (Z ≤ cv | H 0 falsk) = P (Z ≤ Z 1–α | H0 falsk)
Her ses det, at jo mindre værdi a f a, desto større er Z1–α, og desto større
bliver β. Det næste eksempel illustrerer dette.
Eksempel 14.7: Stikprøve fra normalfordeling – del 5
I eksemplet med stikprøven med de 12 normalfordelte observationer
med varians σ2 = 16 er sandsynligheden for en type-II-fejl, β , som en
funktion a f α givet ved:
I figur 14.1 illustrerer vi denne sammenhæng mellem α og β.
Figur 14.1:
Trade-off
mellem α og β
Man kan her tydeligt se det negative trade-off mellem α og β: Jo lavere
sandsynlighed for type-I-fejl man tillader, desto højere sandsynlighed
for type-II-fejl må man acceptere. Hvis man fx ønsker en sandsynlighed
for en type-I-fejl på maksimalt 0,10, må man acceptere en sandsynlig­
hed for en type-II-fejl på omkring 0,3.
■
14.2.6
Tilfældet μ 0 > μ 1
Indtil nu har vi antaget, at μ 0 < μ 1 i forbindelse med hypoteserne
H0: μ = μ0 og H
0:
μ = μ1 I dette underafsnit viser vi, hvordan beslut­
ningsreglen ændres, når vi i stedet har, at μ0 > μ1 Som ovenfor vælger
vi hypotesemålet h (μ ) = μ – μ0 og teststatistikken:
Fordelingen a f teststatistikken er den samme som ovenfor:
Forskellen opstår i forbindelse med beslutningsreglen. Hvis H0 er sand,
så er h( μ ) = 0, og hvis H 1 er sand, så er h( μ ) = μ 1– μ 0 < 0. Det er ulig­
hedstegnet under H 1, som er ændret nu. Det betyder, at negative værdier
af det estimerede hypotesemål,
indikerer, at alternativhypotesen
er sand og nulhypotesen falsk. Tilsvarende gælder for teststatistikkens
fortegn. Derfor vælger vi nu beslutningsreglen:
accepter
H 0 hvis Z ≥ cv
forkast H0 hvis Z < cv
Lad signifikanssandsynligheden være α . Da sandsynligheden for en ty­
pe-I-fejl her er:
P (type-I-fejl) = P (Z < cv | H 0 sand) = α
er den kritiske værdi cv = Z α, hvor Z αer α-fraktilen i standardnormalfor­
delingen. Dermed bliver den endelige beslutningsregel:
accepter
H0
hvis Z ≥ Z α
forkast
H0
hvis Z < Z α
Sandsynligheden for en type-II-fejl er derfor:
β = P (type-II-fejl) = P (Z ≥ cv | H 0 falsk) = P (Z ≥ Zα | H 0 falsk)
14.2.7
Opsummering
Vi afslutter med i punktform at opsummere trinene i konstruktionen af
en hypotesetest.
Konstruktion a f en hypotesetest
1. Opstil nulhypotesen, H0, og alternativhypotesen, H 1
2. Vælg hypotesemål og teststatistik.
3. Vælg signifikansniveau, α, under hensyntagen til styrken,
1 – β , a f testen.
4. Opstil beslutningsreglen, og find den eller de kritiske værdier.
5. Beregn den realiserede teststatistik ved hjælp af stikprøven.
6. Forkast eller accepter H0.
Bemærk, at på grund a f trade-off’et mellem type-I- og type-II-fejlen
kan det være nødvendigt at løse punkt 3 og 4 på én gang, da man har
brug for beslutningsreglen for at kunne beregne testens styrke. I praksis
sætter mange dog blot α = 0,05 eller 0,10 uden hensyntagen til styrken.
Den efterfølgende boks opsummerer de fire første trin i konstruktionen
a f hypotesetesten for det gennemgående eksempel anvendt i dette af­
snit.
E ksem pel på konstruktion a f hypotesetest:
Vi har en simpel tilfældig stikprøve med n normalfordelte obser­
vationer med kendt varians, σ2.
1. Hypoteser: H0: μ = μ 0 vs. H 1: μ = μ 1
2. Teststatistik:
3. Signifikansniveau: α
4 . Beslutningsregel:
a) Hvis μ 1> μ 0, så er beslutningsreglen:
accepter
H 0 hvis Z ≤ Z 1–α
forkast
H 0 hvis Z > Z 1–α
hvor Z1–α er ( 1–α)-fraktilen i standardnormalfordelingen.
Sandsynligheden for en type-II-fejl er da:
b) Hvis μ 1< μ 0, så er beslutningsreglen:
accepter
H0 hvis Z ≥ Zα
forkast H 0 hvis Z < Zα
hvor Zαer α-fraktilen i standardnormalfordelingen. Sandsyn­
ligheden for en type-II-fejl er da:
Generelt er en teststatistik altså en stokastisk variabel, som medfører, at
man accepterer nulhypotesen, hvis teststatistikkens værdier falder i et
bestemt interval, mens man accepterer alternativhypotesen, hvis dens
værdier falder i et andet ikke-overlappende interval. Vi vil derfor af­
slutningsvis give den formelle definition a f en teststatistik, T, og en
beslutningsregel:
Teststatistik og beslutningsregel.
Lad T være en stokastisk variabel og R en mængde a f tal. T er en
teststatistik, når den indgår i beslutningsreglen:
accepter H0
hvis
T ∉R
forkast H0 hvis
T ∈R
hvor R kaldes forkastelsesregionen. Endepunkterne i R kaldes de
kritiske værdier.
I det gennemgående eksempel i dette afsnit har Z rollen som teststati­
stikken, T, forkastelsesregionen er R = (c v ;∞ ) i tilfældet hvor μ 0< μ 1, og
cv er en kritisk værdi. I tilfældet hvor μ0 > μ1, er R = (–∞ ;cv).
14.3
Test af middelværdi under forskellige fordelingsantagelser
I det foregående afsnit gennemgik vi konstruktionen af en hypotesetest
i tilfældet med en specifik hypotese om middelværdien og en antagel­
se om, at observationerne i stikprøven var normalfordelte med kendt
varians. I dette og det følgende afsnit betragter vi den samme hypotese
som ovenfor, men under forskellige antagelser om fordelingen a f ob­
servationerne i stikprøven. I afsnit 14.3.1 og 14.3.2 gennemgår vi det
generelle tilfælde, hvor fordelingen a f observationerne i stikprøven er
ukendt, men hvor vi antager, at variansen kan være enten kendt eller
ukendt. I afsnit 14.3.3 og 14.3.4 kigger vi på specialtilfældene, hvor
observationerne i stikprøven er normalfordelte med henholdsvis kendt
og ukendt varians. Vi opsummerer også de forskellige tilfælde i en tabel
i afsnit 14.7.
Gennem hele dette afsnit er de betragtede hypoteser som i afsnit
14.2, dvs:
H0 : μ = μ 0
H 1:μ = μ 1
hvor μ0 og μ 1er kendte værdier (og de eneste mulige), og det antages, at
μ 0 < μ 1. Da hypoteserne er de samme som i foregående afsnit, bruger vi
også samme hypotesemål og den samme teststatistik:
14.3.1
Ukendt fordeling, kendt varians
Når vi ikke kender fordelingen a f observationerne i stikprøven, kan vi
og der­
ikke finde den eksakte fordeling a f stikprøvegennemsnittet,
med heller ikke den eksakte fordeling a f Z . I stedet for bruger vi den
centrale grænseværdisætning fra kapitel 10, som fortæller os, at stik­
prøvegennemsnittet er approksimativt normalfordelt med middelværdi
μ og varians σ2/n, når stikprøvestørrelsen er stor. Deraf følger det, at:
Præcisionen a f denne approksimation afhænger a f stikprøvestørrelsen,
n. Jo større stikprøve, desto bedre approksimation. Som i afsnit 14.2
kan man bruge dette resultat til at finde fordelingen a f teststatistikken:
blot er en konstant, som kun påvirker mid­
idet det andet led
delværdien af Z . Dette resultat bruger vi til at finde de approksimative
fordelinger a f teststatistikken, Z , under H0 ogH
1:
og
Den eneste forskel i forhold til afsnit 14.2, hvor vi antog, at observatio­
nerne i stikprøven var normalfordelte, er altså, at Z nu kun er approksi­
mativt normalfordelt under nul- og alternativhypotesen.
Baseret på de approksimative fordelinger for Z kan man opstille be­
slutningsreglen. Den er præcis den samme som tidligere:
accepter
H0 hvis Z ≤ cv
forkast
H 0 hvis Z > cv
hvor cv = Z 1–α er ( 1 – α)-fraktilen i standardnormalfordelingen.
14.3.2
Ukendt fordeling, ukendt varians
Når variansen er ukendt, som den typisk er i praksis, kan man erstatte
den med en estimator. En estimator for variansen, σ2, er stikprøvevari­
ansen:
Dermed bliver teststatistikken givet ved:
som stadig er approksimativt normalfordelt, selvom man har erstattet σ2
med S 2. Beslutningsreglen er dermed den samme som i tilfældet med
den kendte varians. Det gælder som regel, at den approksimative for­
deling a f en teststatistik ikke ændrer sig, når man erstatter en ukendt
varians med en estimator for variansen.
14.3.3
Normalfordelte observationer, kendt varians
Når observationerne i stikprøven er normalfordelte, kan vi naturligvis
stadig bruge de generelle resultater fra de to foregående afsnit. Vi kan
dog typisk også anvende mere præcise og derfor bedre resultater.
Når σ2 er kendt, fandt vi i afsnit 14.2, at Z er eksakt normalfordelt.
Dermed er beslutningsreglen nøjagtig som i de to foregående delafsnit
med den ene forskel, at fordelingen a f teststatistikken nu er eksakt, og
dermed er testen også anvendelig ved små stikprøver.
14.3.4
Normalfordelte observationer, ukendt varians
Når σ2 er ukendt og erstattes a f S2, bliver teststatistikken i dette tilfælde
eksakt t-fordelt med n – 1 frihedsgrader under nulhypotesen.20 Den kan
dermed også anvendes ved små stikprøver. t-fordelingen ligner stan­
dardnormalfordelingen og blev beskrevet i kapitel 13. I tabel 3 bagerst
i bogen findes udvalgte fraktiler for t-fordelingen. Ofte kalder man test­
statistikken for T i dette tilfælde for at indikere, at med ukendt varians
og normalfordelte observationer er teststatistikken eksakt t-fordelt.
20 I dette tilfælde behandler vi ikke fordelingen af Z under alternativhypotesen. For interesserede kan det
dog oplyses, at fordelingen af Z under alternativhypotesen er en såkaldt ikke-central t-fordeling.
Eksempel 14.8: Stikprøve fra normalfordeling – del 6
I eksempel 14.5 var det realiserede stikprøvegennemsnit = 2,85. An­
tag nu, at variansen er ukendt, og at den realiserede stikprøvevarians er
s2 = 13,6. Det medfører, at den realiserede teststatistik bliver:
Teststatistikken er t-fordelt med 12–1 frihedsgrader under nulhypote­
sen. Med et signifikansniveau på α = 0,05 bliver den kritiske værdi:
cv = t0,95 ( 11) = 1,80. Da z < cv, accepterer vi nulhypotesen i dette til­
fælde.
■
I eksemplet ses det, at den kritiske værdi er større, når man bruger
t-fordelingen i stedet for standardnormalfordelingen, fordi variansen er
ukendt. Forklaringen på dette er, at den ukendte varians mindsker in­
formationen i teststatistikken, og man derfor skal have stærkere indicier
for at kunne forkaste nulhypotesen ved et givet signifikansniveau.
14.4
Simple og sammensatte hypoteser om en middelværdi
I dette afsnit ser vi på andre hypoteser om middelværdien end dem,
vi betragtede i afsnittene 14.2 og 14.3. Vi fokuserer i dette afsnit på
tilfældet, hvor vi har en simpel tilfældig stikprøve med normalfordelte
observationer, X i ~ Ν (μ, σ 2), hvor variansen er kendt. Når variansen er
ukendt, udskifter man den blot med stikprøvevariansen i udregningen
a f teststatistikken og anvender t-fordelingen. Og når observationerne
ikke er normalfordelte, holder fordelingen a f teststatistikken kun ap­
proksimativt.
Man skelner mellem to typer a f hypoteser. Man kalder en hypotese
for simpel, hvis der kun er én værdi a f parametrene, som opfylder hy­
potesen. For eksempel er hypotesen μ = μ 0 en simpel hypotese, fordi
der kun er én værdi a f middelværdien, som opfylder hypotesen. Ofte
har man i praksis ikke en teori, som medfører så præcise hypoteser.
Hypotesen μ ≠ μ 0 siger fx kun, at middelværdien ikke er lig med μ0, og
hypotesen er derfor opfyldt for alle andre værdier a f middelværdien.
Man kalder en hypotese, som er opfyldt for mere end én værdi a f pa­
rametrene, for en sammensat hypotese. I de foregående afsnit var både
nul- og alternativhypotesen simple hypoteser.
14.4.1
Simpel nulhypotese og sam m en sat dobbeltsidet alternativhypotese
En typisk hypotese inden for samfundsvidenskab er, at der er en effekt
a f et bestemt politisk indgreb. Uden indgrebet ved man, at middelvær­
dien er μ0 Hvis der er en effekt a f indgrebet, er middelværdien nu for­
skellig fra μ 0. Når man ønsker at undersøge, om der er en effekt, sætter
man typisk dette som alternativhypotesen. Derfor er hypoteserne:
Η0:·μ = μ0
Η 1:· μ ≠μ0
Alternativhypotesen er sammensat, fordi mange værdier a f middelvær­
dien tilfredsstiller hypotesen, og den kaldes også dobbeltsidet, fordi
værdier på begge sider a f nulhypotesen tilfredsstiller
alternativhypotesen.
Vi bruger samme hypotesemål og teststatistik som tidligere. Hypo­
tesemålet er således h (μ ) = μ – μ 0. Hvis man indsætter den sande værdi
af middelværdien, som i praksis er ukendt, er hypotesemålet kun lig
med 0, når nulhypotesen er sand, hvorimod det altid er forskelligt fra 0,
når nulhypotesen er falsk. Hypotesemålet kan derfor bruges til at skelne
mellem nul- og alternativhypotesen. Det estimerede hypotesemål ind­
går i teststatistikken på samme måde som tidligere:
Teststatistikken følger også samme fordeling som tidligere:
Beslutningsreglen skal afspejle, at både middelværdier større end μ0 og
middelværdier mindre end μ0 tilfredsstiller alternativhypotesen. Dette
ræsonnement medfører, at vi forkaster nulhypotesen, når værdien af
teststatistikken er langt fra 0, enten i positiv eller i negativ retning. Vi
får derfor to kritiske værdier, cv1 og cv2. Beslutningsreglen er derfor:
accepter
H 0 hvis cv1 ≤ Z ≤ cv2
forkast H 0 hvis Z < cv1 eller Z > cv2
Da Z under nulhypotesen er standardnormalfordelt, og denne fordeling
er symmetrisk omkring 0, vælger vi de to kritiske værdier således, at
cv1 = c–v2 Som ovenfor bruger vi signifikanssandsynligheden, a, til at
fastsætte de endelige værdier a f cv1 og cv2 For at gøre dette skal man
løse:
P (type-I-fejl) = P (Z < cv1 | μ = μ 0) + P (Z > cv2 | μ = μ 0) = α
Løsningen er at sætte cv1 = zα/2 og cv2 = z 1–α/2, hvor Zα/2 og Z 1–α/2 er hen­
holdsvis α/2- og ( 1 – α / 2 )-fraktilen i standardnormalfordelingen. Figur
14.2 illustrerer tilfældet med et signifikansniveau på 0,05.
Figur 14.2:
Kritiske
værdier af Z
ved α = 0,05
Da alternativhypotesen er sammensat, er der mange værdier a f μ, som
vil tilfredsstille alternativhypotesen. For enhver a f disse værdier kan
man beregne sandsynligheden for en type-II-fejl. Man kan da opfatte
sandsynligheden for en type-II-fejl, β, som en funktion a f den sande
middelværdi μ og skrive den som b (μ ) . Da 1 – β er styrken a f en test,
kalder man 1 – β (μ ) for styrkefunktionen.
Eksempel 14.9: Stikprøve fra normalfordeling – del 7
Antag, at vi i eksempel 14.5 i stedet vil teste nulhypotesen imod
H 1: μ ≠ 1. Med et valgt signifikansniveau på 0,05 bliver de kritiske vær­
dier: Z0,05/2 = – 1,96 og Z 1–0,05/2 = 1,96. Beslutningsreglen bliver derfor:
accepter
H 0 hvis
– 1,96 ≤ Z ≤ 1,96
forkast
H 0 hvis Z < – 1,96 eller Z > 1,96
Den realiserede teststatistik var z = 1,60. Vi accepterer derfor nulhypo­
tesen.
Sandsynligheden for at begå en type-II-fejl afhænger a f den sande
værdi under alternativhypotesen. Hvis den sande værdi er μ = 4, kan vi
udregne sandsynligheden for en type-II-fejl ved hjælp a f vores viden
om Z ’s fordeling:
P(type-II-fejl | μ = 4) = P (–1,96 ≤ Z ≤ 1,96 | μ = 4)
= Φ ( –0,6381) – Φ ( –4,5581) = 0,2611 – 0 = 0,2611
■
14.4.2
Simpel nulhypotese og sam m en sat enkeltsidet alternativhypotese
Ovenfor havde vi en alternativhypotese, som ikke skelnede mellem, om
middelværdien var større eller mindre end den hypotetiske værdi under
nulhypotesen. Når man har en teori, som fx siger, at der er en positiv
effekt a f et initiativ, er fokus imidlertid kun på, om middelværdien er
større end middelværdien under nulhypotesen. Det leder frem til hypo­
teserne:21
Η0:μ = μ0
Η 1: μ > μ 0
Alternativhypotesen er her tilfredsstillet a f alle værdier a f middelværdi­
en, som er større end μ 0. Derfor er alternativhypotesen stadig sammen­
sat, da flere værdier a f μ tilfredsstiller H 1 men nu er den enkeltsidet,
da kun middelværdier i én retning fra nulhypotesen tilfredsstiller H 1.
Beslutningsreglen er derfor magen til beslutningsreglen i afsnit 14.2,
hvor vi testede H0: μ = μ 0 imod Η 1 : μ = μ 1 i tilfældet μ 0 < μ 1 Beslut­
ningsreglen er:
accepter
H 0 hvis Z ≤ Z 1–α
forkast H0 hvis Z > Z 1–α
Havde hypoteserne i stedet været:
H 0 : μ = μ0
2 1 Bemærk, at der her er værdier a f μ , som hverken er inkluderet i nulhypotesen eller alternativhypotesen,
nemlig alle de negative værdier. Det er således implicit antaget, at disse værdier ikke er relevante.
Η 1: μ < μ0
var beslutningsreglen blevet:
accepter
H 0 hvis Z ≥ Z α
forkast H 0 hvis Z < Z α
Den eneste forskel mellem situationerne ovenfor og situationen i afsnit
14.2 er, at der nu er mange værdier a f middelværdien, som tilfredsstiller
alternativhypotesen. Man kan derfor udregne sandsynligheden for en
type-II-fejl for hver a f disse værdier.
Figur 3 opsummerer de tre situationer med sammensatte alternativ­
hypoteser, og hvordan man finder den eller de kritiske værdier i hvert
enkelt tilfælde.
Figur 14.3:
Kritiske
værdier ved
dobbeltsidet og
enkeltsidet H1
14.4.3
Sam m ensat nulhypotese
Nogle gange er nulhypotesen a f formen H0 : μ ≤ μ 0 over for en alterna­
tivhypotese a f formen H1 : μ > μ0. Denne nulhypotese er en sammensat
hypotese, da flere værdier a f middelværdien tilfredsstiller nulhypote­
sen. Fremgangsmåden ved test a f denne nulhypotese er den samme som
ved test a f H0 : μ = μ0 vs. H1 : μ > μ0. Når vi ikke på forhånd kan ude­
lukke, at middelværdien kan være mindre end μ0, så er en sammensat
nulhypotese a f formen H0 : μ ≤ μ0 en mere passende specifikation af
nulhypotesen end H0 : μ = μ0, når alternativhypotesen er H1 : μ > μ0.
Med en sammensat nulhypotese ønsker vi at kontrollere sandsyn­
ligheden for en type-I-fejl, uanset hvilken værdi a f μ under nulhypo­
tesen der er den sande. Sandsynligheden for at begå en type-I-fejl for
en værdi a f μ < μ 0 er dog mindre end sandsynligheden for at begå en
type-I-fejl, hvis μ = μ 0, fordi afstanden til den kritiske værdi er større i
det første tilfælde. Det er derfor tilstrækkeligt at finde den kritiske vær­
di for tilfældet, hvor H0 : μ = μ 0. Denne er den samme som ved test af
H0 : μ = μ 0 imod Η 1 : μ > μ 0.
Tilsvarende vil en test a f nulhypotesen, H0 : μ ≥ μ 0, imod
alternativ­hypotesen, Η 1 : μ < μ 0, foregå på samme måde som en test a f nulhypo­
tesen, H0 : μ = μ 0, imod alternativhypotesen, H 1 : μ0.
14.5
Test af middelværdi med Bernoullifordelte observationer
Vi har allerede set på det specialtilfælde, hvor vi antager, at observati­
onerne i stikprøven er normalfordelte. I dette afsnit ser vi på en anden
praktisk relevant situation, nemlig hvor stikprøven er udtrukket fra en
Bernoullipopulation. En test a f middelværdien i en Bernoullipopulation
er det samme som en test a f andelen af succeser i populationen.
Antag, at observationerne i stikprøven er Bernoullifordelte med pa­
rameteren p. Hypoteserne er:
Η0 :μ = p =p 0
Η0 : μ=p>p0
Fordi observationerne er Bernoullifordelte, ved vi, at variansen a f de
enkelte observationer i stikprøven er: V(X i) = p · (1 – p ). Under H0 er
variansen derfor: σ2 = p 0 · ( 1 – p 0). Dette udtryk kan vi bruge i stedet for
σ2 i teststatistikken:
Når n er stor (n > 20), bruger man som før det generelle resultat baseret
på den centrale grænseværdisætning, at Z er approksimativt standard­
normalfordelt under H0.
Eksempel 14.10: Kunder i supermarkedet
En supermarkedskæde har foretaget en undersøgelse af, hvor stor en
andel af befolkningen der handler hos dem. Ud af 400 adspurgte per­
soner svarede 116, at de handlede hos den pågældende kæde. Ejerne af
supermarkedet ønsker at afklare, om de heraf kan slutte, at mere end ¼
a f befolkningen handler hos dem. De ønsker derfor at teste: H0 : p ≤ ¼
over for H1 : p > ¼, hvor p er andelen, der handler hos kæden. Til dette
formål anvender de den ovenstående teststatistik. Den kritiske værdi af
denne ved et 5 %-signifikansniveau er: Z0,95 = 1,64, idet alternativhypo­
tesen er enkeltsidet. Værdien a f teststatistikken udregnes til:
Supermarkedet kan derfor forkaste H0, og ejerne kan således konklude­
re, at mere end ¼ a f befolkningen handler hos dem.
■
Det er også muligt at udregne de eksakte sandsynligheder for Z ved
hjælp a f binomialfordelingen. Det skyldes, at stikprøvegennemsnittet
er en (vægtet) sum a f Bernoullifordelte variabler. Hvis man vil beregne
de eksakte sandsynligheder for Z, kan det gøres ved hjælp a f følgende
omskrivning:
Da
er en sum a f uafhængige Bernoullifordelte stokastiske vari­
abler, så er:
Men medmindre stikprøven er meget lille, bruger man som regel resul­
tatet ovenfor baseret på den centrale grænseværdisætning.
I dette afsnit viser vi en alternativ måde at udtrykke beslutningsreglen
på. I stedet for at anvende en kritisk værdi kan man bruge en såkaldt
p-vœrdi. En p-værdi er en smule mere informativ end en kritisk værdi,
som vi skal se.
Vi betragter først det gennemgående eksempel fra afsnit 14.2. Hy­
poteserne om middelværdien er: H0 : μ = μ 0 vs. H1 : μ = μ1, hvor μ0 = μ1.
Stikprøven indeholder normalfordelte observationer med kendt varians,
σ2. Teststatistikken er derfor:
som følger fordelingen:
Som før forkaster vi nulhypotesen, hvis værdierne a f teststatistikken er
store, og accepterer den, hvis værdierne er små. Beslutningsreglen var
før:
accepter
H0 hvis Z ≤ cv
forkast H 0 hvis Z > cv
I stedet for at fastsætte den kritiske værdi starter vi med den realiserede
værdi a f teststatistikken, z . Dernæst finder vi sandsynligheden for at
observere en værdi a f teststatistikken, der er mindst lige så ekstrem
i retning a f alternativhypotesen som z , givet at nulhypotesen er sand.
Denne sandsynlighed kaldes p-værdien og er givet ved:
p-væ rdi = P (Z > z |H0 sand)
p-værdien udtrykker sandsynligheden for at komme til at begå en typeI-fejl, hvis man anvender den realiserede værdi a f teststatistikken, z ,
som kritisk værdi, dvs. hvis man forkaster nulhypotesen ved værdier af
Z, der er større end eller lig med z .
Eftersom Z er standardnormalfordelt, kan p-værdien i ovenstående
tilfælde udregnes som:
p-værdi = 1 – Φ (z )
Hvis nulhypotesen er sammensat, udregnes p-værdien, ved at man an­
vender den værdi a f μ under H0, som giver den største sandsynlighed for
en type-I-fejl. Nøjagtig som vi gjorde i afsnit 14.4.3.
Beslutningen kan nu foretages baseret på signifikansniveauet, α,
som er den sandsynlighed for type-I-fejl, man er villig til at begå:
accepter
H 0 hvis p-værdi ≥ α
forkast H 0 hvis
p-værdi < α
Eksempel 14.11. Stikprøve fra normalfordeling – del 8
I eksempel 14.5 var den realiserede teststatistik z = 1,60. Dermed bliver
p-værdien:
p-værdi = 1 – Φ ( 1,60) = 1 – 0,9452 = 0,0548
Hvis signifikanssandsynligheden er α = 0,05, accepterer man altså nul­
hypotesen. Dette var også konklusionen i eksempel 14.5.
■
I situationen, hvor μ 0 > μ 1 er p-værdien givet ved:
p-værdi = Φ (z )
når Z er standardnormalfordelt. Beslutningsreglen er den samme som
ovenfor.
Hvis alternativhypotesen er dobbeltsidet, Η 1 : μ ≠ μ 0, er p-værdien:
p-værdi = P (Z < –|z | eller Z > |z | |H0 sand)
Når Z er standardnormalfordelt, kan denne sandsynlighed udregnes
som:
p-værdi = Φ(– |z |) + 1 – Φ(|z |) = 2·Φ(– |z |)
Eksempel 14.12. Stikprøve fra normalfordeling – del 9
I eksempel 14.5 var den realiserede teststatistik z = 1,60. Dermed er
p-værdien for H 1 : μ ≠ μ 0 givet ved:
p-værdi = Φ(– 1,60) + 1– Φ(1,60) = 0,0548 + 1– 0,9452 = 0,1096
Hvis signifikanssandsynligheden er α = 0,05, accepterer man igen nul­
hypotesen.
■
I det generelle tilfælde, hvor man ikke kender fordelingen a f popula­
tionen, udskifter man variansen, σ2, med stikprøvevariansen, S2, i be­
regningen a f teststatistikken. Da teststatistikken i dette tilfælde kun er
approksimativt normalfordelt, så er p-værdierne, udregnet som ovenfor,
også kun approksimative.
14.7
Opsummering af hypotesetest af middelværdi
Resultaterne fra de foregående afsnit er opsummeret i den følgende boks:
Test af middelværdi med simpel tilfældig stikprøve, H0 : μ = μ 0
Alternativhypoteser
Teststatistik og fordeling under H0
Det generelle tilfælde: Stor stikprøvestørrelse (afsnit 14.3.1 og 14.3.2)
p-værdi:
2 · Φ(–|z |)
p-værdi:
1 – Φ(z)
p-værdi:
Φ(z)
Kritiske værdier:
Zα/2 o g Z1–α/2
Kritisk værdi:Z1
–α
Kritisk værdi:
Zα
Normalfordelte observationer (afsnit 14.3.3 og 14.3.4)
p-værdi:
2 · Φ(–|z |)
p-værdi:
1 – Φ(z)
p-værdi:
Φ(z)
Kritiske værdier:
Kritisk værdi:Z1
–α
Kritisk værdi:
Zα/2 og Z1–α/2
Zα
→
p-værdi:
2 · P ( T < – |t|)
K ritiske værdier:
tα/2(n–1) og
p-værdi:
P ( T > t)
p-værdi:
K ritisk værdi:
K ritisk værdi: 1
)α
t (n–
P(T > t)
tt–α(n–1)
t1–α/2(n–1)
Test af en andel: X i ~ Ber(p) og stor stikprøvestørrelse (afsnit 14.5)
p-værdi:
p-værdi:
p-værdi:
2 · Φ(– |z |)
1 – Φ(z )
Φ(z )
K ritiske værdier:
K ritisk værdi: Z1
-α
K ritisk værdi:
Zα
Zα/2 og Z1-α/2
Noter:
1. z og t er de realiserede værdier af teststatistikken.
2. α er signifikansniveauet.
3. Z αer α-fraktilen fra standardnormalfordelingen.
4. tα(n – 1) er α-fraktilen fra t-fordelingen med n – 1 frihedsgrader.
5. Søjlen H1 : μ > μ 0 dækker også over tilfældet H1 : μ = μ 1 når μ0 < μ 1.
6. Søjlen Η1 : μ < μ0 dækker også over tilfældet H1 : μ = μ1 når μ0> μ1
Styrken ved test af middelværdi H0 : μ = μ 0
Alternativhypoteser
Teststatistik og fordeling under H1
Det generelle tilfælde: Stor stikprøvestørrelse
Bemærk, at nogle foretrækker at bruge T-testen i stedet for Z-testen,
når σ2 er ukendt, også selvom observationerne i stikprøven ikke er nor­
malfordelte. Når stikprøvestørrelsen, n, er stor, som det må kræves, når
observationerne ikke er normalfordelte, er forskellen på t-fordelingen
og standardnormalfordelingen dog ikke særlig stor.
14.8
Valg af stikprøvestørrelse baseret på type-I- og type-II-fejl
I en situation, hvor man kan bestemme stikprøvestørrelsen, kan man
gøre dette baseret på undersøgelsens formål. Hvis det primære formål
er at estimere middelværdien med en bestemt præcision, viste vi i afsnit
13.6, hvordan man bestemmer stikprøvestørrelsen, n. Hvis det primære
formål med undersøgelsen er at teste en hypotese med en bestemt kon­
trol over sandsynlighederne for type-I- og type-II-fejl, viser vi i dette
afsnit, hvordan man kan vælge stikprøvestørrelsen.
H
μ
=
0:μ0
Vi betragter som i afsnit 14.2 en test a f de to hypoteser:
For et givet valg af α og derfor Z 1–α kan vi bruge ovenstående ligning til
at finde ud af, hvor stor en stikprøvestørrelse, n, der skal til for at opnå
et givet niveau af β.
Da μ 0 < μ 1 kan β ikke være større end 1 – α , fordi det andet led i
parentesen ovenfor er positivt. Fra definitionen a f en fraktil kan man
se, at udtrykket inden i parentesen må være lig m ed β-fraktilen fra stan­
dardnormalfordelingen:
H 1 : μ = μ 1 n, og dermed få:
Derefter kan vi isolere stikprøvestørrelsen,
hvor μ 0 < μ 1 I afsnit 14.2.5 fandt vi sammenhængen mellem α o g β til
Dette giver os den stikprøvestørrelse, der skal til for at opnå et givet
niveau a f α og β, hvor β < 1 – α.
Eksempel 14.13: Stikprøve fra normalfordeling – del 10
Hvis man i eksempel 14.3 skal beslutte størrelsen a f stikprøvestørrelsen
således, at sandsynligheden for en type-I-fejl er højst 0,05 og sandsyn­
ligheden for en type-II-fejl er højst 0 ,10, skal man som minimum bruge
følgende stikprøvestørrelse:
Man skal altså udtage en stikprøve med mindst 35 observationer for
at holde sandsynlighederne for type-I- og type-II-fejl på de ønskede
niveauer.
■
Fra formlen kan man se, at man kan nøjes med en mindre stikprøvestør­
relse, hvis der er længere imellem μ 0 og μ 1 Det er også tilfældet, at en
lavere varians, σ2, muliggør en mindre stikprøvestørrelse. Endelig ses
det også, at jo højere α og β, man vil tolerere, desto mindre stikprøve­
størrelse.
Beregning a f stikprøvestørrelse baseret på type-I- og typeII-fejl:
1. Beslut størrelserne af α οg β
2. Find fordelingerne a f teststatistikken under H0 og H 1
3. Udregn sammenhængen mellem α og β
4. Ud fra sammenhængen mellem α og β findes stikprøvestør­
relsen
14.9
Test af varians
I dette afsnit ser vi på hypotesetest a f en anden populationsstørrelse,
nemlig variansen, σ2. I nogle finansielle teorier måler variansen, σ2, ri­
sikoen ved en investering. I en sådan situation kan man ofte være inte­
resseret i at finde ud af, om variansen antager en bestemt værdi, eller
om den er større eller mindre end en given værdi. Hvis man studerer
indkomstulighed, kunne det tilsvarende være interessant at teste, om
variansen på indkomst i den danske befolkning har en vis størrelse. En
test a f en varians kan også indgå som en del a f en test af en større teori.
I alle disse situationer har vi altså behov for at kunne teste en hypotese
om variansen, σ2, i en fordeling.
Vi betragter følgende nulhypotese og alternativhypotese:
Η0 : σ2 Η
=1:σ02
σ2≠σ02
hvor σ 2 er værdien a f variansen ifølge vores nulhypotese. Vi skal finde
et hypotesemål, som kan skelne mellem nulhypotesen og altemativhy­
potesen. Det har vist sig, at et hensigtsmæssigt hypotesemål er: σ2 / σ02.
Dette mål er lig med 1, hvis nulhypotesen er sand (σ2 = σ02), hvorimod
det er forskelligt fra 1, hvis alternativhypotesen er sand (σ2 ≠ σ02). Derfor
vil værdier både større end 1 og mindre end 1 blive betragtet som bevi­
ser mod nulhypotesen, når alternativhypotesen som her er dobbeltsidet:
Η1 : σ2 ≠ σ02. Er altemativhypotesen derimod enkeltsidet, Η1 : σ2 > σ02
(eller Η1 : σ2 < σ02), vil kun store (eller små) værdier i forhold til 1 være
beviser mod nulhypotesen.
Til implementeringen a f testen erstatter vi først de ukendte størrelser
i hypotesemålet, σ2 / σ02, med skøn. Et skøn på σ2 er stikprøvevariansen,
S2. Det sidste, vi skal gøre, er at opstille en teststatistik og finde dens
fordeling under H0. Teststatistikken er her givet som:
Årsagen til valget a f denne form er blandt andet, at Y er approksimativt
χ2-fordelt med n – 1 frihedsgrader under H0 ved store stikprøvestørrel­
ser. Vi beskrev χ2-fordelingen i kapitel 12. Fordi vi ikke har forudsat
noget om fordelingen a f observationerne i stikprøven, er χ2-fordelingen
kun en approksimation a f den eksakte, men ukendte fordeling a f teststa­
tistikken, Y, under nulhypotesen. Det vil sige, at den eksakte fordeling
a f Y kun ligner χ2-fordelingen, når stikprøvestørrelsen, n, er stor.
Som ved test a f en middelværdi ovenfor eksisterer der specialtilfæl­
de, hvor man kan udlede den eksakte fordeling a f Y under H0. Et sådant
tilfælde er, når observationerne i stikprøven er normalfordelte. I dette
tilfælde er fordelingen af Y under H0 præcis lig med en χ2-fordeling med
n – 1 frihedsgrader uanset stikprøvestørrelsen.
Test af varians ved simpel tilfældig stikprøve Η0 : σ2 = σ02
Alternativhypoteser
Teststatistik og fordeling under H0
Stor stikprøvestørrelse
K ritiske værdier:
Kritisk værdi:χ2
)1–α(n–
1 Kritisk værdi:
χ21–α/2(n–1)ogχ2α/2(n–1)
χ2α(n–1)
Normalfordelte observationer
Kritiske værdier:
Kritisk værdi:
χ2α/2(n–1) og
χ2α/2(n–1)
χ21–α(n–1)
Kritisk værdi:χ2
)1 α(n–
Noter:
1. α er signifikansniveauet.
2. χ2α(n – 1) er α-fraktilen fra χ2-fordelingen med n – 1 frihedsgrader.
Eksempel 14.14: Aktieudbytter
En aktieanalytiker ønsker at teste variansen på aktieudbytter fra virk­
somheder i servicebranchen og har derfor udtrukket en stikprøve på 51
observerede udbytter. Ud fra de 51 observationer har han beregnet stikprøvevariansen til S2 = 11,59. Han ønsker nu at teste følgende hypotese
om variansen, σ2:
Η0 : σ2 = 10
Η1 : σ2 > 10
Værdien a f teststatistikken bliver i dette tilfælde:
Hvis han ønsker et signifikansniveau på 5% , skal han anvende 0,95-fraktilen fra χ2-fordelingen med 50 frihedsgrader, idet alternativhypotesen
er enkeltsidet. Fra tabel 4 i bogens appendiks ses denne at være 67,5.
Han kan altså ikke afvise sin nulhypotese om, at variansen er 10, til for­
del for en alternativhypotese, som siger, at variansen er større end 10.
■
14.10
Statistisk signifikans versus reel signifikans
Indtil nu har vi fokuseret på, om man skal acceptere nul- eller alterna­
tivhypotesen. Som vi også har nævnt, placerer man typisk den teori,
man vil teste, som alternativhypotesen. Man siger så, at et resultat er
signifikant, hvis man accepterer alternativhypotesen. Denne form for
signifikans kalder man statistisk signifikans.
Man kan fristes til at tro, at et statistisk signifikant resultat nødven­
digvis også er af reel vigtighed. Her skal man dog huske på funda­
mentet for en hypotesetest. En hypotesetest er baseret på en stikprøve,
og den realiserede teststatistik er påvirket a f stikprøveusikkerhed. Det
medfører blandt andet, at det er muligt, at et resultat kan være statistisk
signifikant, når stikprøven er stor, mens det ikke er det, når stikprøven
er lille. Men om resultatet også er vigtigt i praksis, også kaldet reel sig­
nifikans, er en helt anden historie.
Eksempel 14.15: Månedlige indkomster
Antag, at en nulhypotese er, at middelindkomsten i et område er
50.000 kr./måned, mens sandheden er, at middelindkomsten er
50.070 kr./måned. Måske er stikprøvegennemsnittet lig med 50.060 kr./
måned. For et givet signifikansniveau vil man sandsynligvis forkaste
nulhypotesen, hvis blot stikprøven er tilpas stor. Dermed er resultatet
statistisk signifikant. Men er det også signifikant rent økonomisk, at
middelindkomsten er 60 kr. mere per måned, end man troede? I et andet
område er den sande middelindkomst måske 30.000 kr./måned. Hvis
man kun har en lille stikprøve fra dette område og får et stikprøvegen­
nemsnit på 35.000 kr./måned, så er dette måske ikke engang nok til
at forkaste nulhypotesen om en middelindkomst på 50.000 kr./måned.
Men er denne forskel økonomisk vigtig?
■
Vi vil pointere to ting med eksemplet. For det første, at statistisk sig­
nifikans er et begreb, som knytter sig til stikprøveusikkerheden. Reel
signifikans er en vurdering a f de samfundsmæssige (eller andre) kon­
sekvenser a f problemstillingen, man undersøger. For det andet, at valg
a f signifikansniveau bør afhænge a f stikprøvestørrelsen såvel som af
testens styrke.
14.11
Sammenhæng mellem konfidensintervaller og hypotesetest
Afslutningsvis diskuterer vi den tætte sammenhæng mellem et
(1 – α )-konfidensinterval, som var emnet i kapitel 13, og en hypotese­
test med et signifikansniveau på α.
Lad os forestille os, at vi ønsker at teste en nulhypotese om en
middelværdi, H0 : μ = μ 0, over for en alternativhypotese a f formen:
H 1 : μ ≠ μ 0. Et (1 – α)-konfidensinterval for μ vil indeholde den sande μ
med sandsynligheden 1 – α. Hvis nulhypotesen er sand, vil konfidens­
intervallet derfor indeholde μ 0 med sandsynligheden 1 – α. Med andre
ord: sandsynligheden for at konfidensintervallet ikke indeholder μ0, når
nulhypotesen er sand, er α. Men dette er også sandsynligheden for at
forkaste nulhypotesen i vores test, givet at nulhypotesen faktisk er sand
– altså sandsynligheden for at begå en type-I-fejl.
Vi kunne derfor lige så godt teste vores nulhypotese ved at opstille et
( 1 – α)-konfidensinterval for μ og undersøge, om μ 0 ligger i dette inter­
val. Hvis ikke, så kan vi forkaste H0. Dette svarer fuldstændigt til, hvad
hypotesetesten gør. Dette er ikke så overraskende, hvis man tænker på.
at konfidensintervallet blev konstrueret ud fra fordelingen a f det stan­
dardiserede stikprøvegennemsnit, Z , nøjagtig ligesom hypotesetesten i
dette kapitel blev baseret på fordelingen af det standardiserede stikprø­
vegennemsnit under H0.
Den intuitive forskel på de to fremgangsmåder er følgende: Ved
hypotesetesten måler teststatistikken direkte afstanden mellem stikprø­
vegennemsnittet,
og værdien under nulhypotesen, μ 0. Hvis denne
afstand er for stor (teststatistikken er stor), må nulhypotesen forkastes.
Dette er baseret på fordelingen a f teststatistikken, som kommer fra for­
delingen af
Ved et konfidensinterval opstiller man et interval rundt
om
baseret på fordelingen af
og undersøger, om μ0 ligger i dette
interval. Vi undersøger altså indirekte afstanden mellem
og μ0.
14.12
Opgaver
1. Repetitionsspørgsmål:
a) Forklar kort, hvad man forstår ved en nulhypotese og en alterna­
tivhypotese.
b) Hvad vil det sige at begå henholdsvis en type-I- og en type-IIfejl? Giv et eksempel.
c) Hvad forstår vi ved signifikansniveauet?
d) Gør kort rede for de forskellige trin i opbygningen a f en hypo­
tesetest.
e) Hvad er fortolkningen a f p-værdien og a f de kritiske værdier?
f) Forklar forskellen på en enkeltsidet og en dobbeltsidet alternativ­
hypotese. Hvilken betydning har dette for udregning af p-værdier
og kritiske værdier?
g) Hvad forstår man ved en tests styrke?
h) Gør kort rede for, under hvilke forudsætninger de forskellige
teststatistikker kan anvendes, når vi ønsker at teste en hypotese
om en middelværdi. Angiv også deres fordelinger under H0.
i) Forklar kort, hvordan man kan vælge sin stikprøvestørrelse, så
man kan opnå bestemte sandsynligheder for type-I- og type-IIfejl.
j) Gør rede for, hvilken teststatistik man anvender til at teste en
hypotese om en varians.
k) Hvad er forskellen på statistisk og reel signifikans?
1) Gør kort rede for sammenhængen mellem hypotesetest og kon­
fidensintervaller.
2. Antag, at vi har en simpel tilfældig stikprøve på 100 normalfordelte
observationer, (X 1,...,X100), hvor X i~ N (μ , σ2 = 24). Stikprøvegennem­
Vi ønsker nu at teste følgende nul­
snittet er beregnet til:
hypotese: H0 : μ = 20 over for den alternative hypotese: Η1 : μ ≠ 20.
a) Opstil den relevante teststatistik.
b) Angiv teststatistikkens fordeling under H0.
c) Beregn værdien a f teststatistikken samt p-værdien.
d) Kan vi forkaste H0ved et 5 %-signifikansniveau? Ved et 10 %-signifikansniveau?
e) Find også p-værdien, hvis alternativhypotesen i stedet er:
Η 1 : μ > 20.
f) Kan vi nu forkaste H0 ved et 5 %-signifikansniveau?
3. Sodavandsfabrikken fra opgave 2 i kapitel 12 ønsker ved hjælp af
sin simple tilfældige stikprøve på 18 sodavand at teste en nulhypo­
tese om, at middelindholdet a f en sodavand er 25 cl. Det antages i
denne forbindelse, at indholdet i en tilfældigt udvalgt sodavand er
normalfordelt med en varians på 0,02.
a) Opstil teststatistikken.
b) Hvad er fordelingen a f teststatistikken under H0?
c) Beregn værdien af teststatistikken samt p-værdien ved en dob­
beltsidet test af H0.
d) Hvad er de kritiske værdier a f teststatistikken ved en dobbeltsidet
test med et 5 %-signifikansniveau? Kan vi forkaste H0 ved en
sådan test?
e) Antag i stedet, at vi anvender en enkeltsidet test, hvor alternativ­
hypotesen er: μ > μ0. Find de kritiske værdier ved en test med et
5 %-signifikansniveau og med et 10 %-signifikansniveau.
f) Kan vi forkaste H0 i disse tilfælde?
Antag nu, at variansen på indholdet a f en tilfældigt udvalgt soda­
vand er ukendt.
g) Opstil teststatistikken for dette tilfælde.
h) Hvad er fordelingen af teststatistikken under H0?
i) Beregn værdien a f teststatistikken samt p-værdien ved en dob­
beltsidet test a f H0.
j) Find de kritiske værdier ved en dobbeltsidet test med et 5 %-signifikansniveau. Kan vi forkaste H0?
k) Hvad hvis vi i stedet anvender en enkeltsidet test med et 5 %-signifikansniveau, hvor alternativhypotesen er: μ > 25?
4. Sundhedsplejersken fra opgave 3 i kapitel 10 udtager en simpel til­
fældig stikprøve på 100 børnehøjder i en kommune med 3431 børn.
4 cm, og at stikprø­
Hun finder, at stikprøvegennemsnittet er
vevariansen er S2 = 62,32. Hun ønsker nu at teste, om middelværdi­
en i populationen er lig med 140 cm.
a) Opskriv nulhypotesen og alternativhypotesen for denne test, idet
du antager, at hun ønsker at foretage en dobbeltsidet test.
b) Hvad er den relevante teststatistik for dette eksempel?
c) Hvad er fordelingen a f teststatistikken under H0, og under hvilke
antagelser?
d) Hvad er de kritiske værdier ved henholdsvis et 5 %- og et
10 %-signifikansniveau?
e) Beregn værdien a f teststatistikken samt p-værdien.
f) Kan H0 forkastes ved et 5 %-signifikansniveau? Ved et 10 %-signifikansniveau?
g) Antag, at alternativhypotesen i stedet er, at middelhøjden er min­
dre end 140 cm.
h) Ved hvilke signifikansniveauer kan vi nu forkaste H0?
5. I eksempel 1.3 fra kapitel 1 ønskede bilfabrikanten at undersøge, om
der var samme risiko for fejl på fabrikkens nye produktionslinje som
på det oprindelige anlæg, hvor man a f erfaring ved, at fejlprocenten
er 0,8 %. Derfor indsamler fabrikken information om 800 a f de pro­
ducerede biler fra det nye anlæg og finder, at 11 a f dem er behæftet
med fejl. Fabrikken ønsker nu at teste, om denne fejlprocent er sig­
nifikant forskellig fra 0,8 %.
a) Diskutér, om vi med rimelighed kan betragte de 800 biler som en
simpel tilfældig stikprøve.
b) Antag, at der er tale om en simpel tilfældig stikprøve, og lad X.
angive, om den i’te bil i stikprøven er defekt eller ej.
c) Hvilken fordeling følger X i?
d) Opstil nulhypotesen for den test, fabrikken ønsker at udføre.
e) Opstil alternativhypotesen ved en dobbeltsidet test.
f) Hvordan ser teststatistikken ud, og hvad er dens fordeling under
nulhypotesen?
g) Hvad er de kritiske værdier ved et signifikansniveau på 5 %?
h) Udregn værdien af teststatistikken samt p-værdien. Kan vi for­
kaste H0?
i) Hvad er de kritiske værdier ved et signifikansniveau på 10 %?
Kan vi her forkaste H0?
j) Antag, at den relevante alternativhypotese i stedet er, at fejlpro­
centen er højere på det nye anlæg.
k) Find de kritiske værdier a f teststatistikken ved henholdsvis et
5 %- og et 1 %-signifikansniveau.
1) Kan vi forkaste H0 her?
1 5 T e s t af sammenhænge i
kvantitative målinger
I kapitel 14 introducerede vi idéen bag hypotesetest ved at teste hypote­
ser om beskrivende mål (m iddelværdien og variansen) for en fordeling.
M an kan også være interesseret i at teste hypoteser om, hvorvidt to eller
flere fordelinger har de sam m e beskrivende mål. Hvis der er forskel på
et beskrivende mål m ellem to fordelinger, peger det på en mulig sam ­
m enhæ ng m ellem det karakteristikum, som adskiller fordelingerne, og
det karakteristikum, man måler.
Et vigtigt eksempel på en test a f forskelle m ellem to fordelinger er
undersøgelser af, om en behandling har en effekt. Ordet „behandling“
dæ kker her m eget bredere end den snævre m edicinske betydning. En
behandling kan fx være, at en person deltager i et aktiveringstilbud, og
effekten a f behandlingen kan da være indkom sten et år senere. M an kan
da teste, om personer, som har fået behandlingen, tjener m ere end før
behandlingen, eller m an kan sam m enligne dem m ed personer, som ikke
har fået behandlingen. Hvis der er forskel på m iddelværdierne blandt
disse to grupper, antyder det, at behandlingen har en effekt.
Opbygningen a f testene i dette kapitel foregår på sam m e grundlæg­
gende m åde som i kapitel 14. Først definerer vi nul- og alternativhypo­
teserne. Dernæst konstruerer vi et hypotesem ål, som kan skelne mellem
disse hypoteser. Til sidst im plementerer vi testen ved at konstruere en
teststatistik og anvende dens fordeling under nulhypotesen til at bereg­
ne kritiske værdier eller p-værdier. Baseret på disse afgør vi, om nulhy­
potesen skal forkastes eller accepteres.
I afsnit 15.1 viser vi, hvordan m an kan teste, om m iddelværdierne i
to fordelinger er ens. Dette generaliserer vi i afsnit 15.2 til tilfældet med
m ere end to fordelinger. I afsnit 15.3 betragter vi tre m åder at teste ef­
fekten a f en behandling på. M an kan også teste for forskelle i varianser
m ellem fordelinger, som vi skal se i afsnit 15.4.
15.1
Test af forskel på to middelværdier
M an kan undersøge, om der er en forskel på to grupper i en population,
ved at teste, om de har forskellige middelværdier. For eksempel kan
man teste, om der er en forskel på m ænds og kvinders arbejd sindsats
i hjem m et, når begge har fuldtidsjob. Det kunne også være, at m an vil
teste, om en persons m iddellevetid afhænger af, hvor han/hun er op­
vokset.
Eksempel 15.1: Uddannelsesbaggrund – del 1
En virksom hed har to typer a f ansatte i deres produktionsafdeling: A n­
satte, der har stået i mesterlære, og ansatte, der er udlært på tekniske
skoler. I forbindelse m ed ansættelse a f nye medarbejd ere er virksom he­
den i tvivl om, hvorvidt m esterlære er bedre end tekniske skoler (fordi
ejeren selv var i mesterlære). Den hyrer derfor et konsulentfirm a til at
undersøge, om der er en gennem snitlig produktivitetsforskel på de to
typer a f ansatte.
■
Lad Y angive typen a f element, fx om en ansat person har stået i m ester­
lære (Y = 1) eller gået på teknisk skole ( Y = 2). Typisk angiver vi typen
som 1, 2 osv. Lad X være det karakteristikum , man vil sam m enligne for
de to typer. Vi er da interesserede i at sam m enligne m iddelværdierne i
følgende to betingede fordelinger for X: f (x │y = 1) og f ( x │y = 2 ),
dvs. fordelingen a f X for type 1 og fordelingen a f X for type 2.
Andre eksem pler kunne være det forventede afkast på to aktier eller
den forventede karakter ved to forskellige eksamener. O gså dette kan
formuleres på sam m e m åde, nem lig ved at sam m enligne f (x│y = 1)
m ed f (x |y = 2), hvor X er afkastet (eller karakteren), og Y angiver,
hvilken aktie (eller eksam en) der er tale om.
M iddelværdierne i de to betingede fordelinger, f (x │y = 1) og
f ( x │y = 2), er ukendte. Vi antager, at m an har en simpel tilfældig stik­
prøve m ed n1 observationer fra den første betingede fordeling og n2
observationer fra den anden betingede fordeling.22 Vi antager, at antallet
a f observationer fra hver fordeling er bestem t på forhånd. På den måde
er det ikke stokastisk, hvor m ange observationer m an udtager fra hver
a f de to betingede fordelinger.
22
Ofte siger man, at der er to stikprøver, én fra hver fordeling.
15.1.1
Det generelle tilfælde
Det første punkt i konstruktionen a f en test, som beskrevet i kapitel 14,
er opstillingen a f hypoteserne, i det følgende fokuserer vi på en dob­
beltsidet alternativhypotese:
H0 : μ1 = μ 2
H0 : μ1 ≠ μ2
h v o r μ1 er m iddelværdien a f X i fordelingen f (x |y = 1), og μ 2 er m id­
delværdien a f X i fordelingen f ( x |y = 2 ). Nulhypotesen er, at der ikke
er nogen forskel på m iddelværdierne i de to fordelinger, hvorim od al­
ternativhypotesen siger, at der er en forskel. Størrelsen a f m iddelværdi­
erne er ligegyldig. D et interessante er, om de er ens eller ej. M an kunne
også vælge en enkeltsidet altern ativhypotese, som vi viser i et a f de
følgende eksempler.
N æ ste skridt er at finde et hypotesem ål, som kan skelne m ellem nul­
hypotesen og alternativhypotesen, når man indsætter de sande værdier.
Et hensigtsm æssigt hypotesem ål er her: h (μ 1 μ 2) = μ1 – μ 2. Hvis det­
te hypotesem ål er 0 , når det evalueres i de sande værdier, så er nulhypo­
tesen sand, og ellers er den falsk.
Vi kan erstatte de ukendte størrelser i hypotesem ålet m ed skøn. Lad
( X 1,1, X 2,1, . . . , X n1,1) væ re stikprøven fra den første fordeling, og lad
(X1,2,X2,2,...,Xn2,2) væ re stikprøven fra den anden fordeling. D et første
fodtegn indikerer altså observationsnum m eret, m ens det andet fod­
tegn fortæ ller os, hvilken a f de to fordelinger observationen tilhører.
A ntag desuden, at observationerne er uafhæ ngige på tværs a f grup­
perne.
Både μ 1 og μ 2 er ukendte, m en vi kan bruge stikprøvegennem snit­
tene a f observationerne fra hver fordeling som skøn på henholdsvis
μ1 og μ2
Vi væ lger nu en teststatistik, som ligner teststatistikken brugt til at teste
en hypotese om en m iddelværdi i kapitel 14. Vi dividerer således det
estim erede hypotesem ål,
m ed variansen a f det estimerede hy-
potesem ål. Eftersom observationerne på tværs a f grupperne er uafhæ n­
gige, er stikprøvegennem snittene,
også uafhængige. Derfor
er variansen på det estim erede hypotesem ål givet ved:
hvor σ 12 og σ 22 er varianserne i de to fordelinger. Hvis disse ikke er
kendte, skal de også estimeres. Det kan vi gøre m ed estim atoren for
variansen fra kapitel 12:
hvor S 12 er estim atoren for σ 12, og S 22 er estim atoren for σ 2 .2
Vi er nu klar til at opstille vores teststatistik:
Denne er approksim ativt standardnorm alfordelt under nulhypotesen,
når vi har store stikprøvestørrelser, n1 og n2 p-væ rdier og kritiske væ r­
dier findes derfor ved hjælp a f standardnorm alfordelingen.
15.1.2
Ens v arianser
I nogle situationer kan m an m ed rim elighed antage, at de to ukendte
varianser er ens: σ 12 = σ 22 = σ 2. I disse tilfælde kan m an skrive vari­
ansen a f det estim erede hypotesem ål som:
M an får i denne situation et bedre skøn på σ2, og derm ed
ved at anvende den såkaldte „poolede variansestim ator“ :
Teststatistikken får da følgende udseende:
Denne teststatistik har samme approksim ative fordeling under H0 som
teststatistikken i afsnit 15.1.1.
Eksempel 15.2: Uddannelsesbaggrund – del 2
Konsulentfirm aet fra eksempel 15.1 udtræ kker en simpel tilfældig
stikprøve på 30 observationer blandt de ansatte med m esterlære og 50
observationer blandt de ansatte fra tekniske skoler. Ud fra stikprøven
beregner firmaet følgende to produktivitetsgennem snit:
= 22,54 og
= 19,34 (m ålt som værditilvækst i euro per arbejdstim e) samt stikprøvevarianser: S12 = 19,13 og S22 = 22,25. Firm aet tester følgende
hypoteser:
H 0 : μ1 = μ 2
H0 : μ1 > μ 2
Altem ativhypotesen er således, at personer m ed m esterlære er mere
produktive. V ærdien a f teststatistikken, Z kan udregnes til:
Hvis konsulentfirm aet derim od tror, at de to ukendte varianser er ens, er
væ rdien a f teststatistikken i stedet givet ved:
Fordi alternativhypotesen er enkeltsidet og a f formen H 1 = μ 1 > μ 2,
er det kun store væ rdier a f Z , der vil blive betragtet som bevis m od
nulhypotesen. Ved et 5 % -signifikansniveau er den kritiske værdi derfor
givet ved 0,95-fraktilen fra standardnorm alfordelingen, som er 1,64.
Konsulentfirm aet forkaster derfor H0 og konkluderer, at ansatte m ed
m esterlære er m ere produktive.
15.1.3
Normalfordelte observationer med kendte varianser
Hvis observationerne i de to stikprøver er norm alfordelte m ed kendte
varianser, σ 12 og σ 22, kan m an vise, at teststatistikken:
er eksakt standardnorm alfordelt under nulhypotesen. Dette gælder uan­
set stikprøvestørrelsen og er helt parallelt m ed det resultat, vi fandt i
afsnit 14.3 i forbindelse m ed test a f en hypotese om en enkelt m iddel­
væ rdi.
15.1.4
Normalfordelte observationer med ukendte varianser
Hvis observationerne i de to stikprøver er norm alfordelte, m en nu med
ukendte varianser, kan man vise, at teststatistikken (som nu betegnes
„T“ ):
er approksim ativt t-fordelt m ed n1 + n2 – 2 frihedsgrader under nulhypo­
tesen. Hvis varianserne er ens, anvendes den poolede variansestim ator
fra afsnit 15.1.2. Teststatistikken er da eksakt t-fordelt.
Eksempel 15.3: Uddannelsesbaggrund – del 3
Hvis konsulentfirm aet fra eksempel 15.2 mener, at observationerne i
stikprøven er norm alfordelte, skal det altså anvende 0,95-fraktilen fra
t-fordelingen m ed 30 + 50 – 2 = 78 frihedsgrader i stedet for 0,95-frak­
tilen fra standardnorm alfordelingen. Fordi antallet a f frihedsgrader er
så stort, er de to fraktiler imidlertid begge lig m ed 1,64. Det faktum,
at observationerne i stikprøverne er norm alfordelte, ændrer altså ikke
konsulentfirmaets konklusion i dette tilfælde.
■
15.1.5
Bernoullifordelte observationer
Det sidste specialtilfælde er en situation, hvor observationerne i de to
stikprøver er Bernoullifordelte. Dette kan fx forekom me, hvis m an øn­
sker at teste, om andelen a f en given type er den sam m e i to grupper.
Nulhypotesen er her: H 0 : p 1= p 2, hvor p 1 og p 2 er andelene a f den givne
type i henholdsvis gruppe 1 og gruppe 2. Det kan også være, at man
ønsker at teste, om sandsynlighederne, p 1 og p 2, for at få „plat“ m ed to
forskellige (skæve) m ønter er ens.
Hvis stikprøvestørrelsen er stor, kan vi bruge den ovennævnte Z -test,
idet p og p 2 er m iddelværdierne a f to Bernoullifordelte variabler. N år vi
har at gøre m ed én Bern oullifordeling som i afsnit 14.5, kan vi udregne
variansen direkte fra m iddelværdien under nulhypotesen. Ved en sam ­
m enligning a f to Bernoullifordelinger kender vi im idlertid ikke m iddel­
væ rdierne, p1 og p 2, under nulhypotesen, men ved kun, at de skal være
ens. Derfor skal varianserne også være ens, og vi kan da anvende den
poolede variansestimator, som her har følgende udseende:
hvor
er de to stikprøvegennem snit (de estim erede andele), og
er gennem snittet i den samlede stikprøve. Teststatistikken bliver
derfor:
som er approksim ativt standardnorm alfordelt under nulhypotesen.
Eksempel 15.4: Eksamen
En handelsskole ønsker at teste, om sandsynligheden for at bestå en
eksam en afhænger af, hvilken lærer der har undervist i faget. Dvs:
H0 : p 1 = p 2
H0 : p 1 ≠ p 2
hvor p 1 er sandsynligheden for at bestå med lærer 1, og p 2 er sandsyn­
ligheden for at bestå m ed lærer 2. H andelsskolen udtager nu en simpel
tilfældig stikprøve på henholdsvis 25 og 36 elever fra hver a f de to lære­
res eksamener. Den finder, at andelen a f de udtagne, der bestod m ed den
første lærer, var 7/25 = 0,28, m ens andelen, der bestod m ed den anden,
var 14/36 = 0,389. V ærdien a f teststatistikken bliver derfor:
Ved et signifikansniveau på 5 % er de kritiske væ rdier fra standardnor­
m alfordelingen henholdsvis 1,96 og – 1,96. H andelsskolen kan derfor
ikke afvise nulhypotesen om, at der er sam m e sandsynlighed for at be­
stå m ed de to lærere.
■
15.1.6
Test af forskel på to middelværdier – en oversigt
I boksen nedenfor har vi samlet resultaterne fra de foregående afsnit.
Test af forskel på to middelværdier med en simpel tilfældig stikprøve fra hver gruppe, H0 : μ 1 = μ 2
Alternativhypoteser
Teststatistik og fordeling under H0
Det generelle tilfælde: Store stikprøvestørrelser (afsnit 15.1.1 og 15.1.2)
p-væ rdi:
p-væ rdi:
p-væ rdi:
2 · Φ(– |z |)
1 – Φ(z )
Φ (z )
Kritiske værdier:
Kritisk værdi:Z1–α
Kritisk værdi:
Zα
Zα/2 og Z1–α/2
Normalfordelte observationer (afsnit 15.1.3 og 15.1.4)
p-væ rdi:
p -væ rdi:
p-væ rdi:
2 · Φ(– |z |)
1 – Φ(z )
Φ(z )
–αKritisk værdi:
Kritiske værdier: Z1
Kritisk værdi:
Zα/2
Zα
ogZ1–α/2
p-værdi:
p-væ rdi:
p-værdi:
2 · P ( T ≤ –|t|)
P ( T ≥ t)
P ( T ≤ t)
Kritiske værdier:
Kritiskα
+
t værdi:
1( –n 1
Kritisk værdi:
n2 – 2)
tα(n1 + n2 – 2)
tα/2(n1 + n2 – 2)
Og(+
2)–t n1α21/
→
Test på andele: X i ~ Ber(p) og store stikprøvestørrelser (afsnit 15.1.5)
p-væ rdi:
p-værdi:
p-værdi:
2 · Φ(– |Z|)
1 – Φ(z )
Φ (z )
Z1Kritisk værdi:
K ritiske værdier: –α
Kritisk værdi:
Zα/2 og Z1–α/2
Zα
Noter:
1. z og t er de realiserede værdier af teststatistikken.
2. α er signifikansniveauet.
3 . Zαer α-fraktilen fra standardnormalfordelingen, ogtα(n1+ n2– 2) er α-fraktilen fra t-fordelingen med
n1+n2– 2 frihedsgrader.
15.2
Test af forskel på flere middelværdier (variansanalyse)
En m åde at undersøge forskelle m ellem m ange fordelinger på er at se
på, om deres m iddelværdier er forskellige. I dette afsnit vil vi teste, om
m iddelværdierne i en række fordelinger (grupper) er ens. Som ovenfor
er det fordelingerne a f X givet Y = y for forskellige væ rdier a f y, vi
er interesserede i. I dette afsnit er der K forskellige fordelinger, dvs.
y = 1, y = 2, . . . , y = K . N ulhypotesen er:
H 0 : μ1 = μ 2 = .. . = μ k
H 1 : M indst én a f m iddelværdierne er ikke som de andre,
hvor μ k er m iddelværdien i den betingede fordeling f (x |y = k ). B e­
m ærk, at det kun kræver, at én fordelings m iddelværdi er forskellig fra
de øvrige fordelingers middelværdier, for at nulhypotesen er falsk.
Det hypotesem ål, vi bruger til at skelne m ellem nul- og alternativ­
hypotesen, er givet ved:
hvor μ er et eller andet gennem snit a f m iddelværdierne for de K for­
delinger. Det kunne være enten det simple (uvægtede) gennemsnit,
hvor
eller et væ gtet gennemsnit,
wk’ erne er positive vægte, der sum m erer til 1. I begge tilfælde vil hy­
potesem ålet blive nul, hvis vi indsætter de sande m iddelværdier, og de
alle er ens. Hvis derim od m indst én a f dem adskiller sig fra de andre, vil
hypotesem ålet blive større end nul.
M iddelværdierne estim erer vi, som vi før har gjort, m ed stikprøve­
gennemsnittene. Lad X 1,k, X 2,k,..., X nk,k være en simpel tilfældig stik­
prøve på nk observationer fra fordeling k, hvor y = k. Da er skønnet på
middelværdien, μ k for fordeling k givet ved:
Hvis vi bruger den μ, hvor vægtene, wk, er de relative stikprøvestørrel­
ser, nsa/n, så er estim atoren for μ lig m ed det simple gennem snit a f alle
observationerne:
hvor n er det sam lede antal observationer i de K stikprøver, n = n 1+ n2
+ ... + nK.
En estim ator for hypotesem ålet er da:
hvor vi har vægtet hver gruppe m ed dens andel a f den samlede stikprø­
vestørrelse, nk/n. Det vil sige, at en afvigelse mellem
for en
fordeling k, hvorfra vi har en lille stikprøve, nk, kom m er til at betyde
m indre end en afvigelse mellem
for en fordeling, hvorfra vi
har en stor stikprøve.
For at teststatistikken kan få en hensigtsm æssigt fordeling, m å vi
antage, at varianserne i de K fordelinger er ens: σ 21 = ... = σ 21 = σ 21.
Ved at dividere det ovenstående estim erede hypotesem ål med et skøn
på denne varians får vi teststatistikken:
hvor:
og Sk2 er stikprøvevariansen i den k ’te stikprøve. Hvis observationer­
ne i stikprøverne er norm alfordelte, kan m an vise, at teststatistikken er
F-fordelt m ed ( K – 1, n – K ) frihedsgrader under nulhypotesen.
Som ved t-fordelingen og χ2-fordelingen er F-fordelingen en familie
a f fordelinger. I m odsætning til de to andre fordelinger er F-fordelingen
dog karakteriseret ved to param etre eller to sæt a f frihedsgrader. Som
eksempel er F -fordelingen m ed 5 og 9 frihedsgrader, som skrives F (5,
9), vist i figur 15.1. Endvidere er de vigtigste fraktiler for F-fordelingen
at finde i tabel 5 og 6 bagerst i bogen.
Figur 15.1:
F -fordelingen
med (5,9)
frihedsgrader
En alternativ fortolkning a f teststatistikken er følgende: SSTR er et mål
af­
for, hvor m eget de enkelte gruppers gennemsnit,
SSE m åler derimod
viger fra den sam lede stikprøves gennemsnit,
variansen inden for de enkelte stikprøver. Hvis SSTR derfor er stor i
forhold til SS E , er det et tegn på, at der er større varians m ellem stikprø­
verne end inden for stikprøverne. Dette tyder på, at m iddelværdierne i
de K fordelinger ikke er ens, og det m å derfor betragtes som bevis m od
nulhypotesen. Faktisk kan m an vise, at under nulhypotesen er både tæl­
leren og nævneren i teststatistikken estim atorer for variansen, σ2, i de K
fordelinger. U nder H 1 er det derim od kun nævneren, der er en estim ator
for σ2, hvorim od tælleren vokser m ed stikprøvestørrelsen, n. Teststati­
stikken vil derfor antage en stor værdi, hvis alternativhypotesen er sand,
og n er tilstrækkeligt stor. På grund a f denne fortolkning a f testen har
analysen traditionelt væ ret kaldt for variansanalyse.
Variansanalyse
Form ål: Test a f ens m iddelværdier i K norm alfordelinger m ed
sam m e varians, σ2, ved hjælp a f en simpel tilfældig stikprøve fra
hver gruppe.
Hypotese:
H 0 : μ1 = μ 2 = .. . = μ k
H 1 : M indst én μ k er ikke som de andre,
hvor μ k, k = 1 ,..., K , er de ukendte m iddelværdier i de K forde­
linger.
Teststatistik:
hvor:
og
er stikprøvegennem snittet i den k ’te stikprøve m ed nk ob­
s e rv a tio n e r, o g n e r s tø rre ls e n a f d e n s a m le d e s tik p rø v e .
K ritisk værdi: F 1–α(K – 1, n – K )
Eksempel 15.5: Eksportmarkeder
En eksportør ønsker at sam m enligne m iddelefterspørgslen blandt kun­
derne på tre a f dens store eksportmarkeder. Den har derfor indsam let
følgende stikprøve:
Tabel 15.1:
Stikprøve­
størrelse
Stikprøve­
gennemsnit
Stikprøvevarians
M arked 1
16
56,32
17,23
M arked 2
12
6 4 ,12
10,11
M arked 3
11
59,34
18,13
I alt
39
59,57
Stikprøve­
resultater fra
tre eksport­
markeder
Eksportøren mener, at m an m ed rim elighed kan opfatte de tre stikprø­
ver som simple tilfældige stikprøver m ed norm alfordelte observationer,
der alle har sam m e varians, σ2. Han beslutter derfor at anvende varians­
analysen fra ovenstående boks til at teste sin hypotese. V ærdierne a f
SSTR og SSE udregner han til:
= (56,32 – 59,57)2 ·16 + (64,12 – 59,57)2 ·12
+ (59,34 – 59,57)2 ·11 = 418,01
+ (11 – 1) · 18,13 = 550,96
D erm ed bliver væ rdien a f teststatistikken:
U nder nulhypotesen er teststatistikken F -fordelt m ed (3– 1, 39– 3) =
(2, 36) frihedsgrader. 0,95-fraktilen fra denne fordeling er 3,26, og der­
for kan nulhypotesen forkastes. M iddelefterspørgslen er derfor ikke ens
på de tre markeder.
■
15.3
Test af effekt af en behandling
Inden for sam fundsvidenskab er man ofte interesseret i at undersøge,
hvordan en behandling påvirker en person. En behandling kunne for
eksempel være, at en lønm odtager deltager i et efteruddannelseskursus.
M an er her interesseret i at teste, om kurset har en positiv effekt på
hans/hendes efterfølgende produktivitet m ålt ved vedkom m endes løn.
Der er forskellige estimationsmetoder, man kan bruge afhængigt a f
typen a f data, der er til rådighed. Vi ser her på tre forskellige typer a f
data. For det første kan man have observationer på elementer, som har
fået behandling, og elementer, som ikke har fået behandling. Elem en­
terne, som ikke har åf et behandling, kalder m an også for en kontrol­
gruppe.
De to næste typer a f data er specielle derved, at man observerer det
samme elem ent to gange over tid. I den ene type a f data har m an to
observationer på hvert element, en før behandlingen og en efter be­
handlingen. I dette tilfælde har man altså ikke en kontrolgruppe. Ved
den tredje type a f data har man også en kontrolgruppe, som observeres
på de samme tidspunkter som de elementer, der m odtager behandling.
15.3.1
Behandlingsgruppe og kontrolgruppe observeres én gang
N år man kun observerer behandlingsgruppen og kontrolgruppen en
gang hver, foregår estim ation og test a f effekten a f en behandling på
samme m åde som i afsnit 15. 1.1. Lad µbeh være m iddelværdien a f X for
de behandlede og µkon m iddelværdien a f X for kontrolgruppen. Hvis be­
handlingsgruppen og kontrolgruppen ikke adskiller sig fra hinanden, ud
over at førstnævnte har m odtaget behandlingen, så er µbeh – µkon effekten
a f behandlingen. Hypoteserne væ lger vi derfor som:
H 0 : µbeh – µkon = 0
H1 : µbeh – µkon ≠ 0
Estim atoren D a f effekten a f behandlingen er:
er stikprøvegennem snittet i behandlingsgruppen, og
er
hvor
stikprøvegennem snittet i kontrolgruppen. Teststatistikken bliver da:
hvor nbeh og nkon er antal observationer i stikprøverne fra henholdsvis be­
handlingsgruppen og kontrolgruppen, og
ebS(h2) og ( S kon)2er stikprø­
vevarianserne for de to grupper. Teststatistikken er da approksim ativt
standardnorm alfordelt, nøjagtig som i afsnit 15.1.1.
15.3.2
Behandlingsgruppe observeres to gange uden kontrolgruppe
Vi diskuterer i dette underafsnit, hvordan man kan teste effekten a f en
behandling, hvis man kun observerer elementer, som har fået behand­
lingen. Dette er særligt relevant, hvis m an har et kontrolleret eksperi­
ment, fx et laboratorieforsøg.
Antag, at elem enterne m odtager behandlingen m ellem tidspunkt t og
være observationen på det i’te udtrukne elem ent på tids­
t + 1, og lad
er observationen a f elem entet på tidspunkt t + 1. Data
punkt t, m ens
er derm ed a f typen:
A ntag desuden, at stikprøven er simpel tilfældig. D erm ed er parrene,
uafhængige a f hinanden. De to observationer i et par er
derim od typisk ikke uafhængige a f hinanden. D a der er nbeh elementer,
som m an observerer 2 gange, er der 2 · nbeh observationer i alt. Sådanne
data, hvor m an observerer det sam m e elem ent flere gange, kalder man
for paneldata.
Effekten a f behandlingen for elem ent i antager vi her er lig med
For hele populationen a f elementer, som har m odtaget be­
handlingen, er
m iddelværdierne på henholdsvis tidspunkt t
og t + 1. Derm ed er m iddeleffekten a f behandlingen lig m ed
Det leder til følgende to hypoteser:
Vi bruger hypotesem ålet
Hypotesem ålet er
altså her lig m ed m iddeleffekten a f behandlingen. Det estim erede hy­
potesem ål, som også er den estim erede effekt, D , a f behandlingen, er:
Hvor
er stikprøvegennem snittet på tidspunkt
er stikprøvegennem snittet på tidspunkt
t + 1 = 2.
Teststatistikken er opbygget på samme m åde som ved test a f en m id­
delværdi. Den er:
D a parrene (X i,t, X i t,+1) er uafhængige, er det m uligt at om skrive vari­
ansen i teststatistikkens næ vner på følgende måde:
Da
ikke er uafhængige, er det sidste udtryk ikke lig med
M en det sidste udtryk kan man
sum m en a f varianserne af
En estim a­
estimere direkte, da vi har en stikprøve a f par,
tor for variansen er da:
Det gælder ligesom tidligere, at teststatistikken er approksim ativt stan­
dardnorm alfordelt under nulhypotesen, når stikprøven er tilstrækkeligt
stor (fx m indst 30 observationer).
15.3.3
Behandlingsgruppe og kontrolgruppe observeres to gange
Eksistensen a f en kontrolgruppe er særligt relevant inden for sam funds­
videnskab, hvor m an sjældent har kontrollerede forsøg. Form ålet med
en kontrolgruppe er at tage højde for påvirkninger a f de behandlede
elem enter fra andre faktorer i tidsrum met fra t til t + 1 end påvirkningen
fra selve behandlingen. Hvis kontrolgruppen og behandlingsgruppen er
udsat for de sam m e andre faktorer, kan man bruge kontrolgruppen til at
fjerne effekten a f disse faktorer.
K ontrolgruppen ændrer således m iddelværdi fra t til t + 1 udeluk­
kende på grund a f disse andre faktorer. Påvirkningen fra de andre fakto­
er m iddelværdien på tidspunkt t for
hvor
rer er således
kontrolgruppen i populationen. Vi antager, at behandlingsgruppen får
sam m e påvirkning fra andre faktorer som kontrolgruppen. Derudover
får behandlingsgruppen også effekten a f behandlingen. U nder disse an­
tagelser er effekten, B , a f behandlingen:
er m iddelværdien på tidspunkt t for behandlingsgruppen. H y­
hvor
poteserne er derfor:
Hypotesemålet, som også er effekten a f behandlingen, kan m an estim e­
re m ed:
D a denne er lig m ed differencen m ellem to differencer, kaldes den på
engelsk for „diff-in-diff “ - estimatoren. Teststatistikken har sam m e form
som tidligere:
hvor vi igen har sat t + 1 = 2 og t = 1.
Vi antager, at stikprøven fra kontrolgruppen,
består a f nkon parvise observationer, og at disse par er
en simpel tilfældig stikprøve. Tilsvarende antager vi, at stikprøven fra
består a f nbeh par­
behandlingsgruppen,
vise observationer, som udgør en sim pel tilfældig stikprøve. Desuden
antager vi, at observationerne fra den behandlede del a f populationen
er statistisk uafhængige a f observationerne fra kontrolgruppen. Vi kan
under disse antagelser skrive variansen fra næ vneren i ovenstående test­
statistik som:
De to varianser på højre siden kan m an estim ere direkte, da vi har en
stikprøve a f par. Estim atorer for disse to varianser er:
Teststatistikken er approksim ativt standardnorm alfordelt under nulhy­
potesen, når stikprøverne er tilstrækkeligt store både for gruppen a f be­
handlede og for kontrolgruppen.
Eksempel 15.6: Videreuddannelse
En undersøgelse a f 40 personer før og efter et videreuddannelseskursus
gav det resultat, at gennem snitstim elønnen steg fra
= 200 k r ./time
= 220 kr./time. For en kontrolgruppe bestående a f 30 personer,
til
= 190
som blev undersøgt på de sam m e tidspunkter, var resultatet:
= 205 kr./time. Hvis vi laver testen uden brug a f kon­
kr./time og
trolgruppen som i afsnit 15.3.2, får vi følgende værdi a f teststatistikken:
hvor nævneren er kvadratroden a f den estim erede varians. Dette m edfø­
rer, at nulhypotesen forkastes. Vurderingen er altså, at videreuddannel­
seskurset har en statistisk signifikant effekt på lønnen.
Hvis m an derim od m edtager kontrolgruppen som i afsnit 15.3.3, får
man:
hvor næ vneren igen er kvadratroden a f den estim erede varians. I dette
tilfælde accepteres nulhypotesen. Vurderingen er altså her, at videreud­
dannelseskurset ikke har en statistisk signifikant effekt på lønnen.
Å rsagen til de to forskellige konklusioner kan være, at m an uden
brug a f kontrolgruppen kom m er til at m edtage andre faktorer såsom
alm indelige lønstigninger på grund a f inflation eller høj k onju nktur, som
ikke har noget at gøre m ed videreuddannelseskurset.
■
15.4
Test af forskel på to varianser
Ligesom vi i de foregående afsnit har testet, om to eller flere m iddel­
væ rdier er ens, kan man også være interesseret i at teste, om to varianser
er ens. Det kunne fx være tilfældet i en situation, hvor m an overvejer at
anvende den poolede variansestimator, m en er i tvivl om det rim elige i
dette. Det kan også være, at m an vil teste, om afkastet på to aktier har
sam m e varians.
Til dette formål skal vi som i afsnit 15.1 have en sim pel tilfældig
stikprøve fra hver gruppe. Desuden er vi nødt til at antage, at observati­
onerne i disse stikprøver er normalfordelte:
(X1,1,X2,1,...,Xn1,1), hvor
Xi,1~ Ν ( μ 1, σ 12)
(X1,2,X2,2,...,Xn2,2) , hvor X i,2 ~ Ν (μ 1 , σ 2 2 )
Hypoteserne er:
H0 : σ12 = σ22
H1 : σ12 ≠ σ22
Til at teste disse hypoteser vil vi anvende hypotesem ålet σ 12/ σ 2. Hvis
nulhypotesen er sand, er dette mål lig m ed 1, ellers er det forskelligt
fra 1. Det estimerede hypotesem ål, som i dette tilfælde også er vores
teststatistik, fås ved at erstatte variansern e m ed stikprøvevarianserne:
hvor S 12 er estim atoren for σ 12, og S 22 er estim atoren for σ 22. Det kan
nu vises, at denne teststatistik er F-fordelt m ed ( n1 – 1, n2 – 1) friheds­
grader under nulhypotesen. Hvis alternativhypotesen er dobbeltsidet,
vil både høje og lave væ rdier a f F i forhold til 1 være bevis m od nul­
hypotesen. Er altem ativhypotesen derim od enkeltsidet, vil enten høje
eller lave væ rdier a f F kunne forkaste H0, afhængigt a f udseendet a f H 1.
Boksen opsum m erer proceduren:
Test af forskel på to varianser med to uafhængige simple tilfældige stikprøver, H0 : σ 12 = σ22
Teststatistik og fordeling
under H0
Normalfordelte observationer
,α
–1F
()2n2
n1
Kritiske
/
værdier:
–α(n1
,–1F1
)n2
Kritisk værdi:
Kritisk værdi:
Fα(n1 – 1,n2 – 1)
Noter:
1. α er signifikansniveauet.
2. Fα(n1 – 1, n2– 1) er α-fraktilen fra F-fordelingen med (n1–1,n2– 1) frihedsgrader.
Eksempel 15.7: Uddannelsesbaggrund – del 4
I eksempel 15.2 anvendte konsulentfirmaet den poolede variansesti­
m ator. Det kunne derfor være interessant at teste, om varianserne i de
to fordelinger faktisk er ens. Ud fra de beregnede stikprøvevarianser,
S 12 = 19,13 og S 2 = 2 2 ,2 5, udregner vi følgende værdi a f teststatistik­
ken:
Hvis altem ativhypotesen er dobbeltsidet, og konsulentfirm aet an­
vender et 5 %-signifikansniveau, skal det anvende 0,025-fraktilen og
0,975-fraktilen fra F-fordelingen m ed (29, 49) frihedsgrader. Disse
fraktiler er henholdsvis 0,50 og 1,88. Konsulentfirm aet kan derfor ikke
–α/
()–2F1
1,n2
n1
og
afvise nulhypotesen og kan således m ed sindsro anvende den poolede
variansestimator.
■
15.5
Opgaver
1 . Repetitionsspørgsmål:
a) G ør kort rede for, hvilke teststatistikker vi kan anvende, når vi
ønsker at teste en hypotese om to middelværdier. Forklar intuiti­
onen bag teststatistikkerne og angiv deres fordelinger under H 0.
b) H vad forstår vi ved den poolede variansestim ator? H vornår skal
denne anvendes?
c) Forklar intuitionen bag den teststatistik, vi anvender, når vi skal
teste en hypotese om to andele. Hvad er forudsætningerne for at
kunne anvende denne? Hvad er dens fordeling under nulhypote­
sen?
d) Hvad kan variansanalyse bruges til? Forklar, hvordan m an kan
fortolke størrelserne SSTR og S SE samt teststatistikken, F. H vil­
ken fordeling følger F under H 0?
e) Forklar, hvordan man kan teste en hypotese om en effekt a f en
behandling, og gør rede for de tre forskellige tilgange præ sente­
ret i dette kapite1.
f) Hvilken teststatistik kan vi bruge til at teste en hypotese om to
varianser? Hvad er forudsætningerne for at kunne bruge den, og
hvad er dens fordeling under H 0?
2.
Antag, at vi har to uafhængige simple tilfældige stikprøver på hen­
holdsvis 50 og 70 observationer. Stikprøvegennem snittet i den første
stikprøve er beregnet ti1:
= 12, 9 5, m ens det i den anden stikprøve
er
= 13,2. Vi ønsker at teste følgende nulhypotese: H 0 : μ1 = μ 2
over for den alternative hypotese: Η 1 : μ 1 ≠ μ 2.
a) Opstil den relevante teststatistik, hvis varianserne er kendt:
σ 12 = σ 22 = 0,60.
b) Hvad er fordelingen a f teststatistikken under H 0, hvis observa­
tionerne i stikprøverne er norm alfordelte? Hvad hvis de ikke er
norm alfordelte?
c) Beregn væ rdien a f teststatistikken samt p-værdien.
d) Kan vi forkaste H 0 ved et 5 % -signifikansniveau? Ved et 10 % ­
signifikansniveau?
A ntag i stedet, at varianserne er ukendte, m en at stikprøvevarianser­
n e er beregnet til S22 = 0,57 og S 22 = 0,63.
e) Opstil den relevante teststatistik, hvis det antages, at de underlig­
gende varianser ikke er ens.
f) Hvilken fordeling følger denne teststatistik under H 0, hvis det
antages, at observationerne i stikprøverne er norm alfordelte?
g) Hvis observationerne i stikprøverne ikke er norm alfordelte, hvil­
ken fordeling følger teststatistikken da?
h) Find for hvert a f de to tilfælde de kritiske værdier ved et test på
et 5 % -signifikansniveau og sam m enlign disse.
i) Beregn værdien a f teststatistikken samt p-værdien.
j) Ved hvilket signifikansniveau kan vi forkaste H 0 her?
3. En bank ønsker at sam m enligne m iddelom sætningen blandt er­
hvervskunderne i to a f dens filialer. Derfor udtræ kker den to stikprø­
ver, én fra hver filials kundekreds. Resultaterne a f de to stikprøver
er:
n
(1000 kr.)
S
Filial 1
25
1267,7
2 10,8
Filial 2
30
1443,4
278,0
a) Opstil nulhypotesen og altem ativhypotesen.
b) Forklar, hvilken teststatistik der er anvendelig til at teste hypote­
sen fra spørgsmål a).
c) Hvad er fordelingen a f denne under nulhypotesen? U nder hvilke
antagelser gæ lder det?
d) Beregn værdien a f teststatistikken samt p-værdien.
e) Hvad er de kritiske værdier a f teststatistikken ved en test på et
5 %-signifikansniveau? Kan vi forkaste H 0 ved en sådan test?
Banken overvejer at anvende den poolede variansestim ator ved ud­
regning a f teststatistikken.
f) Hvordan kan vi teste, om det er rim eligt at anvende den poolede
variansestimator?
g) Opskriv nulhypotesen og altem ativhypotesen for denne test.
h) Find den relevante teststatistik til brug ved testen i spørgsmål g)
og angiv dens fordeling under H 0.
i) Find de kritiske værdier ved anvendelse a f henholdsvis et 5 %­
og et 10 %-signifikansniveau.
j) Gennem før testen af, om banken kan anvende den poolede vari­
ansestimator.
k) G ennem før testen fra spørgsm ål b)-e), hvor den poolede varian­
sestim ator nu anvendes.
4. Et analyseinstitut har gennem ført to undersøgelser i henholdsvis
1997 og 2002 om folks holdninger til reklam er for alkohol på tv. I
1997 var der 7 4 % i undersøgelsen, der var imod, m ens dette tal i
2002 var 72% . A nalyseinstituttet konkluderer derfor, at der er fal­
dende m odstand m od denne type a f reklamer. Antallet a f adspurgte
var 957 i 1997 og 1012 i 2002.
a) U nder hvilke forhold er det rim eligt at antage, at de to stikprøver
er sim pelt tilfældigt udtrukket og uafhængige?
b) H vilken test kan m an bruge til at afgøre, om analyseinstituttet har
ret i sin konklusion?
c) Gennem før testen og afgør, under hvilke forudsæ tninger analyse­
instituttets konklusion kan accepteres.
d) Baseret på dine resultater, hvad vil du da selv konkludere om
udviklingen fra 1997 til 2002?
5. En aktieanalytiker har gennem en længere periode observeret de
årlige udbyttebetalinger på en 100 kroners-aktie for en gruppe a f
virksom heder i m edicinalindustrien. Hun har få et indsam let obser­
vationer fra 10 virksom heder over fem år, i alt 50 observationer.
Stikprøvegennem snittet har hun udregnet til
= 11,43 og stikprøvevariansen til S 2 = 86,8.
a) Diskutér, hvorvidt vi kan opfatte disse observationer som en sim ­
pel tilfældig stikprøve. Hvordan kan vi da fortolke den populati­
on, som stikprøven er udtrukket fra?
Analytikeren mener, at der er tale om en simpel tilfældig stikprøve,
og ønsker at teste, om standardafvigelsen, σ, på udbytterne er m in­
dre end 10 kr.
b) Hvilken teststatistik skal hun da anvende, og hvilke antagelser
m å hun gøre sig?
c) Opskriv nulhypotesen og altem ativhypotesen.
d) Find den kritiske værdi ved en test på et 5 %-signifikansniveau.
e) Beregn værdien a f teststatistikken og afgør, om analytikeren kan
acceptere sin hypotese.
Analytikeren har også observeret udbyttebetalingerne fra en række
I T -v irk s o m h e d e r H e r h a r hun i a lt 4 3 o b s e r v a tio n e r m ed e t s tik p r ø v e­
gennem snit på
1=4,4 7 og en stikprøvevarians på S 2 = 142,7 .
Hun ønsker nu at teste, om varianserne på udbytterne a f de to typer
a f aktier er den samme.
f) Hvilken teststatistik skal hun i så fald anvende, og hvilke anta­
gelser m å hun gøre sig?
g) Opskriv nulhypotesen og altem ativhypotesen.
h) Find de kritiske værdier ved en test på et 10 %-signifikansniveau.
i) Beregn værdien a f teststatistikken og afgør, om nulhypotesen bør
forkastes.
6. En undersøgelse a f nyansættelser i det forgangne år blandt mindre
danske virksom heder i Jylland, på Fyn og på Sjælland resulterede i
følgende:
Stikprøve­
størrelse
Stikprøve­
gennemsnit
Stikprøvevarians
Jylland
95
3,21
3,97
Fyn
35
4,50
4,11
Sjælland
108
2,44
4,35
En nysgerrig person ønsker nu at undersøge, om det gennem snitlige
antal nyansættelser på fynske virksom heder er det sam m e som i de
to andre regioner.
a) Hvilken test kan han anvende til dette formål?
b) G ør rede for testens forudsætninger.
c) Opstil nulhypotesen og altem ativhypotesen.
d) Find de kritiske værdier ved en test på et 5 %-signifikansniveau.
e) Udregn værdien a f teststatistikken og afgør, om hypotesen kan
accepteres, eller om den m å forkastes.
16
Test af sammenhænge
og fordelinger for
kvalitative data
I dette kapitel gennemgår vi test a f forskellige egenskaber ved én eller
flere diskrete stokastiske variabler, som typisk fremkommer i forbin­
delse med kvalitative data. Diskrete stokastiske variabler kan fx re­
præsentere kvalitative valg: Om en person vælger offentlig eller privat
transport til arbejde, eller om en person køber en dieseldrevet eller en
benzindrevet bil. Man kan teste, om en diskret stokastisk variabel er
fordelt på en bestemt måde, og man kan også teste, om der er en sam­
menhæng mellem to diskrete stokastiske variabler.
Mange test i forbindelse med kvalitative data er baseret på en grund­
læggende teststatistik, som man kalder for en χ2-test. Idéen bag χ2-testen
er, at den sammenligner den observerede (empiriske) fordeling af den
diskrete stokastiske variabel med en hypotetisk fordeling, dvs. en for­
deling, som stammer fra en teori eller en hypotese.
I afsnit 16 .1 gennemgår vi konstruktionen a f χ2-testen. Derefter vil
vi i afsnit 16.2 anvende testen til at afgøre, om en diskret stokastisk
variabel følger en bestemt fordeling. I afsnit 16.3 præsenterer vi en test
for uafhængighed mellem to stokastiske variabler, mens vi i afsnit 16.4
tester, om to fordelinger er ens (homogene).
16.1
χ2 -testen
I dette afsnit introducerer vi χ2-testen, som alle testene i dette kapitel
bygger på. Antag, at en stokastisk variabel, X, kan antage K mulige
værdier: x1,...,x K. Disse betegner vi også som K forskellige kategorier.
Sandsynligheden for hver a f disse værdier (kategorier) er: p 1, . . . , p K,
dvs. P ( X = xk) = p k. Det er hypoteser om disse ukendte sandsynlig­
heder, vi vil teste ved hjælp a f χ2-testen.
I konstruktionen a f en hypotesetest er det første overordnede punkt
at opstille nulhypotesen og alternativhypotesen. Disse er her:
H 0 : P1 = π 1, Ρ 2 = π 2 ,...,ΡK = π K
Η 1 : mindst é n p k ≠ πk, k = 1K
,.
hvor π 1,...,π K er de hypotetiske sandsynligheder for de K mulige ud­
fald. I dette afsnit bruger vi denne nulhypotese uden at forklare, hvor­
fra den stammer. I de følgende afsnit præsenterer vi forskellige teorier,
som giver anledning til nogle konkrete hypotetiske sandsynligheder,
π 1, .. . , π K. Idéen er så at vurdere, om en teori er passende ud fra, om de
sandsynligheder, som den forudsiger, π 1, . . . , π K, stemmer overens med
de sande, men ukendte, sandsynligheder, p 1,...,p K.
Som hypotesemål til at skelne mellem nul- og alternativhypotesen
bruger vi:
Dette hypotesemål er lig med 0, hvis nulhypotesen er sand, hvorimod
hypotesemålet er større end 0, hvis den er falsk. Til at implementere
testen skal vi først erstatte de ukendte størrelser i hypotesemålet med
skøn. De ukendte størrelser er her sandsynlighederne, p1,...,p K.Til at
skønne på disse antager vi, at en simpel tilfældig stikprøve, ( X 1,...,X n),
er til rådighed. Lad Zk være antallet a f observationer i stikprøven med
værdien xk. Hvis vi har n observationer, og Zk a f dem har værdien xk,
så er skønnet på sandsynligheden p k givet ved Zk/n, dvs. andelen af
observationer i stikprøven med værdien xk. På samme måde kan vi be­
regne skøn på de øvrige sandsynligheder. Dermed har vi skøn på alle de
ukendte størrelser i hypotesemålet.
For at teststatistikken blandt andet får en fordeling under nulhypote­
sen, som er nem at approksimere, har den følgende udseende:
Omskrivningen til det sidste udtryk gør det lettere at udregne værdien
a f teststatistikken, idet Zk blot er antallet a f observationer i stikprøven
med værdien x k, mens n · πk er det forventede antal observationer under
H0 med værdien xk i en stikprøve på n observationer. χ2-testen sammen­
holder altså den observerede frekvens, Zk, med den forventede frekvens
under nulhypotesen, n · πk. Tabel 16. 1 giver en skematisk oversigt over
de størrelser, vi skal bruge til udregningen a f teststatistikken.
For at anvende χ2-teststatistikken skal man kende dens fordeling
under nulhypotesen. Hvis stikprøven er simpel tilfældig, kan man ap­
proksimere teststatistikkens fordeling med en χ2-fordeling. Antallet af
frihedsgrader i denne fordeling afhænger af, hvor mange a f πk’ erne man
kan vælge frit. Hvis der er K kategorier, kan antallet af frihedsgrader
højst være K – 1. Forklaringen er, at da πk’ erne skal summere til 1, kan
højst K – 1 a f dem vælges frit. Den sidste må nødvendigvis vælges så­
ledes, at summen a f dem er 1.
Tabel 16.1:
Sandsyn­
Z1
1
P1
ligheder og
frekvenser
Forventet
Observeret
frekvens frekvens under H0
Ukendt
Sandsynlighed
sandsynlighed
under H0
Kategori
χ2-testen:
2
π1
π2
P2
π1, · n
Z2
π2 · n
·
·
·
·
·
·
·
·
·
·
K
Sum:
πK
Pk
1
1
ZK
πK·n
n
n
I de næste afsnit gennemgår vi forskellige teorier, som giver anledning­
til nogle konkrete sandsynligheder, π 1, . . . , π K, og hvor vi også får et be­
stemt antal frihedsgrader for fordelingen a f χ2-teststatistikken under H0.
Da hypotesemålet ovenfor er 0, når det er evalueret i værdierne un­
der nulhypotesen, betragtes kun store værdier a f teststatistikken som
bevis mod H0. Ønsker man derfor et 5 %-signifikansniveau, skal man
anvende 0,95-fraktilen fra den relevante χ2-fordeling.
16.2
Test af en fordeling
Ved hjælp af χ2-testen kan man teste, om stikprøven stammer fra en
bestemt fordeling. Hvis man fx mistænker en mønt for at være bøjet,
kan man undersøge dette ved at teste, om sandsynligheden for hvert af
de to udfald, når man slår „plat eller krone“ med mønten, er 1/2. Dette
vil give K = 2 kategorier, og sandsynlighederne under nulhypotesen er
da: π1 = π2 = 0,5. Mere generelt giver en formodet diskret fordeling an­
ledning til bestemte sandsynligheder, π1,...,πK, og man kan da anvende
χ2-testen til at afgøre, om den observerede stikprøve er i overensstem-
melse med disse, eller om vi er nødt til at forkaste den formodede for­
deling. I det følgende skal vi se forskellige eksempler på sådanne test
a f en fordeling.
Eksempel 16.1: En diskret fordeling: Terningkast
En terning er kastet 60 gange med udfaldene i tabel 16.2 som resultat.
Kan man med et 5 %-signifikansniveau acceptere, at terningen ikke er
skæv?
Nulhypotesen og alternativhypotesen er:
H0: Terning er ikke skæv, dvs. p1 = 1/6, . . . , p 6 = 1/6
Η 1: Terningen er skæv, dvs. mindst én p k ≠ 1/6
Tabel 16.2:
60 Terningkast
Observeret frekvens
1'ere
2'ere
3'ere
4'ere
5'ere
6'ere
I alt
8
11
6
13
10
12
60
Bemærk, at hvis én a f sandsynlighederne er forskellig fra 1/6, vil mindst
to a f dem være forskellige fra 1/6, da de altid skal summere til 1.
For at opstille teststatistikken skal man udregne det forventede antal
udfald under nulhypotesen. Ved en stikprøve på 60 elementer er det
forventede antal 1’ere givet ved 60 · 1/6 = 10. Det samme gælder for de
øvrige fem udfald. Dermed er værdien a f teststatistikken:
Den kritiske værdi finder man fra χ2-fordelingen med: 6 – 1 = 5 fri­
hedsgrader. Årsagen til, at antallet a f frihedsgrader er lig med 5, er, at
vi frit kunne vælge 5 a f sandsynlighederne under H0. 0,95-fraktilen fra
χ2-fordelingen med 5 frihedsgrader er 11, 1. Vi kan derfor konkludere,
at nulhypotesen ikke kan afvises, og at man må acceptere, at terningen
ikke er skæv.
■
Eksempel 16.2: En binomialfordeling – del 1
Lad den stokastiske variabel X være antallet a f drengebørn i en familie
med fire børn. Hvis det er fuldkommen tilfældigt, om en dreng eller
pige bliver undfanget, e r X binomialfordelt med parametrene n = 4 og
p = 0.5. Sandsynligheden for, at en familie med fire børn ikke har nogen
drenge, er:
Tilsvarende kan man beregne de øvrige sandsynligheder fo r X :
P (X = 1) = 0,25,
P (X = 2) = 0,375,
P ( X = 3) = 0,25,
P (X = 4) = 0,0625
Nulhypotesen og alternativhypotesen er:
H 0 : X ~ Bin(4, 0,5), dvs. π 0 = 0,0625, π 1 = 0,25, π 2 = 0,375,
π 3 = 0,25, π 4 = 0,0625
Η : X er ikke Bin(4, 0,5), dvs. mindst én a f sandsynlighederne er
ikke som under H0.
Med en simpel tilfældig stikprøve på 100 familier med fire børn fik man
resultatet i tabel 16.3:
Tabel 16.3:
Observeret
frekvens
Sandsynlighed
under H0
Forventet
frekvens under H0
0
8
0,0625
100 · 0,0625 = 6,25
1
20
0,25
100 · 0,25 = 25
2
28
0,3750
100 · 0,375 = 37,5
3
32
0,25
100 · 0,25 = 25
4
12
0,0625
100 · 0,0625 = 6,25
I alt
100
Antal drengebørn
(kategori)
Drengebørn I
1
100
I tabellen har vi også udregnet de forventede frekvenser under nulhypo­
tesen ved en stikprøvestørrelse på 100. De forventede frekvenser skal
vi bruge til at finde værdien af teststatistikken, som er:
Fordelingen a f teststatistikken under nulhypotesen er χ2-fordelingen
med antal frihedsgrader lig med antallet a f kategorier, 5, minus antallet
a f restriktioner på sandsynlighederne under H0. Der er kun én restrik­
tion i dette tilfælde: At sandsynlighederne summerer til 1. Derfor er
antallet a f frihedsgrader: 5 – 1 = 4 . Med et 5 %-signifikansniveau skal
vi derfor anvende 0,95-fraktilen fra χ2-fordelingen med 4 frihedsgrader.
Denne er 9,49. Vi kan derfor afvise H0, som siger, at antallet af drenge i
familier med fire børn er binomialfordelt med n = 4 og p = 0,5.
■
Vi behøver ikke nødvendigvis på forhånd at vælge, præcis hvilken for­
deling vi vil teste. Valget kan også delvist være bestemt a f stikprøven.
For eksempel kan vi ønske at teste, om fordelingen er en binomialfor­
deling, men vi kan være usikre på, hvilken værdi parameteren p har.
Man kan da bruge stikprøven til først at få et skøn på parameteren p
og dernæst teste, om fordelingen kan være en binomialfordeling med
denne værdi a f p. Det næste eksempel illustrerer dette.
Eksempel 16.3: En binomialfordeling – del 2
I stedet for at teste, om fordelingen a f X i eksempel 16.2 er Bin(4, 1/2),
vil vi nu blot teste, om X ~ Bin (4 ,p ) med en værdi a f p bestemt a f
skønnet på p fra stikprøven. For at få et skøn på p bruger vi, at middel­
værdien a f en binomialfordelt stokastisk variabel, X ~ B in(m , p), er
E ( X ) = m · p. Da stikprøvegennemsnittet,
er et skøn på middel­
værdien, E ( X ), så er et skøn på p givet ved
Vi bruger altså
stikprøven til at bestemme, hvilken binomialfordeling (hvilken værdi
a f p ) der bedst passer med stikprøven. Dernæst tester vi ved hjælp af
stikprøven, om X kan være binomialfordelt med denne værdi a f p.
Nulhypotesen og alternativhypotesen er derfor:
H0: X ~ B in (4 ,p )
H 1: X er ikke B in(4,p )
Med stikprøven fra eksempel 16.2 er skønnet på p :
Ud fra dette kan sandsynlighederne for X under nulhypotesen beregnes
til:
og tilsvarende:
P ( X = 1) = 0,20,
P (X = 2) = 0,37,
P (X = 3) = 0,30,
P (X = 4) = 0,09
Vi kan nu gentage tabellen fra eksempel 16.2 med disse nye sandsyn­
ligheder:
Tabel 16.4:
Observeret
frekvens
Sandsynlighed
under H0
Forventet
frekvens under H0
0
8
0,04
100 · 0,04 = 4
1
20
0,20
100 · 0,20 = 20
2
28
0,37
100 · 0,37 = 37
3
32
0,30
100 · 0,30 = 30
4
12
0,09
100 · 0,09 = 9
I alt
100
Antal drengebørn
(kategori)
Drengebørn II
1
100
Værdien a f teststatistikken kan da udregnes til:
Antallet a f frihedsgrader under nulhypotesen er anderledes end i eksem­
pel 16.2, hvor p var fastlagt a f H 0. Ud over at sandsynlighederne skal sum­
mere til 1, taber man en frihedsgrad, fordi p er estimeret. Derfor er test­
statistikken approksimativt χ2-fordelt med K – 1 – 1 = 5 – 1 – 1 = 3
frihedsgrader. Med et 5 %-signifikansniveau er den kritiske værdi 7,81.
Man kan derfor ikke afvise nulhypotesen om, at antallet a f drengebørn
er binomialfordelt.
■
Det er også muligt at teste en diskret fordeling med uendeligt mange
udfaldsmuligheder. Hvis fx X er Poissonfordelt, kan X antage værdier­
ne: 0,1,2,.... Vi kan da ikke direkte bruge χ2-testen, da den kun tillader
K mulige udfald. Men vi kan definere en ny stokastisk variabel, som har
K – 1 udfald til fælles m ed X , mens det sidste udfald (d et K’te udfald) er
samlingen a f alle de udfald a f X , som ikke er inkluderet i de første K – 1
muligheder. Fremgangsmåden er vist i det følgende eksempel.
Eksempel 16.4: Konkurser
Vi vil undersøge, om antallet a f konkurser om året i en given branche er
Poissonfordelt. Lad den stokastiske variabel X angive antallet a f kon­
kurser i en given måned. Hypoteserne er da:
H0 : X ~ P oi(λ )
H 1: x er ikke Ροi ( λ )
Hvis X er Poissonfordelt, er den forventede værdi a f X lig med
E ( X ) = λ . Vi kan derfor få et skøn på λ ved at bruge stikprøvegen­
nemsnittet
som skøn på E ( X ) og dermed λ. Observationer fra bran­
chen over 250 måneder har givet følgende simple tilfældige stikprøve:
Tabel 16.5:
Konkurser:
observerede
Antal konkurser
(kategori)
Observeret
frekvens
0
10
frekvenser
1
70
2
110
3
30
4
20
5
10
Total
250
Skønnet på X kan da udregnes til:
Vi kan nu udregne de forventede frekvenser under nulhypotesen ved
hjælp af dette estimat på X. Sandsynligheden for X = 0 er:
Tilsvarende fås:
P (X = 1) = 0,27,
P (X = 2) = 0,27, P (X = 3) = 0,18,
P (X = 4) = 0,09, P (X = 5) = 0,04
Den resterende sandsynlighed, P (X ≥ 6), er da: 1 – 0,13 – 0,27 – 0,27
– 0,18– 0,09– 0,04 = 0,02. Da den realiserede stikprøve ikke har højere
udfald end værdien 5, er det naturligt at lave en kategori, som hedder
„6 eller højere“. Under nulhypotesen er sandsynligheden for et udfald i
denne kategori 0,02.
Vi kan nu opstille en tabel med de observerede og de forventede
frekvenser:
Tabel 16.6:
Konkurser:
frekvenser og
Observeret
frekvens
Sandsynlighed
under H0
Forventet frekvens
under H0
0
10
0,13
250 · 0,13 = 32,5
1
70
0,27
250 · 0,27 = 67,5
2
110
0,27
250 · 0,27 = 67,5
3
30
0,18
250 · 0,18 = 45
4
20
0,09
250 · 0,09 = 22,5
5
10
0,04
250 · 0,04= 10
0,02
250 · 0,02 = 5
Antal konkurser
(kategori)
sandsynlig­
heder
≥6
I alt
0
250
1
250
Værdien a f teststatistikken er:
Som i det foregående eksempel er antallet a f frihedsgrader: K – 1 – 1,
da én parameter, λ, er estimeret. Med et 5 %-signifikansniveau skal vi
derfor anvende 0,95-fraktilen fra χ2-fordelingen med 7 – 1 – 1 = 5 fri­
hedsgrader. Denne er 11, 1, og vi kan derfor afvise nulhypotesen om, at
antallet a f konkurser er Poissonfordelt.
■
Boksen nedenfor opsummerer proceduren ved test a f en fordeling.
χ2-test a f en fo rd elin g
Formål: At teste om en diskret stokastisk variabel, X , med K
udfald (kategorier) følger en bestemt fordeling.
Hypotese:
H0:–P1 = π1(θ1,...,θd),p2 = π2(θ1,...,θd),..., pK = πK(θ1,...,θd)
Η 1: mindst én p k ≠ π k ( θ1,...,θd), k = 1, . . .,Κ
hvor p k, k = 1, . . .,Κ er de sande, men ukendte kategorisand­
synligheder, og π k ( θ1,...,θd), k = 1, . . .,Κ er sandsynlighederne
ifølge nulhypotesen, som kan afhænge a f d ukendte parametre,
θ 1,...,θd, i den antagede fordeling for X .
Teststatistik:
hvor Zk er den observerede frekvens i kategori k i en simpel til­
fældig stikprøve af størrelsen n, og
er den estime­
rede sandsynlighed for kategori k under H0 fundet via estimater,
på→
de d ukendte parametre i den antagede fordeling for X .
Kritisk værdi: χ 2 1 – α (K – 1 – d )
Eksempler:
1. H0: X ~ Bin(m, p )
•
Kategorier: X = 0, X = 1,..., X = m
•
Ukendt parameter: p
•
Estimat på p :
⇒
⇒
K = m+1
d = 1
er stikprøvegennemsnittet
2. H0: X ~ Poi(λ):
16.3
•
Kategorier: X = 0, X = 1,...,X = m – 1 og X ≥ m,
hvor m vælges tilpas stor ⇒
K = m + 1.
•
Ukendt parameter: λ
•
Estimat på λ :
⇒
d =1
er stikprøvegennemsnittet
Test af sammenhæng mellem to diskrete stokastiske variabler
Hvis to stokastiske variabler er afhængige, betyder det, at vi kan bruge
information om udfaldet af den ene stokastiske variabel til at forudsige
udfaldet a f den anden. Er de derimod uafhængige, er der ingen sam­
menhæng mellem deres udfald. I kapitel 3 og 4 gav vi den formelle defi­
nition af uafhængighed. I dette afsnit vil vi beskrive, hvordan man med
χ2-testen kan teste, om to diskrete stokastiske variabler er uafhængige.
Uafhængighed mellem to stokastiske variabler, X og Y, betyder, at
den simultane sandsynlighedsfunktion, f (x , y ), er lig med den margi-
nale sandsynlighedsfunktion fo r X , f X (x ), multipliceret med den mar­
ginale sandsynlighedsfunktion for Y, f Y( y ). Nulhypotesen og alterna­
tivhypotesen er derfor:
H0: Uafhængighed, dvs. f (x , y ) = f X (x ) · f Y (y )
for alle værdier a f x og y.
H 1: Afhængighed, dvs. ƒ (x , y ) ≠ f X (x ) · f Y(y )
for mindst én værdi a f x og y.
De sande ukendte sandsynligheder, p k, er lig f (x , y ), mens de hypote­
tiske sandsynligheder, πk er lig med f X ( x ) · f Y(y ), Hvis X kan antage
c værdier, x1,x 2,...,x c, og Y kan antage r værdier, y 1,y 2, ...,y r, er der i
alt c · r mulige udfald a f ( X , Y ). Der er således K = c · r forskellige
kategorier.
Da f X (x ) og f Y(y ). er ukendte, kender vi ikke på forhånd sandsyn­
lighederne under H0 : π k = f x(x ) · f Y(y ). Baseret på stikprøven kan
vi dog få et skøn på både f X ( x ) og f Y(y ), og disse skøn kan vi bruge til
at udregne de hypotetiske sandsynligheder, πk for de K kategorier. Det
næste eksempel illustrerer dette.
Eksempel 16.5: Defekte biler – del 1
En bilproducent har to fabrikker, som producerer en bestemt model.
Producenten vil gerne undersøge, om der er en sammenhæng mellem,
hvor en bil er produceret, og om den er behæftet med fejl (defekt). Lad
derfor den stokastiske variabel X være 0, hvis en tilfældigt udvalgt bil
er defekt, og 1, hvis den ikke er det, og lad den stokastiske variabel Y
indikere med værdierne 1 og 2, om bilen er produceret på fabrik 1 eller
2. Bilproducenten har følgende simple tilfældige stikprøve på 300 biler:
Tabel 16.7:
Biler:
Y = 1 (fabrik 1)
Y = 2 (fabrik 2)
I alt
X = 0 (defekt)
23
30
53
X = 1 (ikke defekt)
68
179
247
I alt
91
209
300
observerede
frekvenser
De observerede antal for de forskellige kombinationer a f X og Y svarer
til de Z k’ere, vi anvendte i afsnit 16.1. I dette tilfælde er der altså fire
kategorier med henholdsvis 23, 30, 68 og 179 observationer.
Baseret på stikprøven skal sandsynlighederne under H 0,
π k = f X (x ) · f Y(y ), udregnes. Skønnet på den marginale sandsynlig­
hed, f X ( x ) , udregner man ved at tælle alle de observationer, som har
X =x, og sætte antallet i forhold til det totale antal observationer. For
eksempel er skønnet på f X (0) givet ved (23+30)/300 = 0,177. Skøn­
nene på de marginale sandsynligheder,
er udregnet på
denne måde i den næste tabel:
Tabel 16.8:
Biler: skøn
Y = 1 (fabrik 1)
Y = 2 (fabrik 2)
X = 0 (defekt)
23
30
53/300
X = 1 (ikke defekt)
68
179
247/300
91/300
209/300
på marginale
sandsynlig­
heder
Baseret på skønnene på de marginale sandsynligheder kan vi ud­
regne skøn på sandsynlighederne:
Da vi til
χ2-testen skal bruge det forventede antal observationer i hver celle,
er disse størrelser udregnet i tabel 16.9.
Tabel 16.9:
Biler:
forventede
Y = 1 (fabrik 1)
Y = 2 (fabrik 2)
I alt
X =0
(defekt)
53
X=1
(ikke defekt)
247
frekvenser
I alt
91
209
300
Værdien af teststatistikken kan nu udregnes på samme vis som tidligere
ved brug a f de observerede frekvenser fra tabel 16.7 og de forventede
frekvenser fra tabel 16.9:
■
For at kunne anvende χ2-testen mangler vi blot at finde dens fordeling
under nulhypotesen. Som tidligere er χ2-testen approksimativt χ2-fordelt
med et antal frihedsgrader, som svarer til antallet a f sandsynligheder,
der kan vælges frit, minus antallet a f estimerede parametre. Da vi har
estimeret c – 1 marginale sandsynligheder for X (den sidste marginale
sandsynlighed for X behøver vi ikke at estimere, da de summerer til 1)
og r – 1 marginale sandsynligheder for Y, så er antal estimerede para­
metre d = (r – 1) + (c – 1). Derfor er antal frihedsgrader:
Frihedsgrader = c · r – 1 – d = c · r – 1 – ( r – 1) – (c – 1) = (c – 1) · ( r – 1)
Eksempel 16.6: Defekte biler – del 2
I eksempel 16.5 er der r = 2 mulige værdier a f X og c = 2 mulige værdier
a f Y. Derfor e r χ2-testen approksimativt χ2-fordelt med (2 – 1) · (2 – 1) =
1 frihedsgrad. Med et 5 %-signifikansniveau er den kritiske værdi der­
for 3,84 (0,95-fraktilen), og vi kan afvise H0, a t X og Y er uafhængige.
Der er altså en statistisk signifikant sammenhæng mellem, hvor en bil
er produceret, og om den er defekt.
■
Hvis man er nødt til at forkaste H0, kan man ikke umiddelbart ud fra
teststatistikkens værdi se, hvilke celler der forårsager afvigelsen fra H0.
Man kan da for hver celle (kategori) i tabellen udregne en størrelse, rxy
som kan indikere, for hvilke celler, dvs. værdier a f x o g y , nulhypotesen
ikke holder. Denne størrelse er givet ved:
hvor n · π xy = n · f X (x ) · f Y(y ) er den forventede frekvens, og Z xy er
det observerede antal i den celle, hvor X = x og Y = y. Intuitionen bag
rxy er, at den er numerisk stor for en celle, hvis den observerede frekvens afviger meget fra den forventede frekvens under nulhypotesen.
Omvendt er den numerisk lille, hvis de ikke afviger fra hinanden. Man
kan vise, at
er
rxy approksimativt standardnormalfordelt under nulhypo­
tesen. Hvis rxy derfor er numerisk større end 1,96, er den pågældende
celle ikke i overensstemmelse med nulhypotesen ved et 5 %-signifi­
kansniveau.
Eksempel 16.7: Defekte biler – del 3
Fra tallene i eksempel 16.5 og 16.6 kan vi for cellen, hvor X = 0 og
Y = 1, udregne r01 til:
De øvrige tre celler vil have samme numeriske værdi a f rxy. Så i dette
tilfælde er der ingen ekstra information at hente ved at beregne rxy.
■
χ 2 -test for u a fh æ n g ig h ed
Formål: At teste om to diskrete stokastiske variabler, X og Y, med henholdsvis r
og c mulige udfald er uafhængige.
Hypotese:
H0: Uafhængighed: ƒ ( xi, y j ) = f X (x i) · f Y ( yj ) for i = 1,...,r , j = 1 ,...,c
H1: Afhængighed, dvs. ƒ (x i, y j) ≠ f X ( x i ) · f Y ( y j ) for mindst ét udfald(j)
ixy,
hvor f X (xi ) er den marginale sandsynlighedsfunktion for X, f Y ( yj ) er den
marginale sandsynlighedsfunktion for Y, og ƒ (x i, y j) er den simultane sand­
synlighedsfunktion.
Teststatistik:
hvor Z ij er den observerede frekvens af udfaldet (xi, yj) i en simpel tilfældig
stikprøve a f størrelsen n, og
er de estimerede marginale sand­
synlighedsfunktioner for X og Y.
Kritisk værdi:
16.4
Test for homogenitet
Vi kan også teste for, om en fordeling af en stokastisk variabel X er
den samme for forskellige grupper. Man kan definere en gruppe som
alle elementer i en population, som har et bestemt karakteristikum. De
forskellige karakteristika i populationen kan betragtes som forskellige
værdier a f en stokastisk variabel, Y. Derfor kan en gruppe skrives som
alle de elementer, hvor Y = y . Når vi skal sammenligne fordelingen af
X over forskellige grupper defineret ved forskellige værdier a f Y, sva­
rer det altså til at sammenligne den betingede fordeling af X givet Y,
f X/Y(x |y ), for forskellige værdier a f y.
Eksempel 16.8: Aldersfordeling for mænd og kvinder
Lad os forestille os, at vi skal sammenligne aldersfordelingen blandt
danske mænd med aldersfordelingen blandt danske kvinder. Popula­
tionen er alle personer i Danmark. Den stokastiske variabel Y indike­
rer, om en tilfældigt valgt person er mand ( Y = 1) eller kvinde (Y = 2).
Den anden stokastiske variabel X angiver personens alder i år. Når vi
skal sammenligne fordelingen a f X blandt mænd med fordelingen a f X
blandt kvinder, skal vi derfor sammenligne de to betingede fordelinger:
f X|Y(x |y = 1) og f X|Y(x |y = 2).
■
Homogenitet mellem to grupper, givet ved Y = 1 og Y = 2, indebærer, at
de to betingede fordelinger f X/Y(x |1) og fX/Y(x|2) skal være ens for alle
værdier af x. Dette er fuldstændig det samme som at sige, at X og 7 er
uafhængige, idet f X/Y(x\y) i så fald ikke afhænger a f y. Dette følger af
vores definition a f uafhængighed fra kapitel 4.
Man kan derfor teste for homogenitet a f X mellem grupper (defineret
ved værdier a f Y) ved at teste, om X og Y er uafhængige. Testproceduren
er således nøjagtig som i afsnit 16.3.
16.5
Opgaver
1. Repetitionsspørgsmål:
a) Hvilke typer af test kan χ2-testen anvendes til?
b) Gør rede for de grundlæggende principper bag χ2-testen, herun­
der hvad nulhypotesen og alternativhypotesen er, og hvordan det
mål, vi anvender, kan skelne mellem disse hypoteser.
c) Forklar, hvordan kategorisandsynlighederne under nulhypotesen
findes, når vi ønsker at teste, om X er binomialfordelt.
d) Hvad er antallet a f frihedsgrader i fordelingen af teststatistikken
under H0 i dette tilfælde? Hvad er den kritiske værdi?
e) Forklar, hvordan χ2-testen kan anvendes til at teste for uafhæn­
gighed mellem to stokastiske variabler.
f) Hvad er antallet af frihedsgrader i fordelingen a f teststatistikken
under H0 i dette tilfælde?
g) Hvorfor er det at teste for homogenitet det samme som at teste
for uafhængighed?
2. I en undersøgelse a f bilulykker på motorvejene har man observeret
følgende antal ulykker på forskellige ugedage:
Ugedag
Antal observerede ulykker
Mandag
112
Tirsdag
87
Onsdag
121
Torsdag
134
Fredag
155
Lørdag
97
Søndag
67
Man ønsker nu at undersøge, om man ud fra denne stikprøve kan af­
vise, at der er samme sandsynlighed for ulykker de forskellige dage
i ugen.
a) Opskriv nul- og alternativhypotesen.
b) Udregn de forventede frekvenser under H0.
c) Opstil teststatistikken og udregn værdien a f denne.
d) Hvad er den kritiske værdi ved et 5 %-signifikansniveau?
e) Kan nulhypotesen forkastes?
3. En virksomhedsejer har en idé om, at antallet a f produktionsstop
på en uge pga. tekniske fejl på maskinerne i produktionsafdelingen
følger en Poissonfordeling. Gennem det seneste år har han samlet
følgende 50 ugentlige observationer:
Observeret frekvens
Antal produktionsstop
0
11
1
19
2
12
3
7
≥4
1
I alt
50
a) Opstil nul- og alternativhypotesen.
b) Hvordan beregnes de forventede frekvenser under H0? Beregn
disse.
c) Opstil teststatistikken og angiv dens fordeling under nulhypote­
sen.
d) Beregn værdien a f teststatistikken og afgør, om virksomhedsejerens idé bør forkastes.
4. I en undersøgelse a f 200 ægtepars daglige rygevaner fik man følger
de resultater:
Kone ryger
ikke
Kone ryger
1-20 stk.
Kone ryger
> 20 stk.
Mand ryger ikke
57
33
11
Mand ryger 1-20 stk.
21
38
8
Mand ryger >20 stk.
6
14
12
Man ønsker nu at bruge disse data til at undersøge, om ægtefællers
rygevaner er uafhængige.
a) Opstil de relevante nul- og alternativhypoteser.
b) Opstil teststatistikken og angiv dens fordeling under nulhypote­
sen.
c) Hvad er den kritiske værdi a f teststatistikken ved et 5 %-signifikansniveau?
d) Beregn de forventede frekvenser under H0.
e) Find værdien a f teststatistikken og brug denne til at afgøre, om
nulhypotesen bør forkastes.
f) Forklar, hvordan testen fra denne opgave også kan opfattes som
en test for homogenitet mellem grupper.
5. En meget sportsinteresseret dreng sidder under en kamp i Wimbledon-turneringen i tennis og noterer, hvordan to spillere server. Hans
observationer kan sammenfattes i følgende tabel :
1. serv
godkendt
Fejl på 1. serv,
2. serv godkendt
Dobbeltfejl (fejl på
både 1. og 2. serv)
Spiller A
63
28
8
Spiller B
43
32
2
Drengen vil nu undersøge, om fordelingen a f server er den samme
for de to spillere.
a) Formulér den hypotese, som drengen ønsker at teste.
b) Hvilken teststatistik skal han anvende, og hvad er dens fordeling
under nulhypotesen?
c) Udregn de forventede frekvenser under H0.
d) Beregn endvidere værdien af teststatistikken og afgør, om nulhy­
potesen kan forkastes ved et 5 %-signifikansniveau.
17
Simpel lineær regression
I dette kapitel introducerer vi en a f de mest brugte metoder til at mo­
dellere sammenhænge mellem stokastiske variabler: Regressionsana­
lyse. Regressionsanalyse bruger man også til at forudsige udfaldet af
én stokastisk variabel ved at bruge information om udfaldet a f andre
stokastiske variabler.
I regressionsanalyse forklarer man den forventede værdi af en sto­
kastisk variabel som en funktion a f én eller flere andre stokastiske vari­
abler. Hvis fx X er prisen på en vare, og Y er efterspørgslen efter varen,
giver regressionen a f Y på X den forventede efterspørgsel efter varen
ved forskellige priser, dvs. ved forskellige værdier a f X. I dette kapi­
tel fokuserer vi på simpel lineær regression. Simpel lineær regression
betyder, at den forventede værdi af Y er en lineær funktion a f kun én
stokastisk variabel, X. Når man forklarer den forventede værdi af Y med
mere end én stokastisk variabel, kalder man det for multipel regression.
Det ser vi på i kapitel 18.
I afsnit 17.1 gennemgår vi den generelle idé med regression. I afsnit
17.2 fokuserer vi på simpel lineær regression, og i afsnit 17.3 viser vi,
hvordan man med en stikprøve kan få et skøn på en simpel lineær re­
gression. I afsnit 17.4 diskuterer vi forskellige metoder til at undersøge,
om den lineære regresion er korrekt specificeret. Derefter kan man teste
hypoteser om selve regressionsfunktionen, hvilket vi viser i afsnit 17.5.
Kapitlet slutter med afsnit 17.6, der omhandler brugen a f regression til
forudsigelser.
17.1
Regression
Sammenhængen mellem to stokastiske variabler, X og Y, er fuldstændig
beskrevet ved deres simultane sandsynlighedsfordeling, f (x , y ). Ud fra
denne kan vi udlede, hvordan værdien a f den ene stokastiske variabel re­
laterer sig til fordelingen af den anden. I det følgende fokuserer vi på,
hvordan en værdi a f X relaterer sig til fordelingen af Y. Dette er beskrevet
ved den betingede fordeling, f Y│X(y │x ), som blev defineret i kapitel 4. Den
giver os sandsynlighedsfordelingen for Y, givet at X antager værdien x .
17.1.1
Regressionsfunktionen
Den måske mest basale type a f information om sammenhængen mellem
X o g Y er, om de er statistisk uafhængige. Hvis X og Y er uafhængige, ved
vi fra kapitel 4, at f Y│X(y │
x ) = f Y(y ), hvilket betyder, at X ikke indeholder
nogen information om Y. Uanset hvilken værdi X antager, er fordelingen
af Y den samme, nemlig f Y(y ). Hvis X og Y derimod er afhængige, er den
betingede fordeling for Y, f Y│X (y │
x ), forskellig for forskellige værdier af
X. Værdien af X giver os altså information om Y’s fordeling.
Regression fokuserer på den betingede middelværdi, E (Y│X = x ),
som er et beskrivende mål for den betingede fordeling, f Y│X(y │x ). Som vi
tidligere har vist, er det nemmere at fortolke et beskrivende mål end hele
fordelingen. Den betingede middelværdi er en funktion af x og kaldes
også regressionsfunktionen a f Y på X. Den er formelt defineret i boksen
for henholdsvis diskrete og kontinuerte stokastiske variabler.
Regressionsfunktionen, E (Y│
X = x ):
For en diskret stokastisk variabel, Y, er den betingede middel­
værdi af Y givet X = x:
hvor
y1,...,yNer de N m ulige værdier a f Y, og f Y│X(y │x ) er den
betingede sandsynlighedsfunktion defineret i kapitel 4.
For en kontinuert stokastisk variabel, Y, er den betingede mid­
delværdi a f Y givet X =x :
hvor f Y│X(y │x) er den betingede tæthedsfunktion defineret i ka­
pitel 4 .
Funktionen E (Y│X = x ) er en funktion af x . Den kaldes regressi­
onsfunktionen af Y på X.
De betingede middelværdier er udregnet på samme måde som de almin­
delige middelværdier i kapitel 5. Den eneste forskel er, at sandsynlig­
hedsfunktionen (eller tæthedsfunktionen) er udskiftet med den betinge­
de sandsynlighedsfunktion (eller den betingede tæthedsfunktion).
Når man regresserer Y på X, kalder man X den forklarende variabel
og Y den forklarede variabel. Man bruger også nogle gange betegnelser
som, at X er den uafhængige variabel og Y den afhængige variabel.
Eksempel 17.1: En regressionsfunktion – del 1
To diskrete stokastiske variabler, X og Y, har følgende simultane sand­
synligheder:
Tabel 17.1:
og marginale
Marginal sandsynlighed
X= 1
X=2
Y= 0
0,3
0,1
0,4
Y= 1
0,2
0,4
0,6
Marginal sandsynlighed
for X: f X( x )
0,5
0,5
Simultane
fo r Y:f Y(y )
sandsynlighe­
der for X og Y
I tabel 17.1 er også de marginale sandsynligheder for Y og X angivet.
Dermed kan de betingede sandsynligheder for Y givet X beregnes ved
hjælp a f følgende formel fra kapitel 4:
Resultatet er opsummeret i tabel 17.2:
Tabel 17.2:
fY│X(y│1)
Betingede
sandsynlighe­
fY│X( y│2)
Y=0
Y=0
Y= 1
Y=1
der for Y givet
X =x
Deraf kan middelværdien a f Y, givet X = 1, og middelværdien af Y,
givet X = 2, udregnes til:
E (Y │X = 1) = 0 · f Y│X( 0 |1) + 1 · f Y│
X (1|1) = 0 · 0,6 + 1 · 0, 4 = 0,4
E (Y │X = 2) = 0 · f Y│X (0|2) + 1 · f Y│X( 1|2) = 0 · 0,2 + 1 · 0,8 = 0,8
Regressionsfunktionen a f Y på X er da:
Det ses, at E (Y │
X = x ) er en funktion a f x . For at tydeliggøre dette, så
lad h(x ) = E (Y │X = x ). Da er:
■
I eksempel 17.1, hvor X kun kan antage to forskellige værdier, 1 og 2,
får man tilsvarende to værdier a f regressionsfunktionen: E (Y │X = 1) og
E (Y │X = 2). Vi kan fortolke denne situation som en situation med to
grupper i en population, hvor den ene gruppe er kendetegnet ved X = 1,
og den anden gruppe har X = 2. Middelværdierne a f Y for de to grupper
er henholdsvis E (Y │X = 1) og E (Y │X = 2).
Regression har imidlertid mere generel anvendelse end dette tilfæl­
de med kun to mulige værdier a f X. Hvis X i stedet kan antage alle mu­
lige værdier, giver regressionsfunktionen den betingede middelværdi af
Y for enhver af disse værdier.
17.1.2
Forudsigelse af Y med regressionsfunktionen
En måde at forudsige værdien a f Y på, hvis man kender værdien a f X,
er at bruge regressionsfunktionen. Dermed bliver forudsigelsen lig med
den betingede middelværdi af Y givet den kendte værdi x a f X , dvs.
E (Y│X = x ).
Det er vigtigt at huske, at regressionen a f Y p å X kun giver sammen­
hængen mellem x og den betingede middelværdi a f Y. Den faktiske
værdi a f Y for en given x er kun sjældent lig med den betingede mid­
delværdi. Forskellen mellem den faktiske værdi a f Y og den betingede
middelværdi a f 7 kaldes forudsigelsesfejlen:
U = Y – E ( Y│X = x )
Fordi forventningen til Y givet X = x er E ( Y │
X = x), rammer regres­
sionen i gennemsnit plet, dvs. man vil ikke forvente en systematisk
forudsigelsesfejl på Y. Derfor er den betingede middelværdi af forud­
sigelsesfejlen lig med nul: E (U │X = x) = 0 . Da E ( U │
X = x) = 0 for
alle værdier af x, er også den ubetingede middelværdi a f U lig med nul,
E ( U ) = 0.
Eksempel 17.2: En regressionsfunktion – del 2
Hvis vi i eksempel 17.1 ved, at X = 1, da er vores forudsigelse a f Y givet
ved:
E ( y │X = 1) = 0,4
Denne forudsigelse vil aldrig ramme plet, idet Y enten er 0 eller 1. For­
udsigelsesfejlen er:
Den forventede værdi af forudsigelsesfejlen, U, givet X = 1, er:
E(U│
X = 1) = – 0,4 · fY│X (0|1) + 0,6 · f Y│X(1|1) = – 0,4 · 0,6 + 0,6 · 0,4 = 0
Tilsvarende kan man vise, at forudsigelsesfejlen også har forventet vær­
di 0, hvis X = 2.
■
Når man bruger en anden metode end regressionsfunktionen til at for­
udsige Y, får man også en anden forudsigelsesfejl. Man kan undersø­
ge, hvilken metode der er „bedst“, hvis man definerer, hvad man for­
står ved „bedst“ . Hvis man med „bedst“ mener en forudsigelse, som i
gennemsnit rammer rigtigt, E ( U │
X = x ) = 0, så opfylder regressions­
funktionen E (Y │X = x ) dette kriterium. Hvis man med „bedst“ mener
en forudsigelse, som har den mindste varians a f forudsigelsesfejlen,
V(U │X = x ), opfylder regressionsfunktionen også dette.23 Regressions­
funktionen har altså begge disse ønskværdige egenskaber, når man bru­
ger den til forudsigelser.
Man kan blive fristet til at tro, at hvis man med X kan forudsige
Y, så forårsager X også Y. Det er imidlertid ikke altid tilfældet. Hvis
man fx laver en regression a f mængden a f kriminalitet på størrelsen
a f politistyrken i forskellige områder, så finder man typisk, at der er
en positiv sammenhæng: Jo mere politi, desto mere kriminalitet. Hvis
man giver denne sammenhæng en kausal fortolkning, dvs. at mere po­
liti forårsager mere kriminalitet, er det klart, hvad man skal gøre for at
nedbringe kriminaliteten: Mindre politi. Der kunne dog også være den
forklaring, at man øger politistyrken i et område, hvor der er mere kri­
minalitet. Ifølge denne forklaring er det kriminaliteten, som forårsager
politistyrkens størrelse. Om det er den ene eller anden forklaring, eller
ingen af dem, som er sand, kan man ikke vurdere udelukkende ved
hjælp af regressionsfunktionen. Bemærk, at dette hænger tæt sammen
med den diskussion, vi havde i kapitel 3 om spuriøse sammenhænge.
17.2
Simpel lineær regression
I praksis starter man ofte med at forudsætte, at den betingede middel­
værdi, E (Y │X = x ), er lineær i værdien a f x . Det betyder, at hvis man
i et koordinatsystem har x på 1.-aksen og den betingede middelværdi
a f Y givet X = x på 2.-aksen, så ligger punkterne på en ret linje. I ek­
sempel 17.1 kan X kun antage to værdier, og der er derfor en lineær
sammenhæng mellem x og E ( Y │X = x ), idet man altid kan forbinde
to punkter med en ret linje. Havde X kunnet antage en tredje værdi,
X = 3, ville sammenhængen ikke nødvendigvis være lineær. Hvis fx
E ( Y │X = 3) = 0,5, så ligger de tre punkter ikke længere på en ret linje,
som illustreret i figur 17. la. Hvis derimod E ( Y │
X = 3) = 1,2, så er sam­
menhængen lineær. Dette er vist i figur 17.1b.
23 En betinget varians, fx V(Y│X = x), er ligesom en betinget middelværdi, E(Y│X = x), defineret ved
hjælp af den betingede fordeling, f Y│X(y │x). Formelt er den for en diskret stokastisk variabel, Y, givet ved:
hvor y i er de mulige værdier af Y. Hvis Y er kontinuert, er definitionen:
Figur 17.1:
a) I kke-lineær
og b) lineær
sammenhæng
mellem x og
E(Y │X = x )
Hvis sammenhængen mellem x og E (Y│X = x ) er lineær, og der kun
er én forklarende variabel, X, bruger man betegnelsen simpel lineær
regression. Boksen indeholder den præcise definition:24
Sim pel lineær regression af Y på X :
E (Y │X = x ) = β 0 + β1 · x
hvor β 0 og β 1 er konstante koefficienter, der kaldes henholdsvis
intercept og hældningskoefficient.
Den simple lineære regression a f Y på X kan også skrives som:
Y = β 0 + β 1 · X + U, hvor E (U │X = x ) = 0
Eksempel 17.3: Blue Bull
Et marketingbureau har fundet ud af, at den forventede ugentlige ef­
terspørgsel, Y, efter læskedrikken Blue Bull er en lineær funktion af
prisen, x :
E (Y │X = x ) = 3000 – 200 · x
hvor Y er målt i antal flasker og prisen x i kroner per flaske. Hvis pri­
sen på Blue Bull er 10 kr. per flaske, er den forventede efterspørgsel
3000 – 200 · 10 = 1000 flasker. Øger man derimod prisen til 11 kr.
24 En matematisk connaisseur vil indvende, at β0 + β 1 · x er en affine funktion, hvorimod den kun er en
lineær funktion, hvis β 0 = 0. Vi vil dog holde os til den gængse – men ikke korrekte – brug a f navnet lineær
funktion.
per flaske, falder den forventede efterspørgsel til 3000 – 200 11 = 800
flasker.
Den faktiske efterspørgsel ved en pris på 11 kr. per flaske er dog ikke
nødvendigvis 800 flasker. Fortolkningen a f en forventet værdi er som
tidligere: Forestiller man sig, at man gentager eksperimentet uendeligt
mange gange, vil man i gennemsnit afsætte 800 flasker om ugen, når
prisen er 11 kr. per flaske.
■
Man kan vise, at man kan beregne koefficienterne β 0 og
ud fra va­
riansen a f X og kovariansen mellem X og Y. Formlerne er givet i den
følgende boks.
Beregning a f koefficienter i den simple lineære regression:
I den simple lineære regression E (Y │X = x ) – β 0 + β 1 · x er
koefficienterne β 0 og β 1 givet ved:
Formlerne hjælper til en fortolkning a f den simple lineære regression.
Hvis X og Y er ukorrelerede, så er Cov(X, Y) = 0, og dermed er β 1 = 0.
Regressionsfunktionen er i dette tilfælde E ( Y │X = x) = β 0 = E(Y).
Regressionen afhænger således ikke a f værdien af x. Man kan med an­
dre ord ikke bruge information om X til at forudsige den forventede
værdi a f Y, når X og Y er ukorrelerede. Dette er også tilfældet, hvis X og
Y er uafhængige, idet uafhængighed medfører, at X og Y er ukorrelere­
de. Når man ikke kan bruge information om X til at forudsige middel­
værdien a f Y, er det bedste bud på den betingede middelværdi a f Y givet
X = x blot middelværdien, E (Y ).
Man kan også se a f formlen for β 1 at fortegnet på β 1 er bestemt a f
Cov(X, Y), idet V(X) altid er positiv. Hvis X og Y er positivt korrelere­
de, så har β 1 også positivt fortegn. Dermed er middelværdien a f Y givet
X = x stigende i x. I eksempel 17.3 er β 1 = –200, dvs. negativ. Det bety­
der, at prisen og efterspørgslen er negativt korrelerede, hvilket intuitivt
passer med, at en højere pris sænker efterspørgslen.
Man kan også fortolke regressionen i forhold til effekten på den for­
ventede værdi a f Y a f en lille ændring i x. Antag, at vi øger x med én
enhed. Da vil den forventede værdi a f Y ændre sig på følgende måde:
Δsim p el = E ( Y │X = x + 1) – E ( Y │X = x )
= [β 0 + β 1 · (x + 1)] – [β 0 + β 1 · x] = β 1
hvor Δsimpel er ændringen i den forventede værdi af Y, givet at man øger
x med én enhed. Koefficienten β 1 i den simple lineære regression kan
man altså fortolke som ændringen i den forventede værdi a f Y, når man
øger værdien a f X med én enhed. I eksempel 17.3 vil en stigning i pri­
sen på Blue Bull på 1 kr. altså resultere i en nedgang i den forventede
efterspørgsel på 200 flasker.
17.3
Estimation af den simple lineære regressionsfunktion
I praksis kender vi ikke koeffi cienterne β 0 og β ,1 som indgår i den line­
ære regression a f Y på X. I dette afsnit viser vi, hvordan man med en
simpel tilfældig stikprøve kan få et skøn på β 0 og β 1 og dermed på den
lineære regressionsfunktion.
17.3.1
Stikprøveanalogprincippet
I udtrykkene for β 0 og β 1 fra ovenstående boks indgår de beskrivende
mål E (Y), E(X), V(X) og Cov(X,Y). Som vi allerede har set i kapitel
10 og 12, kan vi konstruere skøn på disse størrelser, hvis vi har en sim­
pel tilfældig stikprøve. Hver observation i stikprøven er et par beståen­
de af en observation af X og en observation a f Y. Stikprøven er derfor:
(( X 1,Y1) ,( X 2,Y2),...,(X n,Yn) ) . I kapitel 10 viste vi, at skøn på E(X ) og
E ( Y ) er givet ved stikprøvegemmensnittet:
I kapitel 12 viste vi, at skøn på V(X) og Cov(X, V) er givet ved:
Vi kan nu bruge stikprøveanalogprincippet og erstatte alle de ukendte
størrelser i udtrykkene for β 0 og β 1 i afsnit 1 7 med skønnene baseret
på stikprøven. Dermed bliver estimatorer n for β 0 og β 1:
Estimatorer for β 0 og β1:
Estimatoren for den simple lineære regressionsfunktion er da:
Eksempel 17.4: Rødvin og indkomst – del 1
I en markedsundersøgelse har man udtrukket en simpel tilfældig stik­
prøve a f en persons månedlige forbrug a f rødvin, Y, målt i liter, og per­
sonens månedlige indkomst, X, målt i tusinde kroner. Den realiserede
stikprøve med n = 10 observationer er vist i tabel 17.3:
Tabel 17.3:
x i (indkomst)
y i (forbrug)
22,2
5,04
(indkomst og
12,1
2,96
forbrug)
14,3
3,08
8,1
3,58
17,6
5,52
10,8
2,73
7
3,78
10,1
3,87
9,8
2,70
12,3
4,70
Realiseret
stikprøve
Baseret på stikprøven kan man udregne følgende skøn på E (Y), E(X),
V(X) og C ov(X ,Y ):
Dermed er estimaterne på β 0 og β 1:
Skønnet på den lineære regressionsfunktion bliver således:
Der er således en positiv sammenhæng mellem indkomsten og det for­
ventede forbrug. Den forventede ændring i rødvinsforbruget er 0,134
liter ved en forøgelse a f indkomsten med 1000 kr. per måned.
Bemærk, at man ikke kan konkludere, at sammenhængen er kausal.
Det kan være, at man forbruger mere rødvin, fordi man har en højere
indkomst. Det kan dog også være, at man ønsker at forbruge mere rød­
vin og derfor må skaffe sig en højere indkomst.
■
17.3.2
Mindste kvadraters metode
Estimatorerne
kalder man ofte for mindste-kvadraters-meto­
de-estimatorer eller OLS-estimatorer.25 Årsagen til dette navn er, at den
måde,
beregnes på, også kan ses som et forsøg på at finde en ret
linje, b0 + b1 · x , der ligger så tæt som muligt på de observerede vær­
dier a f Y i stikprøven. Som mål for afstanden mellem linjen og obser­
vationerne a f Y i stikprøven bruger man summen a f de lodrette afstande
kvadreret. Denne sum er
25
Forkortelse af den engelske betegnelse „Ordinary Least Squares“.
Dette er illustreret i figur 17.2 for en stikprøve med otte observationer:
Figur 17.2:
Mindste
kvadraters
metode (OLS)
Man kan vise, at de værdier af b0 og b1, som sikrer, at ovenstående kva­
dratsum bliver mindst mulig, lige nøjagtig er estimatorerne
de skøn, der be­
fra det foregående afsnit. Med andre ord er
virker, at summen af de kvadrerede forskelle mellem hver observation
a f Y og den estimerede regressionsfunktion bliver mindst mulig.
17.3.3
Egenskaber ved OLS-estimatorerne
Ligesom ved andre estimatorer, vi har undersøgt, vil vi gerne kende for­
for at kunne bedømme deres
delingen af OLS-estimatorerne,
egenskaber. Vi vil i dette afsnit opstille nogle antagelser, under hvilke
vi kan udlede deres fordeling.
I kapitel 10 gennemgik vi forskellige egenskaber, som vi gerne vil
have, at estimatorer besidder. En estimator er central (unbiased), hvis
dens forventede værdi er lig den størrelse, som den er en estimator for.
En estimator skal også helst være konsistent. Det betyder, at hvis stik­
prøven er meget stor, er der en sandsynlighed tæt på 1 for, at estimato­
ren er tæt på den sande værdi. Den følgende boks indeholder en samling
har disse egenskaber:
a f antagelser, under hvilke
Egenskaber ved O LS-estim atorer i simpel lineær regression:
Antagelser:
1. Simpel lineær regression: E (Y│X = x) = β 0 + β 1 · x
2. Simpel tilfældig stikprøve: ((X 1,Y1) ,(X 2,Y2),...,(X n,Yn))
3. V ( Y│Χ = x ) = σ 2, dvs. variansen a f Y afhænger ikke af x.
4. For given X =x er Y normalfordelt.
Under antagelserne:
• 1 og 2 er
vis β0 og β 1:26
•
1,2 og 3 er
hvor
•
centrale og konsistente skøn på henholds­
approksimativt normalfordelte:
er variansen af
1,2, 3 og 4 er
hvor
er variansen af
er variansen af
eksakt normalfordelte:
er variansen af
Den første antagelse sikrer, at vi har den rigtige specifikation a f re­
gressionsfunktionen. Den anden antagelse implicerer, at fx (Χ 1, Y1) og
(X2, Y2) er uafhængige. Det betyder, a t X1 er uafhængig a f både X 2 og Y 2
og tilsvarende for Y1. Antagelsen betyder ikke, a t X 1er uafhængig a f Y1
I så fald er der ingen pointe i at lave regressionen a f Y på X. Den tredje
antagelse siger, at den betingede varians a f Y ikke afhænger a f værdien
a f X. Antagelsen bevirker, ud over at skønnene på varianserne af
og
bliver nemmere at udregne, at estimatorerne
er efficiente,
og
dvs. har den mindst mulige varians a f alle lineære centrale estimatorer
for β 0 og β 1 Dette resultat er kendt som Gauss-Markov-teorernet. Den
egenskab, at variansen a f Y ikke afhænger af X, hedder homoskedastici­
tet. Det modsatte er heteroskedasticitet.
For i praksis at kunne bruge det resultat, at
er normalfor­
delte, behøver man et skøn på varianserne af
samt et skøn på
variansen σ2 a f Y. Udtrykkene for disse skøn er givet i næste boks.
26
Under forudsætning af, at variansen af Y eksisterer.
Skøn på σ 2,
i simpel lineær regression:
Man kalder kvadratrødderne af
og standardfejlen af
af
17.3.4
I
for henholdsvis standardfejlen
kke-stokastisk forklarende variabel
OLS-estimatorerne kan man også anvende ved andre udvælgelsesme­
toder a f stikprøven end den simple tilfældige udvælgelse (antagelse 2)
i ovenstående boks). Dette er nyttigt, når man fx kan kontrollere den
forklarende variabel, X. I sådanne situationer er X ikke stokastisk, da vi
fastlægger den på forhånd. Hvis man fx producerer en vare, kan man
ofte selv bestemme prisen. En lignende situation opstår i laboratoriefor­
søg, hvor man kan kontrollere størrelsen a f den dosis, som en forsøgs­
person indtager. I sådanne tilfælde, hvor den forklarende variabel ikke
er stokastisk, siger vi, at X er fast.
Når X er fast, udskifter vi antagelse 2 om en simpel tilfældig stikprø­
ve med en antagelse 2 ´, som kun antager, at Y ’erne er ukorrelerede.27
De tre øvrige antagelser fra ovenstående boks er i al væsentlighed uæn­
drede. Da X ikke længere er stokastisk, kan vi ikke formelt set betinge
på en given værdi a f X, da den ikke er bestemt a f eksperimentet, men
af os. Derfor udskifter vi antagelse 1 om den betingede forventning,
27 Dette er en svagere antagelse end antagelsen om en simpel tilfældig stikprøve, som implicerer uaf­
hængighed mellem Yi’erne. I tilfældet med stokastiske X’e re pålægger antagelse 2) fra afsnit 17.3.3 også
restriktioner på X’erne. Det gør den nye antagelse 2') ikke, d a X nu er fast, dvs. bestemt af os. For at den
i den følgende boks skal være korrekt, er det nødvendigt at lægge visse
approksimative fordeling af
begrænsninger på X. En nem og tilstrækkelig begrænsning er, at hvis man gentager eksperimentet, bruger
man de samme værdier a f X.
E ( y │X = x ), med en ny antagelse 1´ om E(Y), og tilsvarende udskif­
ter vi antagelse 3 om den betingede varians, V ( Y │ X = x ), med en ny
antagelse 3 ´ om V(Y). Fortolkningerne a f disse to antagelser er dog
stort set helt de samme. Den følgende boks opsummerer resultatet, når
X er fast.
Egenskaber ved O LS-estimatorer i simpel lineær regression
med fast X :
Antagelser:
1’. Simpel lineær regression: E (Y ) = β 0 + β1 · x .
2 ’. Yi’erne er ukorrelerede, dvs. Cov( Yi,Yj ) = 0 for alle værdier
a f i og j , hvor i ≠ j .
3’. V ( Υ ) = σ 2 , hvor σ 2 ikke afhænger a f x .
4 ’. Y er normalfordelt.
Under antagelserne:
•
1’ og 2 ’ er
holdsvis
centrale og konsistente skøn på hen­
approksimativt normalfordelte:
•1’, 2 ’ og 3 ’ er
hvor
•
er variansen af
1’, 2 ’, 3 ’ og 4 ’ er
Skøn på
med stokastisk X.
17.4
er variansen af
eksakt normalfordelte.
kan man udregne på samme måde som i tilfældet
Specifikationstest af simpel lineær regression
Inden man bruger den estimerede regressionsfunktion til at fortolke en
sammenhæng mellem Y og X, skal man sikre sig, at regressionsmodel­
len er en fornuftig model. Fornuftig betyder her, at antagelserne for re­
gressionsmodellen er opfyldt. I de næste underafsnit viser vi forskellige
grafiske metoder til at undersøge, om antagelserne er opfyldt.
For den simple lineære regressionsmodel opstillede vi fire antagel­
ser i boksen i afsnit 17.3.3. Man kan få et godt indtryk af, om antagel­
serne holder, ved at se på forskellige typer a f grafiske plot. Til dette får:
vi brug for følgende størrelser:
Estimeret afhængig variabel:
Residual:
Ûi = Yi – Ŷ , i = .1,n
For hver observation, (xi, y i), i den realiserede stikprøve kan man ud­
regne ŷi og ûi, hvor ŷi er estimatet a f den betingede forventning a f Y
givet værdien a f X for den i’te observation i stikprøven. Det estimerede
residual, ûi, er forskellen på denne betingede forventning og den fakti­
ske observation, y i, i stikprøven, dvs. den lodrette afstand mellem den
estimerede regressionsfunktion og den i’te observation a f Y.
Eksempel 17.5: Rødvin og indkomst – del 2
= 0,134
I eksempel 17.4 fandt vi følgende værdier a f estimatorerne:
=
2,131.
De
estimerede
værdier
a
f
den
afhængige
variabel
er da
og
givet ved: ŷi = 2,131 + 0,134 · xi I følgende tabel er ŷi og ûi udregnet
for de 10 observationer i stikprøven:
Tabel 17.4:
xi (indkomst)
y i (forbrug)
ŷi
ûi
forklarede
22,2
5,04
5,11
–0,07
variabler, ŷ i ,
12,1
2,96
3,75
–0,79
og residualer,
14,3
3,08
4,05
–0,97
8,1
3,58
3,22
0,36
17,6
5,52
4,49
1,03
10,8
2,73
3,58
–0,85
7
3,78
3,07
0,71
10,1
3,87
3,48
0,39
9,8
2,70
3,44
–0,74
12,3
4,70
3,78
0,92
Estimerede
ûi
Residualerne summerer til nul, når der ses bort fra afrundingsfej l . Dette
er en generel egenskab ved OLS-estimatorerne.
Figur 17.3:
Estimeret
regressions­
funktion
■
Man kan udføre formelle statistiske test a f de fire antagelser. Det vil
imidlertid gå for vidt at beskrive disse test her. Mange statistikprogram­
mer udregner imidlertid automatisk disse test. Man kan også typisk få
statistikprogrammerne til at tegne alle de grafiske plot, vi beskriver ne­
denfor. Det er faktisk forbløffende, hvor stor indsigt i et problem man
kan få ved at se på de forskellige plot. Så selvom man tester forudsæt­
ningerne formelt, bør man også altid kigge grundigt på plottene. I det
følgende gennemgår vi hver enkelt antagelse for sig.
17.4.1
Antagelse 1: Funktionel form
Til at undersøge, om den betingede middelværdi a f Y er lineær i x, kan
man plotte de estimerede residualer, ûi, mod ŷi. i et koordinatsystem
med ŷi. ud ad 1.-aksen. Man kan også plotte residualerne, ûi, mod x i.
Sådanne plot kalder man residualplot. Hvis antagelse 1 er korrekt, skal
residualerne fordele sig omkring 1.-aksen uden noget mønster. Figur
17.4 viser en situation, hvor den lineære regressionsfunktion (sandsyn­
ligvis) er korrekt. I figur 17.4a er y i plottet im od x i, og figur 17.4b viser
residualplottet. Det ses, at residualerne tilsyneladende fordeler sig til­
fældigt omkring 1.-aksen.
Figur 17.4:
Korrekt funk­
tionel form
I figur 17.5 har vi derimod en situation, hvor den lineære regressionsfunktion (sandsynligvis) ikke er korrekt. I figur 17.5a er y i. plottet imod
xi, og det ses, at sammenhængen bøjer opad for høje værdier a f x . Det
indtryk træder endnu tydeligere frem i residualplottet i figur 17.5b. Her
er det tydeligt, at residualer er positive for lave og høje værdier a f ŷi,
hvorimod residualerne er negative for mellemstore værdier a f ŷ i
Der er altså en tendens til, at den estimerede betingede middelværdi,
Ê (Y │X = x ), rammer systematisk forkert, og at den valgte lineære form
for den betingede middelværdi dermed ikke er korrekt. Det ser derimod
ud til, at der kunne være en kvadratisk (x 2) sammenhæng mellem x og
den forventede værdi a f Y.
Figur 17.5:
Fejlspecificeret
funktionel form
17.4.2
Antagelse 2: Simpel tilfældig stikprøve
Antagelsen om, at stikprøven er simpel tilfældig, kan være overtrådt,
hvis man fx har indsamlet stikprøven over tid. Et eksempel kunne være,
at man har en stikprøve af huspriser, hvor den første observation (i = 1)
er for året 1980, den næste observation (i = 2) for året 1981 og så frem­
deles frem til fx observation (i = 21), som er indsamlet i år 2000. En
stikprøve, som er indsamlet på denne måde, kalder man en tidsrække.
Da der ofte er en sammenhæng mellem det, der skete sidste år, og det,
der sker i år, vil det typisk gøre observationerne afhængige. Sagt med
andre ord: Sidste års boligpriser giver os information om dette års bo­
ligpriser. I så fald er stikprøven ikke simpel tilfældig, fordi dette kræ­
ver, at observationerne er uafhængige.
Hvis man har en stikprøve a f observationer over tid (en tidsrække),
kan man plotte residualerne ûi mod tiden, i. Hvis stikprøven er simpel
tilfældig, bør residualerne være tilfældigt fordelt omkring 1.-aksen.
Der kan imidlertid også være andre grunde til, at stikprøven ikke er
simpel tilfældig. Hvis man i eksempel 17.4 har indsamlet stikprøven
ved at spørge 10 kunder i den lokale vinhandel om deres indkomst og
forbrug a f vin, er stikprøven næppe simpelt tilfældigt udvalgt fra hele
populationen. Her vil man nok forvente, at de, der er kunder i forret­
ningen, har et vinforbrug, der er over det gennemsnitlige for personer
i deres indkomstklasse. Med andre ord vil Y for disse personer have en
tendens til at være større end den betingede middelværdi af Y for per­
soner med samme indkomst. Man kan vise, at OLS-estimatoren i dette
tilfælde ikke engang er konsistent, hvilket betyder, at resultaterne ikke
er troværdige. I dette tilfælde er årsagen selektionsbias, som betyder, at
sandsynligheden for at være med i stikprøven afhænger a f den forklare­
de variabel, Y. Vi beskrev en lignende situation i kapitel 9.
Bemærk, at sandsynligheden for at være i stikprøven også kan af­
hænge a f den forklarende variabel, X, fx indkomsten. Når selektionen
afhænger af den forklarende variabel, medfører det dog ikke et problem
for konsistensen a f OLS-estimatoren.
17.4.3
Antagelse 3: Homoskedasticitet
Antagelsen om homoskedasticitet betyder, at variansen a f Y skal være
den samme uanset værdien a f X. Heteroskedasticitet kan for eksem­
pel forekomme, når man som i eksempel 17.4 undersøger forbrnget af
et produkt, og den forklarende variabel er indkomsten. Personer med
høj indkomst, X, har flere forbrugsmuligheder end personer med en
lav indkomst. Derfor varierer deres forbrug ofte mere end forbrnget
for personer med en lav indkomst. Variationen omkring den betingede
middelværdi, dvs. variationen i Y givet X = x , er altså højere for store
værdier af X.
For at få en idé om, hvorvidt antagelsen om homoskedasticitet hol­
der, kan man kigge på de kvadrerede residualer, ûi2. Disse giver en indi­
kation a f variansen a f U givet X og dermed a f variansen a f Y givet X .28
Man kan plotte de kvadrerede residualer mod den forklarende variabel.
Hvis antagelsen om homoskedasticitet er korrekt, skal spredningen af
de kvadrerede residualer være den samme for forskellige værdier a f den
forklarende variabel. Figur 17.6 illustrerer en situation, hvor variansen
a f Y givet X afhænger a f x (eller størrelsen a f Y). I figur 17.6a er y i plot­
tet im od x i, og det ses, at yi’erne er mere spredte for høje værdier af x i.
Dette indtryk bekræftes i figur 17.5b, hvor de kvadrerede residualer, ûi2,
er plottet imod ŷi og i figur 17.5c, hvor de kvadrerede residualer, ûi2, er
plottet imod x i I begge figurer stiger variationen for højere værdier af
henholdsvis ŷi og xi.
Figur 17.6:
Heteroskedasticitet
28
Den betingede varians a f Y givet X kan skrives som:
V(Y│X = x ) = V(β 0 + β 1Χ+ U │
X = x)
hvor vi har udnyttet, at Y = β0 + β 1 · X . Her kan X betragtes som en konstant, da vi betinger på, at X skal
være lige med x. Det betyder, at β 0 + β1 · X kan betragtes som en konstant i udtrykket på højre side af lig­
hedstegnet. Dermed bliver V(Y\X = x) = V(U│X = x) i henhold til regnereglerne for varianser i kapitel 5.
17.4.4
Antagelse 4: Normalfordelte observationer
Hvis antagelse 4 om normalfordelte observationer holder, har det den
fordel, at vi kender fordelingerne a f β0 og β 1 , selv når stikprøvestørrel­
sen er lille. I afsnit 17.5 vil vi vise, hvordan disse fordelinger kan bru­
ges til at teste hypoteser om koefficienternes størrelser. Inden vi når så
langt, vil vi i dette afsnit introducere to grafiske metoder til at sammen­
ligne en estimeret fordeling med en hypotetisk fordeling. Disse metoder
kan bruges til at teste, om antagelse 4 er opfyldt.
Baggrunden for de to grafiske metoder er følgende: Antag, at vi øn­
med en
sker at sammenligne en estimeret fordelingsfunktion,
hypotetisk fordelingsfunktion,
Den estimerede fordelingsfunk­
tion kunne fx være den empiriske fordelingsfunktion, der blev intro­
duceret i afsnit 12.4, mens den hypotetiske fordelingsfunktion er en,
vi vælger. Den kunne i dette tilfælde være standardnormalfordelingen,
En nærliggende sammenligning af
kunne bestå i at tegne graferne for de to funktioner i det samme diagram
med u på den vandrette akse og
på den lodrette akse.
kere, at fordelingerne
er ens. Hvis der er store forskelle mellem de to grafer, vil det også være
nemt at spotte i et sådant diagram, men er forskellene mindre, kan det
være sværere at se. Fx hvis forskellene kun optræder for meget store
eller meget små værdier a f u. A f denne grund introducerer vi nu de to
(alternative) grafiske metoder.
Den første metode kaldes et (p,p)-plot. I et (p,p)-plot vælger vi en
værdi a f u, fx u1, og markerer det punkt i et koordinatsystem, som har
som 2. ko­
som 1. koordinat (den vandrette akse) og
ordinat (den lodrette akse), dvs. punktet
Bemærk, at
værdien a f u] ikke bliver afsat på hverken den vandrette eller den lod­
rette akse. Ideen bas dette er, at hvis
er identiske, så
vil punktet
ligge på den 45-graderslinie, der går gen­
nem (0,0) i koordinatsystemet. Vi kan derfor undersøge, om
og
er ens ved at vælge mange forskellige værdier a f u og markere
de tilhørende punkter
i koordinatsystemet for at se om
de ligger på 45-graders linjen. Et sådant plot af
for for­
skellige værdier a f u kaldes et (p,p)-plot eller et “probability plot”. Be­
tegnelsen (p,p)-plot refererer til det faktum, at enhederne på både den
vandrette og den lodrette akse er (kumulative) sandsynligheder.
Den primære fordel ved et (p,p)-plot i forhold til et simpelt diagram
er, at det er meget lettere at afgøre,
med graferne for
om én graf ligger oven på 45-graders linjen, end at afgøre, om to grafer
for to ikke-lineære funktioner er sammenfaldende. (p,p)-plottet har des­
uden den fordel, at alle værdier ligger mellem 0 og 1, så man kan nøjes
med at tegne 45-graders linjen og (p,p)-plottet i dette interval, mens
skal tegnes for alle de mulige værdier a f u, hvilket i
princippet kan være alle værdier mellem –∞ og ∞ .
Vi kan nu anvende (p,p)-plottet til at undersøge, om antagelse 4
ser ud til at holde, dvs. vi skal undersøge, om Y er normalfordelt for
enhver værdi a f X. Det er en omfattende opgave, eftersom X poten­
tielt kan antage mange forskellige værdier, og vi er nødt til at lave et
(p,p)-plot for hver a f disse værdier. Vi kan dog forenkle problemet en
anelse, idet antagelse 1 giver os middelværdien a f Y for hver værdi af
X , og antagelse 3 fortæller os, at variansen a f Y ikke afhænger a f X.
Disse to antagelser kan brugs til at omdefinere opgaven fra at under­
søge om Y er normalfordelt for enhver værdi a f X til at undersøge om
U er normalfordelt. Årsagen er, at hvis Y ~ Ν (β 0 + β 1 · x, σ 2), så er
U = Y – (β 0 + β 1 · x ) ~ N (0, σ 2), og selvom fordelingen a f Y afhæn­
ger a f x , så gør fordelingen a f U det ikke. Dvs. vi behøver blot at under­
søge om U er normalfordelt.
For at kunne undersøge, om U er normalfordelt, skal vi bruge en
estimator for fordelingen a f U. Eftersom vi kan beregne residualerne,
Û i , kan vi også beregne den empiriske fordelingsfunktion for disse.
Denne er givet ved:
Vi skal sammenligne denne empiriske fordeling med normalfordelin­
gen med middelværdi 0 og varians σ 2, dvs.
hvor man i stedet for σ kan bruge standardafvigelsen af residualerne fra
Dermed får vi (p,p)-plottet ved at plotte:
stikprøven,
for alle værdier a f u (i stikprøven). Hvis residualerne er normalfordelte
vil grafen blive en ret 45-graders linje gennem punkterne (0,0) og (1,1).
I praksis vil punkterne aldrig ligge præcis på en ret linje, men spørgs­
målet er også blot, om der er tegn på systematiske afvigelser fra en ret
45-graders linje. Det vil i så fald indikere manglende normalitet. Det
næste eksempel illustrerer den generelle teknik.
Eksempel 17.6: (p, p) plot
I regnearket nedenfor er der en stikprøve med 30 observationer af en
stokastisk variabel, X. I kolonne B har vi de sorterede observationer, og
i kolonne C er den empiriske fordelingsfunktion,
angivet. Vi
ønsker at undersøge om X er normalfordelt, og vi skal derfor sammen­
holde den empiriske fordelingsfunktion med
, hvor
og S er henholdsvis gennemsnittet og standardafvigelsen fra
stikprøven, da den sande middelværdi og standardafvigelse a f X er
ukendte. I kolonne E er sandsynlighederne,
bereg­
net for værdierne a f x fra stikprøven. Grafen viser
plottet mod
for de 30 observationer i stikprøven.
I ovenstående graf ligger punkterne tilnærmelsesvis på en ret linje, og
det er derfor rimeligt at antage, at observationerne er normalfordelte.
I figuren nedenfor har vi en anden stikprøve. Det ses, at punkterne
her afviger fra den rette linje i enderne. Fordelingen er derfor sandsyn­
ligvis ikke en normalfordeling i dette tilfælde.
Den anden grafiske metode kaldes et (q,q)-plot. Den grundlæggende
ide er, at hvis to fordelinger er identiske, har de også de samme fraktiler
(se afsnit 5.3 for definitionen a f en fraktil). I (p,p)-plottet plottede vi
sandsynlighederne fra en estimeret fordeling mod sandsynlighederne
fra en hypotetisk fordeling. I (q,q)-plottet plotter vi fraktilerne fra en
estimeret fordeling mod fraktilerne fra en hypotetisk fordeling.
være p -fraktilen fra
(q,q)-plottet konstrueres på følgende vis: Lad
den hypotetiske kumulative sandsynlighedsfunktion,
(u), og lad
være p -fraktilen fra den estimerede kumulative sandsynlighedsfunkti­
Betragt fx p 1-fraktilen. Her skal vi bruge det punkt, der har
on,
som 1. koordinat og
som 2. koordinat. Hvis de to fordelinger er
identiske, vil dette punkt,
ligge på 45-graders linjen. Vi kan
derfor undersøge, om
er identiske, ved at vælge en
og
række forskellige værdier a f p, afsætte de tilhørende punkter i et ko­
ordinatsystem og tjekke, om de alle ligger på 45-graders linjen. Dette
kaldes et (q,q)-plot eller et fraktil-plot.
Typisk vælger man de fraktiler, der skal plottes, på følgen­
de måde: Den mindste observation i stikprøven er en estimator for
( 1 – 0,5)/n-fraktilen, mens den næstmindste observation er en estima­
tor for (1 – 0,5)/n-fraktilen osv. Hvis der er 10 observationer i stikprø­
ven, er den mindste observation således en estimator for 0,05-fraktilen
(idet (1 – 0,5)/10 = 0,05), den næstmindste en estimator for 0,15-frak­
tilen osv. op til den største observation, som bliver en estimator for
0,95-fraktilen. Vi skal med andre ord blot afsætte observationerne i vo­
res stikprøve ud ad 1.-aksen i diagrammet.
Op ad 2.-aksen skal vi afsætte de tilsvarende teoretiske fraktiler fra
den hypotetiske fordeling, fx fra normalfordelingen. Her ved vi, at der
eksisterer følgende lineære sammenhæng mellem en normalfordelt va­
riabel, X, og den standardnormalfordelte variabel, Z :
hvor μ er middelværdien a f X, og σ er standardafvigelsen a f X. Så i
stedet for at undersøge, om de teoretiske fraktiler for X danner en ret
linje med de estimerede fraktiler, kan vi lige så godt undersøge, om
de teoretiske fraktiler for Z danner en ret linje (dog ikke nødvendigvis
45-graders linjen) med de estimerede fraktiler. Derfor afsætter vi de til­
svarende teoretiske fraktiler for Z op ad 2.-aksen. Disse kan findes ved
hjælp a f tabel 2 bagerst i bogen.
Eksempel 17.7: (q, q)-plot
Stikprøven fra eksempel 17.6 indeholdt 30 observationer. Den mind­
ste observation bruges derfor som estimator for ( 1 – 0,5)/30 = 1/60 ≈
0,0167-fraktilen, mens den næstmindste bruges som estimator for (2 –
0,5)/30 = 1/20 = 0,05-fraktilen osv. I regnearket nedenfor har vi fundet
de tilsvarende fraktiler fra standardnormalfordelingen. I figuren har vi
endvidere plottet de 30 empiriske fraktiler, dvs. stikprøveobservatio­
nerne, mod de 30 teoretiske fraktiler. Billedet bekræfter konklusionen
fra eksempel 17.6.
17.5
Hypotesetest og konfidensinterval ved simpel lineær regression
Når man har sikret sig, at regressionsmodellens forudsætninger er op­
fyldte, kan man teste de hypoteser, som måske oprindeligt motiverede
hele undersøgelsen. I dette afsnit beskriver vi, hvordan man kan teste
hypoteser om hældningskoefficienten, β 1,i regressionsfunktionen.
For at teste, om den forklarende variabel har en effekt på den for­
ventede værdi a f den forklarede variabel, tester man, om hældningsko­
efficienten er lig med 0. Mere generelt vil vi dog gerne kunne teste, om
hældningskoefficienten er lig med en bestemt værdi, β 10. Toptegnet „0“
indikerer, at der er tale om værdien a f koefficienten under nulhypotesen.
Vi kan følge samme fremgangsmåde, som vi gjorde i kapitel 14 ved
test af en hypotese om en middelværdi. Derfor starter vi med at opstille
nul- og alternativhypoteserne, som her er:
Næste trin er at opskrive et hypotesemål, som kan skelne mellem nul­
hypotesen og alternativhypotesen, når man indsætter den sande vær­
di. Her bruger vi samme hypotesemål som ved test a f en middelværdi,
Dette hypotesemål er 0, hvis den sande værdi
nemlig
tilfredsstiller nulhypotesen, ellers er det forskelligt fra 0.
Sidste trin er at konstruere teststatistikken baseret på hypotesemå­
let. Først erstatter vi ukendte størrelser med skøn. Den eneste ukendte
For at
størrelse er β 1, som vi kan erstatte med OLS-estimatoren,
teststatistikken får en fordeling, som er nem at arbejde med, vælger vi
en teststatistik magen til den, der er brugt ved test a f en middelværdi.
Vi dividerer hypotesemålet med standardafvigelsen a f skønnet på
Skønnet på standardafvigelsen er kvadratroden af
som vi gav form­
len for i afsnit 17.3.3. Den følgende boks opsummerer testen.
Test af hældningskoefficienten, β 1, i den simple lineære re­
gression:
Teststatistik:
Under antagelserne 1, 2 og 3 er T ~ A N (0, 1) under H0.
Under antagelserne 1, 2, 3 og 4 er T ~ t(n – 2) under H0.
Eksempel 17.8: Rødvin og indkomst – del 3
I eksempel 17.4 beregnede vi et skøn på regressionen a f en persons
forbrug a f rødvin, Y, på personens indkomst, X. Vi fandt, at sammen­
hængen var positiv. Et spørgsmål er, om sammenhængen er statistisk
signifikant, eller om man kan tilskrive sammenhængen den naturlige
variation forårsaget af stikprøven. Vi vil derfor teste, om sammenhæn­
gen er statistisk signifikant på et 5 %-signifikansniveau.
Nul- og altemativhypoteserne er: H0 : β χ = 0 og H1 : β 1≠ 0. For at ud­
Ifølge boksen fra afsnit 17.3.3
regne teststatistikken skal vi beregne
er denne givet ved:
Vi ved allerede fra eksempel 17.4, at SX2 = 21,0. Vi mangler derfor
blot at beregne
Dermed er:
og værdien a f teststatistikken derfor:
De kritiske værdier finder vi fra standardnormalfordelingen. Med
α = 0,05 er disse: – 1,96 og 1,96. Da T er større end 1,96, forkaster vi
nulhypotesen og accepterer dermed, at der er en sammenhæng mellem
forventet rødvinsforbrug og indkomst. Havde vi i stedet valgt at bruge
de kritiske værdier fra t-fordelingen med n – 2 = 1 0 – 2 = 8 frihedsgra­
der, ville vi lige nøjagtig ikke kunne forkaste H0 ved et 5 %-signifikans­
niveau.
■
Ovenfor har vi behandlet hypotesetest for hældningskoefficienten. Man
kan følge nøjagtig samme procedure, hvis man vil teste en hypotese om
interceptet, β 0.
Ved hjælp a f de samme teknikker som i kapitel 13 kan vi desuden
opstille konfidensintervaller for de ukendte koefficienter, β 0 og β1. Bok­
sen nedenfor giver de nødvendige formler:
Konfidensinterval for en koefficient i den lineære regres­
sionsfunktion:
Under antagelserne 1, 2 og 3 er det approksimative ( 1 – α)-kon­
if densinterval for βk (k = 0 eller k = 1):
hvor Z 1–α/2 e r ( 1 – α/2)-fraktilen fra standardnormalfordelingen.
Under antagelserne 1, 2, 3 og 4 er det eksakte ( 1 – α)-konfidens­
interval for β k(k = 0 eller k = 1):
hvor t1–α/2(n – 2) er (1 – α/2)-fraktilen fra t-fordelingen med n – 2
frihedsgrader.
17.6
Usikkerhed på forudsigelser ved simpel lineær regression
Man kan bruge den estimerede regressionsfunktion til at forudsige Y
eller den forventede værdi a f Y givet en værdi a f den forklarende vari­
abel, som vi vælger. I eksempel 17.3 viste vi, hvordan man kan bruge
regressionsfunktionen til at forudsige den forventede efterspørgsel efter
Blue Bull-læskedrikken for en given pris, x . Dette kan fx være nyttigt,
hvis man vil undersøge, hvilken pris der giver det største overskud for
producenten a f Blue Bull.
I eksempel 17.3 kendte vi udseendet a f regressionsfunktionen:
E (Y │
X = x ) = 3000 – 200 · x , hvor Y var efterspørgslen, og x var pri­
sen. Ved hjælp a f denne kan vi forudsige:
a. Den forventede efterspørgsel ved en given pris x *: E (Y │X = x *)
b. Den faktiske efterspørgsel ved en given pris x *:
Y = E ( Y |X = x ) + U
Vi har sat en stjerne på x for at markere, at det er en værdi, vi
vælger. Vores forudsigelse a f den forventede efterspørgsel er
E ( Y |X = x *) = 3000 – 200 · x *. Denne forudsigelse er uden usikker­
hed, idet regressionsfunktionen er kendt. Forudsigelsen a f efterspørgs­
len, Y, er også E ( Y |X = x *) = 3000 – 200 · x *, da vi ikke kender U,
men ved, at U har forventet værdi, E(U | X = x *), lig med 0. Forudsi­
gelsen a f den faktiske efterspørgsel har derfor U som forudsigelsesfejl.
I praksis kender man ikke regressionsfunktionen, men som vi så
ovenfor, kan man estimere denne. Dette estimat bruger man til at for­
udsige den forventede værdi a f Y givet en værdi x * a f X, som vi vælger.
Ved at indsætte i den estimerede regressionsfunktion får man:
Dette er vores forudsigelse a f den forventede værdi a f Y givet værdien
af x *, dvs. punkt a) ovenfor. Det er også vores forudsigelse af den fakti­
ske værdi af Y givet værdien a f x *, dvs. punkt b).
Da vi kun har et estimat på regressionsfunktionen, er både skønnet
på den forventede værdi a f Y givet x * og skønnet på Y givet x * påvirket
a f stikprøveusikkerhed. I de følgende to underafsnit viser vi, hvordan
man kan bestemme størrelsen a f denne usikkerhed i de to situationer.
17.6.1
Usikkerhed på forudsigelse af den forventede værdi af Y
Usikkerheden på skønnet på den forventede værdi af Y givet X stammer
udelukkende fra usikkerheden på skønnene over de ukendte parametre:
β 0 og β1
Forudsigelsen a f den forventede værdi a f Y givet X = x * i den simple
lineære regressionsmodel er:
Usikkerheden på dette skøn er givet i den følgende boks:
Usikkerhed på forudsigelse a f den forventede værdi a f Y
givet X = x * i den simple lineære regressionsmodel:
Forudsigelse:
Forudsigelsesfejl:
Varians a f forudsigelsesfejl:
Forudsigelsefejlen er her kaldt W *for at markere, at det er forskellen
mellem den sande forventede værdi og den estimerede forventede vær­
di, i modsætning til U, som er forskellen mellem den faktiske værdi og
den forventede værdi. Man kan få et skøn på V ( W *) ved at udskifte σ2
med
Det ses, at stikprøveusikkerheden på forudsigelsen (variansen af W*)
er større, hvis x * er langt fra gennemsnittet i stikprøven, end hvis x *
er tæt på
Intuitionen for dette er, at de data (stikprøven), vi har brugt
til at estimere regressionsfunktionen, er placeret omkring stikprøvegen­
nemsnittet, og derfor har vi mest information om Y givet X i nærheden
af stikprøvegennemsnittet. Derudover kan man se, at usikkerheden fal­
der, hvis vi kan øge stikprøvestørrelsen, n. Hvis stikprøvestørrelsen er
meget (uendeligt) stor, forsvinder usikkerheden fuldstændig.
Ligesom ved andre skøn kan man opstille et konfi densinterval for
den ukendte størrelse, her den betingede middelværdi, E ( Y | X = x *) .
Dette har følgende udseende:
K onfidensinterval for den betingede middelværdi a f Y givet
X = x * i den sim ple lineære regressionsmodel:
U nder antagelserne 1, 2 og 3 er det approksim ative (1 – α )-kon­
fi densinterval for E ( Y |X = x * ) :
hvor Z 1–α/2 er ( 1 – α /2)-fraktilen fra standardnormalfordelingen.
U nder antagelserne 1, 2, 3 og 4 er det eksakte ( 1 – α )-konfidens­
interval for E ( Y | X = x * ) :
hvor t1–α/2( n – 2) er (1 – α /2)-fraktilen fra t-fordelingen med
n – 2 frihedsgrader.
17.6.2
Usikkerhed på forudsigelse af værdien af Y
Usikkerheden på skønnet a f Y givet X stammer både fra stikprøve­
usikkerheden på skønnene a f de ukendte parametre, β 0 og β 1 og fra den
usikkerhed, der skyldes Y’s fordeling omkring dens forventede værdi.
Forudsigelsen a f Y givet X =x * i den simple lineære regressionsmo­
del er:
hvor stjernen på x igen markerer, at det er en værdi, vi har valgt. Dette
skøn er lig med skønnet på den forventede værdi a f Y fra foregående
afsnit. Usikkerheden på dette skøn er givet i den følgende boks.
Usikkerhed på forudsigelse af værdien a f Y givet X = x* i den
simple lineære regressionsmodel:
Forudsigelse:
Forudsigelsesfejl:
Varians a f forudsigelsesfejl:
I forhold til afsnit 17.6.1 er der nu lagt σ2 til variansen a f forudsigelses­
fejlen. Intuitionen bag dette ekstra led er, at vi forudsiger Y og ikke kun
den forventede værdi a f Y. Forudsigelsesfejlen, U*, er altså en sum af
to fejl: Fejlen fra afsnit 17.6.1, der skyldes, at vi bruger den estimerede
regressionsfunktion til at forudsige den forventede værdi a f Y, og fejlen
fra afsnit 17.1.2, der skyldes, at vi forudsiger Y med dens forventede
værdi. Denne sidste forudsigelsesfejl har variansen σ2 og forklarer der­
med forskellen på V( U*) og V(W*). Man kan få et skøn på V( U*) ved
at udskifte σ2 med
Selvom stikprøvestørrelsen er meget stor, forsvinder usikkerheden
altså ikke i dette tilfælde. Den usikkerhed, man fjerner ved en stor stik­
prøvestørrelse, er den usikkerhed, der stammer fra den ukendte regres­
sionsfunktion, det vil sige forudsigelsesfejlen fra afsnit 17.6.1. Den
usikkerhed, der skyldes, at Y er fordelt omkring den betingede middel­
værdi, E (Y|X = x ), kan man ikke undslippe.
Man kan også udregne et konfidensinterval for Y som i den følgende
boks:
Konfidensinterval for Y givet X = x * i den simple lineære re­
gressionsmodel:
Under antagelserne 1, 2 og 3 er det approksimative (1 – α )-kon­
if densinterval for Y:
hvor Z 1–α/2 er ( 1 – α/2)-fraktilen fra standardnormalfordelingen.
Under antagelserne 1, 2, 3 og 4 er det eksakte ( 1 – α)-konfiden­
sinterval for Y:
hvor t1–α/2(n – 2) er ( 1 – α/2)-fraktilen fra t-fordelingen med
n – 2 frihedsgrader.
17.7
Opgaver
1. Repetitionsspørgsmål
a) Hvad er en regressionsfunktion?
b) Forklar, hvordan regressionsfunktionen kan anvendes til at for­
udsige værdien af en stokastisk variabel, Y.
c) Hvad er forudsigelsesfejlen?
d) Forklar, hvad simpel lineær regression er, og giv en fortolkning
a f koefficienten β1.
e) Forklar, hvordan vi kan opnå et skøn på regressionsfunktionen.
Hvad er fortolkningen a f mindste kvadraters metode?
f) Hvad er egenskaberne ved estimatorerne? Under hvilke antagel­
ser?
g) Gør rede for de antagelser, der ligger til grund for den simple li­
neære regressionsmodel, og forklar, hvordan vi grafisk kan kon­
trollere dem.
h) Hvilken teststatistik bruger vi til at teste hypoteser om koeffi­
cienterne i regressionsfunktionen? Hvilken fordeling har den un­
der H0?
i) Gør rede for de to typer a f forudsigelser, vi kan foretage ved
hjælp a f den estimerede regressionsfunktion. Hvilken a f de to
forudsigelser er forbundet med størst usikkerhed? Hvorfor?
2. Baseret på en tilfældig stikprøve har en kommune estimeret den
forventede afstand, Y (målt i km), mellem hjem og arbejde som en
funktion a f en persons indkomst X (målt i 100.000 kr.). Sammen­
hængen er estimeret til
a) Hvor meget ændrer den forventede afstand til arbejde sig, hvis
indkomsten stiger med 100.000 kr.?
b) Test hypotesen om, at en persons indkomst ingen indflydelse
har på den forventede afstand mellem hjem og arbejde. Det kan
(koefficienten til x) er estimeret til:
oplyses, at variansen på
c) Kan man konkludere, at højere indkomst forårsager længere af­
stand til arbejde?
3. I en undersøgelse a f efterspørgslen efter 20 sekunders reklameblok­
ke, Y, til en tv-station har et marketingbureau estimeret følgende
sammenhæng med prisen (målt i 1.000 kr.), P, på en 20 sekunders
reklameblok:
Ê (Y|P = p ) = 800 – 50 · p.
Sammenhængen er estimeret med OLS på en simpel tilfældig stik­
prøve med n = 20 observationer. Gennemsnitsprisen,
i stikprø­
Desuden er
ven er 10 og
a) Fortolk den estimerede regressionsfunktion.
b) Hvad er forudsigelsen af den forventede efterspørgsel, hvis man
sætter prisen til henholdsvis 5 og 10?
c) Hvad er forudsigelsen a f efterspørgslen, hvis man sætter prisen
til henholdsvis 5 og 10?
d) Sammenhold og diskuter dine svar på spørgsmål b) og c).
e) Hvad er usikkerheden på forudsigelsen a f den forventede efter­
spørgsel, hvis man sætter prisen til henholdsvis 5 og 10?
f) I spørgsmål e): Hvorfor er der forskel på usikkerheden, når pri­
sen er henholdsvis 5 og 10?
g) Hvad er usikkerheden på forudsigelsen a f efterspørgslen, hvis
man sætter prisen til henholdsvis 5 og 10?
h) Hvorfor er der forskel på svarene til spørgsmål e) og g) i det til­
fælde, hvor prisen er 10?
i) Opstil et 0,95-konfidensinterval for regressionsfunktionen, når
prisen er 10.
4. I et villakvarter er indsamlet huspriser (i millioner a f kroner), Y, og
antallet a f kvadratmeter, X, på de sidste 8 solgte huse. Den realisere­
de stikprøve er i tabellen:
Huspris, y i
Størrelse,x i
1,4
135
1,8
160
2,1
210
1,7
175
1,9
180
1,2
140
1,8
180
1,6
155
a) Diskuter rimeligheden i at antage, at stikprøven er simpel tilfæl­
dig.
b) Beregn OLS-estimatet på regressionsfunktionen.
c) Undersøg, om forudsætningerne er opfyldt.
d) Test om husets størrelse har en statistisk signifikant sammen­
hæng med den forventede pris ved et 5 %-signifikansniveau.
e) Forudsig, hvad den forventede pris er på et hus på 180 m2.
f) Lav et 0,90-konfi densinterval for regressionsfunktionen.
18
Multipel lineær regression
I dette kapitel udvider vi regressionsanalysen fra kapitel 17 til multipel
lineær regression, hvor m an forklarer den forventede værdi a f den af­
hængige variabel, Y, m ed m ere end én stokastisk variabel, X. På denne
m åde kan man analysere sam m enhængen m ellem to stokastiske varia­
bler, Y og X, sam tidig m ed at m an holder effekten fra andre stokastiske
variabler konstant.
I afsnit 18 .1 introducerer vi den m ultiple lineære regression og dis­
kuterer fortolkningen a f denne sam m enlignet m ed den simple lineære
regression. Estimationen a f den m ultiple lineære regressionsm odel gen­
nem går vi i afsnit 18.2. Svarende til kapitlet om simpel lineær regres­
sion gennem går vi specifikationstest i afsnit 18.3, hypotesetest i afsnit
18.4 og forudsigelser i afsnit 18 .5 .1 afsnit 18.6 ser vi på andre ikke-li­
neære funktionelle form er a f en regressionsfunktion. Dernæst diskute­
rer vi i afsnit 18.7 konsekvensen af, at en potentielt relevant stokastisk
variabel i regressionen ikke kan observeres. Endelig vender vi i afsnit
18.8 tilbage til diskussionen om spuriøse sam m enhænge fra kapitel 3.
18.1
Multipel lineær regression
M ultipel lineær regression udvider den simple lineære regression, som
har én forklarende variabel, til lineær regression m ed flere forklarende
variabler. Lad X 1, X 2, . . . , X K være K forskellige stokastiske variabler.
Den m ultiple lineære regressionsfunktion er givet ved:
E ( Y |X 1 = x 1, X 2 = x 2, ...,X K = x K)
= β 0 + β 1 · x1
+ β 2 · x2+ ...+ βK · xK
hvor β 0, β 1, β 2, . . . ,β K er koefficienter. M an kan også skrive den multiple
lineære regressionsm odel som:
Y = β 0 + β 1 X 1 + β 2 X 2 + ...+ β K X K + U ,
hvor E (U |X 1 = x 1, X 2 = x 2, ..., X K = x K) = 0
Forudsigelsesfejlen, U, har sam m e fortolkning som i den simple line­
ære regression i kapitel 17.
M an kan ligesom m ed den simple lineære regressionsfunktion op­
stille udtryk for β 0, β 1,...,β K, men da udtrykkene er relativt kom plicere­
de, springer vi dem over. Hvad der her er langt vigtigere, er fortolknin­
gen a f den multiple lineære regressionsfunktion.
Eksempel 18.1: Blue Bull – del 1
I eksempel 17.3 kiggede vi på den forventede efterspørgsel efter læ ­
skedrikken Blue Bull som en funktion a f prisen. Vi kan udvide denne
m odel for efterspørgslen efter Blue Bull, så den også tager en konkur­
rerende læskedrik, Caco Laco, m ed i betragtning. Lad YBB være efter­
spørgslen efter Blue Bull. Prisen på Blue Bull kalder vi nu X BB og prisen
på Caco Laco X CL Antag, at den forventede efterspørgsel efter Blue
Bull som en funktion a f prisen på Blue Bull og prisen på Caco Laco er:
E ( YBB|XBB = XBB’ X CL = x C L ) = 2500 – 250 · x BB + 100 · x CL
hvor YBB er m ålt i antal flasker, og priserne er m ålt i kroner per flaske.
Hvis prisen på Blue Bull er x BB = 10 kr. per flaske, og prisen på Caco
Laco er x CL= 10 kr. per flaske, så er den forventede efterpørgsel efter
Blue Bull lig med: 2500 – 250 · 10 + 100 · 10 = 1000 flasker. D ette er
den sam m e værdi, som vi fik i eksem pel 17.3, når prisen på Blue Bull
var 10 kr. per flaske.
M an kan nu undersøge den forventede efterspørgsel efter Blue
Bull ved forskellige priser på det konkurrerende produkt Caco
Laco. Hvis prisen på Caco Laco i stedet for 10 kr. per flaske er
11
kr. per flaske, så er den forventede efterspørgsel efter Blue Bull:
2500 – 250 · 10 + 100 · 11 = 1100 flasker. En prisforøgelse på 1 kr. per
flaske Caco Laco hæ ver altså den forventede efterspørgsel efter Blue
Bull m ed 100 flasker.
■
En m ulig fortolkning a f den m ultiple lineære regression kan m an få ved
at udregne effekten på den forventede værdi a f Y a f en lille ændring i en
a f de forklarende variabler. F or at sam m enligne m ed den simple lineære
regressionsm odel betragter vi følgende to regressionsfunktioner:
(i) E (Y |X 1 = x 1) = β 0 +
β1 – x 1
(ii) e ( y |x 1 = x 1, X2 = x 2) = γ 0 + γ1 · x1 + γ 2 · x 2
Koefficienterne i (ii) benævner vi γ for at skelne dem fra β ’ erne i (i).
I (i) er den forventede værdi a f Y betinget på x 1 hvorim od i (ii) er den
forventede værdi a f Y betinget på både x 1 og x 2. Effekten på den forven­
tede værdi a f Y, hvis x 1 øges m ed én enhed, fandt vi i afsnit 17.2 til at
være Δ simpel = β 1 i den simple lineære regressionsm odel. Tilsvarende
kan vi udlede effekten på den forventede værdi a f Y, hvis x1 øges med
én enhed, i den multiple lineære regressionsmodel:
Δ multipel,
x1= Ε (Υ |Χ 1 = x1 + 1, X2 = x2 – Ε (Υ |Χ 1 = x1, Χ 2 = x2 )
= [γ0 + γ1 · (x1 + 1) + γ2 · x2] – [ γ 0 + γ 1 · x 1 + γ 2 · x 2 ] = γ1
hvor Δmultipel,x1
er ændringen i den forventede værdi a f Y, hvis x1 øges
med én enhed .29
Fortolkningen a f β 1 er: Æ ndringen i den forventede værdi a f Y, hvis
x1 øges m ed én enhed. Fortolkningen a f γ1 er lidt anderledes: Æ ndrin­
gen i den forventede værdi a f Y, hvis x1 øges m ed én enhed, givet at x2
er uændret. Forskellen i fortolkningen er altså, at x 2 er uændret i (ii),
hvorim od x2 ikke nødvendigvis er uændret, når man øger x1 m ed én en­
hed i (i). M ed andre ord er der ikke betinget på x2 i den simple lineære
regression i (i).
Eksempel 18.2: Blue Bull – del 2
Vi kan sam m enligne effekten a f en højere pris på Blue Bull i eksempel
17.3 og eksempel 18.1. Hvis vi kun betinger på prisen a f Blue Bull, men
ikke Caco Laco, som i eksempel 17.3, så er sammenhængen:
E (Y B B |X B B
=
x B B ) =
3 0 0 0
–
2 0 0
· x B B
Den forventede efterspørgsel falder altså fra 1000 til 800 flasker, hvis
prisen på Blue Bull er 11 kr. per flaske i stedet for 10 kr. per flaske, dvs.
Δsimpel = – 2 0 0 .
Hvis vi også betinger på prisen a f Caco Laco, som i eksempel 18.1,
så er sammenhængen:
29 Man kan lave tilsvarende udregninger for ethvert x i den multiple lineære regressionsmodel. Hvis man
fx øger x2 og holder x1 konstant, får man Δmultipel,x2 = γ2.
E ( Ybb |X bb = x BB, X cl = x cl) = 2500 – 250· x BB + 100 · x CL
Hvis prisen på Caco Laco er 10 kr. per flaske, falder den forventede
efterspørgsel efter Blue Bull fra 1000 til 750 flasker ved prisforøgelsen
fra 10 til 11 kr. per flaske Blue Bull, dvs.
Faldet i den forventede efterspørgsel er altså forskelligt alt efter,
hvilken a f de to regressionsfunktioner man bruger. Dette er ikke en fejl.
Forklaringen er, at det første resultat er opnået uden at forudsætte noget
om prisen på Caco Laco, hvorim od prisen på Caco Laco er fastholdt
på et bestem t niveau (10 kr.) i udregningen a f det andet resultat. Det
andet resultat bruger altså m ere inform ation, da prisen på Caco Laco
indgår. Det betyder dog ikke, at det første resultat er uinteressant. Det
første resultat tager nem lig implicit hensyn til, at prisen på Caco Laco
ikke nødvendigvis er den sam m e ved forskellige priser på Blue Bull. En
sam m enhæng m ellem prisen på Caco Laco og prisen på Blue Bull kan
m an m åle som korrelationen m ellem X BB og X CL.
■
Som eksemplet ovenfor påpeger, skal m an være præcis, når m an fortol­
ker regressionsfunktionen. Den skal fortolkes som, at alt det, der ikke
er m edtaget (dvs. det der ikke er betinget på) i regressionen, kan variere
frit. M an siger også „alt andet ikke lige“ .
M an kan også fortolke forskellen på simpel og multipel lineær re­
gression ved hjælp a f en populationsbetragtning. Antag, at der kun er to
forskellige væ rdier a f x1 i populationen. Ved simpel lineæ r regression
sam m enligner man den gennem snitlige værdi a f y for de to dele a f p o ­
pulationen, som har forskellig værdi a f x1 Den del a f populationen som
har den første værdi a f x 1 består im idlertid a f forskellige undergrupper,
som har forskellige væ rdier a f x2 Tilsvarende består den del a f popula­
tionen, som har den anden værdi a f x1, a f forskellige undergrupper med
forskellige væ rdier a f x2 Ved multipel lineær regression sam m enligner
man den gennem sitlige værdi a f y for de undergrupper a f de to delpo­
pulationer, som også har sam m e værdi a f x2 Det er altså forskellige
grupper a f elementer, man sam m enligner i simpel og m ultipel lineær
regression.
18.2
Estimation af den multiple lineære regressionsfunktion
I praksis kan vi anvende en simpel tilfældig stikprøve (X i,1,...,X i,K, Yi ),
i =1 , . . . , n til at beregne et skøn på de ukendte koefficienter i den m ulti­
ple lineære regressionsfunktion. Frem gangsm åden, som vi brugte til at
opnå skøn i forbindelse m ed den simple lineære regression, virker også
ved multipel lineær regression.
OLS-estim atoren m inim erer sum m en a f de kvadrerede lodrette af­
stande m ellem en observation og regressionslinien. M ed andre ord er
de valg a f b0, b1, . . . , bK, som gør kvadratsummen:
mindst mulig.
M an kan udlede eksplicitte udtryk for
m en de er re­
lativt komplicerede. De fleste statistik- og regnearksprogram m er har
indbygget udtrykkene for OLS-estim atorerne. Sådanne program m er
udregner også skøn på varianserne
Skønnene betegner vi m ed symbolerne
derne a f
Kvadratrød-
kalder m an standardfejlene for
Egenskaberne for OLS-estim atorerne i multipel lineær regression er
opsum m eret i følgende boks:
Egenskaber ved O LS-estim atorer i multipel lineær regression:
Antagelser:
1. M ultipel lineær regressionsmodel:
E ( Y |X 1 = x1,X 2 = x 2,...,X K = xK ) = β 0
+β1· x1 + β2 · x2 +...+ βK · xK
2. Simpel tilfældig stikprøve:
(( X1,1,X1,2,....,X1,K ),( X2,1,X2,2,....,X2,K,Y2 ),. .. ,( Xn,1,Xn,2,....,Xn,K,Yn ))
3. Variansen a f Y afhænger ikke a f X1,X2,....,XK:
V ( Y |X 1 = x 1, X 2 = x 2 ,...,X K = x K = σ 2
4. For givne X1 = x1 , X 2 = x 2, . . . , X K = x K er Y normalfordelt.
Under antagelserne:
•1 og 2 er
centrale og konsistente skøn på β 0, β 1,...,β K
•1 , 2 og 3 er
approksim ativt normalfordelte:
er varianserne på
hvor
•
1 , 2,3 og 4 er
eksakt norm alfordelte.
Egenskaberne for O LS-estim atorerne ved m ultipel lineær regression er
stort set som ved simpel lineær regression. Estim atoren for σ 2 er dog en
anelse anderledes. Form len er nu:
Forskellen er, at man i den simple lineære regression estim erer to ukend­
te koefficienter, β 0 og β 1, hvorim od man i m ultipel lineær regression
estim erer K + 1 koefficienter. M an dividerer derfor m ed n – (K + 1) i
stedet for n – 2.
Eksempel 18.3: Blue Bull – del 3
I virkeligheden kender producenten a f Blue Bull ikke væ rdien a f ko­
efficenterne i regressionsm odellen fra eksempel 18.1. Producenten er
derfor interesseret i at estimere koefficienterne i følgende regressions­
model:
E(YBB|XBB = xBB, XCL = xcl) = β0 + βBB · xBB, + βCL · xCL
Denne m odel antages at opfylde antagelse 1,3 og 4 i ovenstående boks.
Til estimationen har producenten udtrukket en simpel tilfældig stik­
prøve (antagelse 2) på 12 observationer: (1578, 8,7, 10,9), (681, 11,9,
10,1), (1283, 9,6, 11,7), (1328, 9,0, 9,4), (483, 11,7, 10,7), (826, 11,9,
12,0), (874, 10,2, 12,0), (1069, 10,1, 9,7), (1688, 8,2, 10,2), (1012, 8,3,
9,4), (817, 11,2, 11,3) og (907, 10,1, 9,9), hvor det første tal i hver
parentes er efterspørgslen, og de efterfølgende to tal er prisen på hen­
holdsvis Blue Bull og Caco Laco.
Baseret på disse observationer udregner producenten estimaterne af
Standard­
de tre koefficienter til
fejlene på disse estim ater er
■
18.3
Specifikationstest af multipel lineær regression
Som ved simpel lineær regression er det muligt at undersøge antagel­
serne i multipel lineær regression fra boksen i afsnit 1 8 .2 .1 dette afsnit
diskuterer vi kort, hvordan m an kan undersøge antagelserne m ed gra­
fiske metoder. De grafiske m etoder er stort set de samme som ved den
simple lineære regression, så vi vil kun pointere forskellene i forhold til
simpel lineær regression og ellers henvise til afsnit 17.4.
A ntagelse 1 om kring den funktionelle form undersøger vi med et
residualplot, hvor vi har ŷi. på 1. aksen og ûi på 2. aksen. Den eneste
forskel i forhold til den simple lineære regression er i beregningen a f
ŷi. Ved multipel lineær regression udregner m an ŷi. på følgende måde:
mens residualerne som tidligere udregnes som:
Hvis antagelse 1 skal være opfyldt, m å der (som i kapitel 17) ikke være
en systematisk variation om kring 1. aksen.
Antagelse 2 om kring den simple tilfældige stikprøve kan m an un­
dersøge, hvis fx stikprøven er indsam let over tid. M an kan da nøjagtig
som i kapitel 17 plotte residualerne m od tiden, i. Hvis observationerne
er uafhængige, bør residualerne være tilfældigt fordelt om kring 1. ak­
sen.
Antagelse 3 om kring hom oskedasticitet betyder, at variansen a f Y
(eller U) ikke m å væ re en funktion a f en eller flere a f de forklarende va­
riabler, X . M an kan derfor plotte de kvadrerede residualer m od hver a f
de forklarende variabler samt ŷi for at undersøge, om denne antagelse
er opfyldt.
Antagelse 4 om norm alitet kan m an undersøge m ed et (p, p)-plot
eller et (q, q)-plot – nøjagtig som i kapitel 17 . 1 begge tilfælde har man
brug for den em piriske fordelingsfunktion a f residualerne. Den udreg­
ner man på sam m e m åde som i afsnit 17.4.4 ved den simple lineære
regression.
18.4
Hypotesetest og konfidensinterval ved multipel lineær regression
Ved multipel lineær regression er der m ulighed for at teste m ange for­
skellige typer a f hypoteser. F or eksempel kan m an teste, om en forkla­
rende variabel har relation til den afhængige variabel, Y, eller om flere
forklarende variabler har sam m e relation til den afhængige variabel, Y.
I de næste underafsnit ser vi på disse situationer, som alle er karakteri­
seret ved, at man tester en hypotese om en eller flere koefficienter.
18.4.1
Test af hypotese om en enkelt koefficient
Hvis m an vil teste, om en forklarende variabel har relation til den for­
ventede værdi a f den forklarede variabel, svarer det til at teste, om ko­
efficienten til den forklarende variabel er lig m ed 0. M ere generelt vil
vi gerne kunne teste, om fx koefficienten, βk, til den k ’te forklarende
variabel, x k, er lig m ed en bestem t værdi,
Toptegnet „0“ indikerer, at
der er tale om værdien a f koefficienten under nulhypotesen.
Vi følger her sam m e frem gangsm åde som i kapitel 17 ved test a f en
koefficient i den simple lineære regressionsfunktion. Hypoteserne er:
hvor vi estim erer β k med
Som hypotesem ål bruger vi
For at få en teststatistik m ed en fordeling, som
OLS-estimatoren,
er nem at bruge, dividerer vi hypotesem alet m ed kvadratroden a f dets
som vi gav formlen for i af­
varians. Skønnet på denne varians er
snit 17.3.3 i tilfældet m ed simpel lineær regression. Den følgende boks
opsum m erer testen:
Test a f en koefficient i den multiple lineære regressions­
funktion:
Teststatistik:
U nder antagelserne 1, 2 og 3 er T ~ A N (0, 1) under H0.
U nder antagelserne 1, 2, 3 og 4 er T ~ t (n – K – 1) under H 0.
Eksempel 18.4: Blue Bull – del 4
Producenten a f Blue Bull ønsker at teste, om prisen på Caco Laco spil­
ler en rolle for den forventede efterspørgsel efter Blue Bull. De hypote­
ser, han tester, er derfor:
H0 : β CL= 0
H 1 : βCL ≠ 0
Ved hjælp a f estimaterne fra eksempel 18.3 udregner producenten væ r­
dien a f teststatistikken til:
Den kritiske værdi fra standardnorm alfordelingen ved en test på et
5 % -signifikansniveau er 1,96. Producenten konkluderer derfor, at pri­
sen på Caco Laco ingen statistisk rolle spiller.
■
Ved hjælp a f de sam m e teknikker som i kapitel 13 kan vi desuden op­
stille konfidensintervaller for de ukendte koefficienter, β 0, β 1, β 2,...,β K.
B oksen giver de nødvendige formler:
Konfidensinterval for en koefficient i den multiple lineære
regressionsfunktion:
U nder antagelserne 1, 2 og 3 er det approksim ative ( 1 – α)-kon­
fidensinterval for β K:
hvor Z 1 – α /2 er ( 1 – α/2)-fraktilen fra standardnorm alfordelingen.
U nder antagelsern e 1, 2, 3 og 4 er det eksakte ( 1 – α)-konfidens­
interval for βK:
hvor t1–α/2( n – K – 1) er (1 – α/2)-fraktilen fra t-fordelingen m ed
n – K – 1 frihedsgrader.
18.4.2
Test af samlet signifikans af alle de forklarende variabler
I dette underafsnit tester vi, om der (samlet set) overhovedet er en a f de
forklarende variabler, som relaterer sig til den forventede værdi a f Y.
Det giver følgende hypoteser:
H0 : β1 = 0, β2 = 0,..., βK = 0
H 1 : m indst én βK ≠ 0 , k = 1, . . . , Κ
Bem ærk, at interceptet, β 0, ikke er inkluderet. Hvis β1 = 0 , β 2 = 0,...,
β K = 0, så e r β0 lig med m iddelværdien, E ( Y) .
I dette tilfælde kan m an finde inspiration til et hypotesem ål, som
skelner m ellem nul- og alternativhypotesen ved at betragte følgende to
regressionsm odeller, som udspringer a f henholdsvis nulhypotesen og
alternativhypotesen:
Y = β 0 + U r (den restringerede model)
Y = β 0 + β 1 · Χ 1 + ... + β K · Χ K + Uu (den ikke-restringerede model)
hvor fodtegnene r og u på U indikerer, at Ur hører til modellen, der ud­
springer a f nulhypotesen (også kaldet den restringerede model), mens
U uhører til m odellen, der udspringer a f alternativhypotesen (også kaldet
den ikke-restringerede model). Hvis nulhypotesen er sand, er variansen
a f U r og Uu den samme, idet de to ovenstående m odeller da er ens. Hvis
altem ativhypotesen derim od er sand, kan m an vise, at variansen a f Ur
m å være større end variansen a f Uu. Intuitivt skyldes dette, at en del af
Y’s varians da er forklaret a f nogle a f X ’erne i den ikke-restringerede
model, og derm ed er der m indre varians tilbage til Uu. I den restringe­
rede model er der derim od ingen X ’ere, hvorfor Ur nødvendigvis har
sam m e varians som Y. M an kalder også nogle gange variansen a f U for
den uforklarede del a f variansen a f Y. U nder alternativhypotesen er den
uforklarede del a f Y’s varians altså større i den restringerede m odel end
i den ikke-restringerede model.
H ypotesem ålet m åler forskellen m ellem variansen i den restringere­
være variansen a f Ur og
de og den ikke-restringerede model. Lad
variansen a f Uu. Hypotesem alet er da:
Evalueret i de sande væ rdier a f varianserne er dette mål lig m ed 0, når
nulhypotesen er sand, m ens det er større end 0 , når alternativhypotesen
er sand.
Som vi har set tidligere, er det hensigtsm æssigt at konstruere en test­
statistik på en sådan måde, at den har en fordeling, som er nem at bruge.
Først erstatter vi de ukendte param eterværdier m ed estimatorer. Lad
være følgende estim ator for
hvor
er sum m en a f de kvadrerede residualer fra
en O LS-estim ation a f den restringerede model. Tilsvarende lader vi
være følgende estim ator for
hvor
er sum m en a f
de kvadrerede residualer fra en OLS-estim ation a f den ikke-restringe­
rede model.
Det viser sig da, at teststatistikken:
er approksim ativt χ2-fordelt m ed K frihedsgrader under nulhypotesen.
For sm å værdier a f χ2 accepterer m an nulhypotesen, m ens m an for store
væ rdier forkaster nulhypotesen. Bem ærk, at antallet er frihedsgrader
er givet ved forskellen m ellem antallet a f restriktioner under nulhypo­
tesen, som er K, og antallet a f restriktioner under alternativhypotesen,
som er 0 .
M an benytter im idlertid ofte en lidt modificeret teststatistik. Den er
udledt under forudsætning af, at Y er normalfordelt. I dette tilfælde kan
m an nem lig udlede den eksakte fordeling for følgende teststatistik:
N år nulhypotesen er sand, er denne teststatistik F -fordelt m ed
( K , n – K – 1) frihedsgrader. M an kan også skrive denne teststatistik
på følgende vis:
D et er typisk denne udform ning a f teststatistikken, m an bruger i prak­
sis. Endvidere b ruger m an også ofte denne teststatistik i praksis, selvom
Y ikke er norm alfordelt. I dette tilfælde gæ lder det, at teststatistikken
kun er approksim ativt F -fordelt m ed ( K , n – K – 1) frihedsgrader un­
der nulhypotesen. Som ovenfor accepterer m an nulhypotesen for små
væ rdier a f teststatistikken og forkaster den ved store værdier.
D ivisionen m ed K og ( n – K – 1) i henholdsvis tæller og nævner
ovenfor kan fortolkes som en division m ed antallet a f frihedsgrader. I
forbindelse m ed udregning a f nævneren estim erer man K + 1 param e­
tre, β 0,...,β K. Antallet a f frihedsgrader er derfor antal observationer, n,
m inus antallet a f estim erede parametre, K + 1. I tælleren er der n – 1
frihedsgrader forbundet m ed RSSR, da man her estim erer én parameter,
β 0. Derfra trækker m an USSR, som er forbundet m ed n – ( K + 1) fri­
hedsgrader, da man her estim erer K + 1 parametre, β 0,...,β K. Da USSR
er fratrukket RSSR, er der i alt n – 1 – (n – K – 1) = K frihedsgrader.
Dette er også lig antallet a f ekstra restriktioner, som nulhypotesen
pålæ gger i forhold til alternativhypotesen, nem lig at de K parametre,
β 1,...,β K, er lig m e d 0.
Eksempel 18.5: Blue Bull – del 5
Opm untret a f det resultat, at prisen på Caco Laco ingen betydning har
for efterspørgslen efter Blue Bull, ønsker producenten nu at undersøge,
om priser overhovedet spiller en rolle. Han tester derfor følgende hy­
poteser:
H 0 : β ΒΒ = β C L = 0
Η 1 : β ΒΒ ≠ 0 eller β CL ≠ 0
Baseret på stikprøven fra eksempel 18.3 udregner producenten
RSSR = 1433284 og USSR = 379409. V ærdien a f teststatistikken bliver
derfor:
Den kritiske værdi fra F -fordelingen med (2, 9) frihedsgrader er 4,26.
Producenten konkluderer derfor, at m indst en a f koefficienterne i re­
gressionsm odellen er statistisk signifikant.
■
18.4.3
Test af andre hypoteser i den multiple lineære regressionsfunktion
I afsnit 18.4.2 testede vi en nulhypotese, hvor der var K restriktioner på
modellen. Dette ledte frem til en teststatistik, som var en funktion a f de
kvadrerede residualer fra den restringerede model og de kvadrerede re­
sidualer fra den ikke-restringerede model. Denne tilgang kan m an også
bruge i forbindelse m ed en række andre hypoteser.
Et eksempel kunne være at teste, om nogle a f koefficienterne anta­
ger bestem te værdier. Fx kunne m an væ re interesseret i at teste følgende
hypotese om de første q koefficienter:
H 1 : m indst én
hvor
er væ rdien a f koefficienten til x q under nulhypotesen. I afsnittet
ovenfor var
for k = 1, . . .,Κ .
Vi bruger samme hypotesem ål og teststatistik som ovenfor. R egres­
sionsmodellen, der udspringer a f alternativhypotesen, er regressionen
a f Y på X 1,.. ., X K. Fra en O LS-estim ation a f denne regression kan m an
finde sum m en a f de kvadrerede ikke-restringerede residualer, USSR.
Regressionsm odellen, der følger a f nulhypotesen, kan m an skrive som:
H er er det kun koefficienterne β 0, β q+1,...,β K, som er ukendte og skal
estimeres. Til dette kan m an bruge følgende trick. Hvis vi definerer den
stokastiske variabel Z til at være:
og trækker denne fra på begge sider a f lighedstegnet i den foregående
regressionsligning, så får vi:
Y – Z = β 0 + β q +1 · X q+1 + ... + β K · X K + U
Hvis m an dernæst definerer en ny stokastisk variabel givet ved:
kan m an estim ere koeffienterne β 0, β q+1,...,β K ved en O LS-estim ation
a f regressionen a f Y*på X q+1,.. ., X K. Sum m en a f de kvadrerede residu­
aler fra denne estim ation er lig m ed RSSR.
N år vi har fundet USSR og RSSR, kan vi udregne teststatistikken.
Som i afsnit 18.4.2 er der n – ( K + 1) frihedsgrader forbundet med
USSR. Der er derim od n – ( K + 1 – q ) frihedsgrader forbundet med
RSSR, da m an her estim erer ( K + 1 – q ) parametre. Teststatistikken
har derfor følgende udseende:
Som i det foregående afsnit kan m an fortolke q som det antal ekstra
restriktioner, som nulhypotesen pålæ gger i forhold til alternativhypo­
tesen. Teststatistikken er approksim ativt F -fordelt m ed (q , n – K – 1)
frihedsgrader under nulhypotesen.
Denne opbygning a f teststatistikken, hvor m an sam m enligner sum ­
men a f de kvadrerede residualer fra O LS-estim ationen a f henholdsvis
den restringerede og den ikke-restringerede model, har generel anven­
delse. Lad os som et sidste eksempel antage, at m an vil teste, om sum ­
Derm ed
m en a f koefficienterne β 1 og β 2 er lig m ed en given værdi,
er hypoteserne:
Den restringerede model kan her skrives på følgende måde:
Eller som:
Vi kan da definere to nye stokastiske variabler:
Den restringerede regressionsm odel kan derfor også skrives som:
Summ en a f de kvadrerede residualer fra O LS-estim ationen a f denne
model er da lig med RSSR. USSR findes som tidligere ved OLS-estim a­
tion a f den ikke-restringerede model.
Teststatistikken er da:
Bem ærk, at m an kun dividerer m ed 1 i tælleren, fordi nulhypotesen kun
pålæ gger en ekstra restriktion. Det er altså ikke antallet a f variabler in­
volveret i nulhypotesen (her to), som afgør antallet a f restriktioner, men
i hvor m ange udsagn disse er involveret.
18.5
Forudsigelser ved multipel lineær regression
Forudsigelser baseret på den m ultiple lineære regressionsm odel foregår
på samme m åde som ved den simple lineære regressionsm odel. Be­
regningen a f usikkerheden er m ere kom pliceret, m en fortolkningen er
uændret.
N år m an vil forudsige m iddelværdien a f Y betinget på en ræ kke for­
klarende variabler X 1,.. ., X K, skal m an vælge væ rdier a f disse forkla­
rende variabler. Lad disse væ rdier være x 1*,...,x *K. Forudsigelsen er da
givet ved:
Denne forudsigelse bruges, som ved den simple lineære regression, til
at forudsige både værdien a f Y og den betingede m iddelværdi a f Y.
M an kan udregne usikkerheden på denne forudsigelse. D a udtrykket
for usikkerheden er kom pliceret, udelader vi det dog her.
18.6
Ikke-lineære regressionsfunktioner
I nogle tilfælde er det ikke tilstrækkeligt at betragte en lineær regres­
sionsfunktion. N ogle gange fortæller vores teori os eksplicit, at regres­
sionsfunktionen bør være ikke-lineær. A ndre gange vil de grafiske test
i afsnittene 17.4.1 og 18.3 afsløre, at regressionsfunktionen sandsyn­
ligvis er ikke-lineær. I dette afsnit ser vi nærm ere på forskellige typer
a f ikke-lineære regressionsfunktioner. For nogle a f disse er det m uligt
efter en om skrivning at estim ere dem m ed den alm indelige m indste
kvadraters m etode (OLS).
N edenfor er fire eksem pler på ikke-lineære regressionsfunktioner:
i)
Ε (Υ|Χ 1 = x1, X 2 = x2) = β 0 + β 1, · x1 + β 2 · x2 + β 3 · x1 · x2
ii )
Ε(Υ|Χ1 = x1) = β0 + β1 · x1 + β2( x1 )2
iii)
iv)
E(ln(Y )|X 1 = x1) = β 0 + β 1 · ln( x1)
Den første regressionsfunktion er ikkel ineær i de forklarende varia­
bler, fordi produktet x1 · x 2 indgår. Den næste regressionsfunktion er
ikke-lineær, fordi den forklarende variabel optræder opløftet i anden
potens. I både i) og ii) indgår koefficienterne (betragtet som m atem ati­
ske variabler) imidlertid lineært. I den tredje regressionsfunktion indgår
både den forklarende variabel og en a f koefficienterne ikke-lineært på
Endelig indgår både den forklarende variabel og
grund a f leddet
den afhængige variabel ikke-lineært i den fjerde regressionsfunktion,
fordi der her er taget logaritmen til dem begge. Koefficienterne indgår
dog lineært som i de to første tilfælde.
Vi viser nedenfor, hvordan m an kan estimere regressionsfunktioner
med den almindelige mindste kvadraters metode, selvom de er ikke-li­
neære i variablerne, så længe de er lineære i koefficienterne.
18.6.1
Estimation af en ikke-lineær regressionsfunktion med OLS
M an kan i m ange tilfælde omskrive den ikke-lineære regressionsfunk­
tion til en lineær regressionsfunktion. Betragt følgende simple regres­
sion:
E (Y |X 1 = x 1) = β0, + β 1 · g (x1)
h v o r g ( ) er en kendt ikke-lineær funktion. Da funktionen g ( ) er kendt,
kan m an definere en ny forklarende variabel som:
z 1 = g (x1)
Ved indsættelse får man:
E (Y |X 1 = x 1) = β 0 + β 1 · g (x 1) = β0 + β1 · z1 = E (Y |Z 1,= z1)
Regressionen a f Y på Z1 hvor Z1 = g (X1), er da en simpel lineær re­
gression. Derm ed er udtrykkene for koefficienterne ifølge afsnit 17.2
lig med:
Eksempel 18.6: Kvadreret forklarende variabel
En regressionsfunktion er givet ved:
E (Y |X = x ) = β 0 + β 1x· 2
Denne funktion er ikke-lineær i x . Hvis vi definerer en ny variabel,
z = x 2, så er regressionsfunktionen:
E (Y |Z = z ) = β 0 + β 1 · z
imidlertid lineær i z . M ed en tilfældig stikprøve kan vi derfor beregne
skønnene på β 0 og β 1 ved hjælp a f mindste kvadraters metode:
Dette giver følgende skøn på E ( Y |Z = z ):
hvilket er det sam m e som:
idet z = x 2. Det er derfor m uligt at få et skøn på den ikke-lineære regres­
sionsfunktion a f x ved at estimere regressionsfunktionen ved brug a f z .
■
Tricket m ed at om form ulere en ikke-lineær regressionsfunktion til en
lineær regressionsfunktion virker kun, hvis der eksisterer en om form u­
lering, z = g (x ), som ikke involverer ukendte størrelser, og hvor re­
som
gressionsfunktionen er lineær i z . Hvis fx
for at E ( y |Z = z ) er
i tilfælde iii) ovenfor, så skal z være lig med
lineær i z . M en da vi ikke kender β 1 er funktionen g ( ) ikke kendt på
forhånd. D erfor kan man ikke udregne z og derm ed heller ikke om for­
mulere regressionsfunktionen til en lineær funktion a f z . Vi kan altså
ikke anvende den almindelige mindste kvadraters m etode i dette tilfæl­
de.30
30 Der eksisterer en ikke-lineær udgave a f mindste kvadraters metode, som man kan bruge til at få et skøn
på β 1 og β 2 i sådanne tilfælde.
M an kan også bruge den alm indelige mindste kvadraters metode,
hvis den afhængige variabel, Y, er transform eret a f en kendt funktion.
I eksempel iv) ovenfor indgår ln(Υ) som den afhængige variabel. Man
kan her definere en ny variabel Y* = l n ( Y), ligesom man definerer en
ny forklarende variabel z = ln (x ). Derefter kan man lave den simple
lineære regression a f Y* på Z for at estimere de to koefficienter β 0 og β1.
18.6.2
Lineær regression som approksimation til ikke-lineæ r regression
Selvom den korrekte regression er ikke-lineær, kan m an stadig have
nytte a f at anvende den lineære regression – m ed den rette fortolkning.
I den simple lineære regressionsm odel er forudsigelsesfejlen givet
ved:
U = Y – E (Y |X = x ) = Y – (β 0 + β 1x· )
Som et udtryk for kvaliteten (usikkerheden) a f en forudsigelse brugte
vi i afsnit 17.6 variansen a f forudsigelsesfejlen, V( U ) . Den bedste for­
udsigelsesvarians a f Y som en funktion a f x er den funktion, som giver
den mindste varians, V( U ) .
Antag nu, at regressionen E ( Y | X = x ) er ikke-lineær. Hvis man
skulle vælge en lineær model til at approksim ere den sande ikke-line­
ære regressionsm odel, så ville den lineære regressionsm odel være det
bedste valg blandt de lineære modeller, i den forstand at den ville have
den m indste varians a f forudsigelsesfejlen.
18.6.3
Regression med interaktion mellem forklarende variabler
I praksis er det muligt, at effekten a f en forklarende variabel afhænger
a f størrelsen a f en anden forklarende variabel. For eksempel kan effek­
ten a f at vande haven være større, hvis det har væ ret tørvejr længe, end
hvis det har regnet uafbrudt den sidste uge. N år to forklarende variabler
påvirker effekten a f hinanden, siger man, at der er interaktion mellem
de to variabler. I dette afsnit ser vi nærm ere på den oftest brugte model
for interaktion m ellem to variabler.
I eksempel i) fra ovenfor havde vi følgende regressionsfunktion:
E (Y |X 1 = x 1, X 2 = x2) = β 0 + β 1 · x1 + β2 · x 2 + β3 · x1 · x2
Leddet x1 · x 2 kalder m an interaktionsleddet. En konsekvens a f interak­
tionsleddet kan man se ved at udregne effekten på den forventede værdi
a f Y ved at øge x1 med én enhed, givet at x 2 er konstant. Denne effekt er:
Δ interaktion,x1 = Ε (Υ |Χ 1 = x1 + 1,Χ 2 = x 2) – Ε (Υ |Χ 1 = x1, Χ 2 = X2)
= [β 0 + β1 · ( x1 + 1) + β2 · x 2 + β3 · ( x1 + 1) · x 2 ] –
[β 0 + β 1 · x1 + β2 · x2 + β3 · x1 · x2 ] = β1 + β3 · x2
Denne effekt, Δinteraktion,x1 = β 1 + β 3 · x 2, kan m an sam m enligne med
effekten a f at øge x1 i den „alm indelige“ multiple lineære regressions­
funktion. H er er effekten blot β 1 M an kan se, at effekten a f at øge x 1
m ed én enhed, givet at x2 er konstant, afhænger a f værdien a f x 2 i m o­
dellen m ed interaktionsled. Hvis fx Y er forbrug a f varm e i et hus, x ,2 er
indendørstem peraturen, og x 2 er udendørstem peraturen, vil et interakti­
onsled kunne tage højde for, at varm eforbruget stiger m indre, når man
øger indendørstem peraturen, x 1 m ed én grad, hvis udendørstem peratu­
ren, x 2, er høj i stedet for lav.
En udbredt anvendelse a f en regressionsm odel m ed interaktionsled
forekommer, når m an undersøger, om forskellige grupper i en popu­
lation er ens. Hvis der er to grupper, kan m an definere en stokastisk
variabel, som antager værdien 0 for den ene gruppe og væ rdien 1 for
den anden. En sådan variabel kalder m an også for en dummyvariabel.
Det næste eksempel illustrerer anvendelsen a f en dum m yvariabel i en
regressionsm odel m ed interaktionsled.
Eksempel 18.7: Løndiskrimination
Et konsulentfirm a skal undersøge, om der foregår løndiskrim ination a f
kvinder i forhold til m ænd m ed sam m e uddannelse. Lad X 1 væ re en
dum m yvariabel defineret ved:
Da løn afhænger a f erfaring, m edtager m an også en stokastisk variabel,
X 2, som er en persons erfaring m ålt i år. Lønnen Y er m ålt i 1000 kroner
per år.
Konsulentfirm aet udregner en regressionsfunktion m ed interakti­
onsled. Resultatet er:
E (Y |X 1 = x 1, X 2 = x 2) = 200 – 10 · x ,1 + 4 · x 2 + 3 · x 1 · x 2
For kvinder er regressionen a f løn på erfaring givet ved:
E (Y |X 1 = 0, X 2 = x 2) = 200 – 10 · 0 + 4 · x 2 + 3 · 0 · x 2 = 200 + 4 · x 2
og for m æn d:
Ε (Υ |Χ 1 = 1, X 2 = x2) = 200 – 10 · 1 + 4 · x 2 + 3 · 1 · x2 = 190 + 7 · x 2.
Figur 18.1:
Løn for mænd
og kvinder
R egressionsfunktionerne for kvinder og m ænd er forskellige. En m and
uden erfaring (x 2 = 0) har en forventet løn, som er 1 0 . 0 0 0 kr. lavere
end for kvinder uden erfaring. Til gengæld stiger m ænds forventede
indkom st m ere med erfaringen end kvinders indkomst. Efter fire års
erfaring er m ænds forventede indkomst 218.000 kr., hvorim od kvinders
forventede indkom st er 216.000 kr.
M an kan også udregne forskellen m ellem m ænd og kvinder direk­
te. Denne forskel er: Δ interaktion,x1 = –10 + 4 · x 2. Forskellen er således
negativ, hvis erfaringen er m indre end 2,5 år (dvs. den forventede ind­
kom st er lavest for en m and i dette tilfælde), hvorim od den er positiv for
erfaring større end 2,5 år. Hvis man fortolker resultatet, at Δinteraktion,x1 er
forskellig fra 0 , som løndiskrimination, afhænger løndiskriminationen
m ellem kønnene altså a f deres erfaring.
■
For at estim ere koefficienterne i en regressionsm odel med interaktions­
led kan vi bruge sam m e trick som ovenfor, hvor vi definerede nye va­
riabler. M an kan her definere en ny stokastisk variabel, Z = X 1 · X 2.
D erm ed får man:
E ( Y |X 1 = x1, Χ 2 = x 2, Z = z ) = β 0 + β 1 · x 1 + β 2 · x 2 + β 3 · z
Ved at regressere Y p å X 1,X 2 og Z kan man estimere koeffi cienterne med
mindste kvadraters metode.
18.7
Udeladte variabler
Et stort problem i praksis er eksistensen a f forklarende variabler, som
m an gerne vil m edtage i regressionen, m en som m an ikke kan observere
og derfor ikke kan medtage. For eksempel kan m an interessere sig for,
om uddannelse har en effekt på lønnen. M an vil gerne kontrollere for
en persons evner, således at m an ikke fejlagtigt finder en positiv effekt
på lønnen som foranlediget a f uddannelse, hvis det faktisk forholder
sig sådan, at personer m ed en længere uddannelse har nogle evner, som
både forårsager højere løn og længere uddannelse. Det er typisk svært
at få et godt observerbart mål for evner, og derfor er det svært at m ed­
tage evner i en regression.
M an kan illustrere problem stillingen ved at betragte tre variabler 7,
Χ 1 og X 2, hvor Y er køn, X 1 er uddannelse og X 2 er evner. Antag, at man
er interesseret i at regressere Y på X l og X 2 for at fortolke effekten a f X 1
på 7, når m an har kontrolleret for Χ 2 Hvis m an im idlertid ikke har ob­
serveret X 2, kan m an nøjes m ed at regressere Y p å X 1 I denne sam m en­
hæ ng kalder m an variablen X 2 for en udeladt variabel. Som vi allerede
har diskuteret tidligere i dette kapitel, er der forskel på fortolkningen
a f regressionen a f Y på X 1 og X 2 og a f regressionen a f Y på X 1 I dette
afsnit vil vi belyse denne forskel, hvis m an alligevel forsøger at fortolke
effekten a f Χ 1på Y i regressionen a f Y på X 1, som om m an har foretaget
regressionen a f Y på både X 1 og Χ 2
M an kan udlede effekten a f en udeladt variabel ved at betragte en
regression a f Y på Χ 1 og Χ 2:
E ( Y |X 1 = x 1, X 2 = x 2) = β 0 + β 1 · x1 + β 2 · x2
Hvis vi i stedet regresserer Y på X 1, kan vi vise, at:
E (Y |X 1 = x 1) = β 0 + β 1 · x1 + β 2 · E (X 2|X1, = x 1)
Udtrykket E ( X 2|X 1 = x 1) svarer til regressionen a f X 2 på X 1 Lad os nu
antage, at regressionen a f X 2 på X 1 er en simpel lineær regression givet
ved: E (X 2|X 1 = x 1) = α 0 + α1 · x1. D a får vi:
E ( Y |X 1 = x1) = β 0 + β 1 · x 1 + β 2 · (α 0 + α1 · x 1)
= (β0 + β2 · α0)
(β 1
+
β 2 · α1) · x1 = β 0*
+
β 1* · x1
hvor β 0* = β 0 + β 2 · α0 og β 1* = β 1 + β 2 · α1. Hvis m an har et ønske
om at finde β 1, når man regresserer Y på Χ 1, bliver det ønske altså ikke
opfyldt. I stedet får m an β 1 plus β 2 · α1. Størrelsen β 2 · α1 kalder m an
den udeladte-variabel-bias, fordi størrelsen optræ der i koefficienten til
x1, når m an udelader x 2 Vi kan se, at denne bias afhænger både a f for­
holdet m ellem
X1
og X 2 (udtrykt ved x 1) og a f betydningen a f X 2 i den
oprindelige regressionsm odel (udtrykt ved β 2).
Fortolkningen a f koefficienten til x1 i regressionen a f Y på Χ 1 af­
hænger af, i hvilket lys m an ser de andre variabler (her x 2). Hvis man
kun er interesseret i regressionen a f Y på X 1 uden at m an kontrollerer
for x 2, så leverer regressionen a f Y på Χ 1 det rigtige resultat. Hvis man
derim od er interesseret i at fortolke koefficienten til x 1 i regressionen
a f Y på X 1 som om man har kontrolleret for andre effekter (her x 2), så
leverer regressionen a f Y på Χ 1 ikke det rigtige resultat, m edm indre α1
er 0 , eller β 2 er 0 . Sagt med andre ord: Hvis X ,1 er ukorreleret med X 2
hvilket er ensbetydende med, at α1 er lig med 0 , så gør det ikke noget, at
man har udeladt Χ 2 Det gør det heller ikke, hvis den udeladte variabel
slet ikke hører hjem m e i regressionen a f Υ på Χ 1 o g X 2, hvilket betyder,
at β 2 er lig med 0 .
18.8
Spuriøs sammenhæng i regressionsanalyse
Allerede i kapitel 3 diskuterede vi fortolkninger a f tilsyneladende sam ­
m enhænge, som m an finder i statistiske analyser. Et stort problem i
praksis er at vurdere, om en fundet sam m enhæng er reel eller spuriøs.
For at give begreberne reel og spuriøs m ening var vi nødt til at tænke
på kausale sam m enhænge, nem lig om den ene variabel forårsager den
anden, eller om de begge er forårsaget a f en tredje variabel.
I vores diskussion i kapitel 3 var hovedkonklusionen, at m an kan
have fundet en spuriøs sam m enhæng, hvis to stokastiske variabler er
statistisk afhængige, m en statistisk uafhængige, hvis m an betinger på
en tredje stokastisk variabel. Denne tredje variabel kunne være den va­
riabel, som reelt forårsager de to variabler, som tilsyneladende har en
sammenhæng.
Statistisk afhængighed er defineret ved hjælp a f sandsynligheder. Da
statistisk uafhængighed medfører, at de stokastiske variabler er ukor­
relerede, kan m an bruge multipel regressionsanalyse som en praktisk
tilgang til at få et godt indblik i, om en sam m enhæng er reel eller spu­
riøs. Hvis man fx regresserer Y på X 1 og finder, at X ,1 er relateret til den
betingede m iddelværdi a f Y, er denne sam m enhæng så reel eller spuri­
øs? Hvis man ud a f den praktiske problem stilling m istænker en tredje
variabel, X 2 for at være den reelle årsag til sam m enhængen mellem Y
o g X i, vil det afsløre sig i regressionen a f Y p å X 1 o g X 2. I denne regres-
sion vil koeffcienten til Χ 1 blive 0 , hvis sam m enhæ ngen m ellem Y og
X 1 er spuriøs.
M an kan få et yderligere indblik i dette resultat ved at bruge resul­
tatet fra afsnit 18.7 om udeladt-variabel-bias. I det afsnit fandt vi, at
koefficienten til X 1 i regressionen a f Y på Χ 1 var β 1* = β 1 + β 2 · α1,
hvor β 2 er effekten a f X 2 i regressionen a f Y på X 1og X 2, og α1 er effekten
a f Χ 1 i regressionen a f X 2 på Χ 1. Hvis sam m enhæ ngen m ellem Y og X 1
er spuriøs, så er β 1 lig m ed 0. Det m edfører dog ikke, at koefficienten
til Χ 1 i regressionen a f Y på X 1 er nul, da denne koefficient er lig med
β 1*= β 1 + β 2 · α1. M ed β 1 = 0 er den derfor lig m ed β 1* = β 2 · α1.
Den spuriøse sam m enhæ ng m anifesterer sig altså som en udeladt-varia­
bel-bias, når m an ikke har kontrolleret for den bagvedliggende variabel,
som forklarer den spuriøse sam m enhæng. M ed multipel lineær regres­
sion er det relativt nem t at inkludere en række variabler for at kontrol­
lere for en potentiel spuriøs sam m enhæng forårsaget a f disse variabler.
18.9
Opgaver
1 . Repetitionsspørgsmål
a) Forklar, hvad multipel lineær regression er, og giv en fortolkning
a f koefficienterne.
b) Hvad er egenskaberne ved estim atorerne? U nder hvilke antagel­
ser?
c) G ør rede for forskellen på simpel lineær og m ultipel lineær re­
gression, herunder fortolkningen a f koefficienterne.
d) Gør rede for de antagelser, der ligger til grund for den m ultip­
le lineære regressionsm odel, og forklar, hvordan vi grafisk kan
kontrollere dem.
e) Hvilke teststatistikker bruger vi til at teste hypoteser om ko ef­
ficienterne i regressionsfunktionen? Hvilke fordelinger har de
under H0?
f) Forklar, hvordan vi i nogle tilfælde kan estimere selv ikke-line­
ære regressionsfunktioner ved hjælp a f m indste kvadraters m e­
tode.
g) Forklar, hvad vi forstår ved udeladt-variabel-bias.
h) R edegør for, hvordan m an kan undersøge, om en sam m enhæng
er spuriøs, ved hjælp a f multipel lineær regression.
2. Den forventede løn, Y (m ålt i 1000 kr.), afhænger a f længden a f en
persons uddannelse, Χ 1 (målt i år), og personens erfaring, X 2 (målt i
år). Sam m enhængen er:
E (Y |X 1 = x 1, X 2 = x 2) = 90 + 8 · x1 + 3 · x2
a) Skitsér regressionsfunktionen for personer med henholdsvis 9 og
18 års uddannelse.
b) Fortolk koeffi cienterne til x1 o g x 2.
3. Regressionen a f Y p å X 1, giver:
E (Y |X 1 = x 1) = 25 + 4 · x 1
og regressionen a f Y på X 1 og X 2 giver:
E ( Y |X 1 = x 1, X 2 = x 2) = 23 + 7 · x 2
a) Fortolk koefficienterne i de to regressionsfunktioner.
b) Hvad kan forklare, at en regression a f Y på X 1 afhænger a f X 1,
hvorim od en regression a f Y på både X ,1 og X 2 ikke afhænger a f
X 1?
Sandsynlighedstabeller
Tabel 1. Standardnormalfordelingen: Kum ulative sandsynligheder
Tabel 2. Standardnormalfordelingen: Fraktiler
Tabel 3. t-fordelingen: Fraktiler
Tabel 4. X2-fordelingen
Tabel 5. F - fordelingen: 0,95-fraktiler
Tabel 6. F -fordelingen: 0,975-fraktiler
Tabel 1. Standardnormalfordelingen: Kumulative sandsynligheder
z
0
1
2
3
4
5
6
7
8
9
-3,0
-2,9
-2,8
-2,7
-2,6
-2,5
0,0013
0,0019
0,0026
0,0035
0,0047
0,0062
0,0013
0,0018
0,0025
0,0034
0,0045
0,0060
0,0013
0,0018
0,0024
0,0033
0,0044
0,0059
0,0012
0,0017
0,0023
0,0032
0,0043
0,0057
0,0012
0,0016
0,0023
0,0031
0,0041
0,0055
0,0011
0,0016
0,0022
0,0030
0,0040
0,0054
0,0011
0,0015
0,0021
0,0029
0,0039
0,0052
0,0011
0,0015
0,0021
0,0028
0,0038
0,0051
0,0010
0,0014
0,0020
0,0027
0,0037
0,0049
0,0010
0,0014
0,0019
0,0026
0,0036
0,0048
-2,4
-2,3
-2,2
-2,1
-2,0
0,0082
0,0107
0,0139
0,0179
0,0228
0,0080
0,0104
0,0136
0,0174
0,0222
0,0078
0,0102
0,0132
0,0170
0,0217
0,0075
0,0099
0,0129
0,0166
0,0212
0,0073
0,0096
0,0125
0,0162
0,0207
0,0071
0,0094
0,0122
0,0158
0,0202
0,0069
0,0091
0,0119
0,0154
0,0197
0,0068
0,0089
0,0116
0,0150
0,0192
0,0066
0,0087
0,0113
0,0146
0,0188
0,0064
0,0084
0,0110
0,0143
0,0183
-1,9
-1,8
-1,7
-1,6
-1,5
0,0287
0,0359
0,0446
0,0548
0,0668
0,0281
0,0351
0,0436
0,0537
0,0655
0,0274
0,0344
0,0427
0,0526
0,0643
0,0268
0,0336
0,0418
0,0516
0,0630
0,0262
0,0329
0,0409
0,0505
0,0618
0,0256
0,0322
0,0401
0,0495
0,0606
0,0250
0,0314
0,0392
0,0485
0,0594
0,0244
0,0307
0,0384
0,0475
0,0582
0,0239
0,0301
0,0375
0,0465
0,0571
0,0233
0,0294
0,0367
0,0455
0,0559
-1,4
-1,3
-1,2
-1,1
-1,0
0,0808
0,0968
0,1151
0,1357
0,1587
0,0793
0,0951
0,1131
0,1335
0,1562
0,0778
0,0934
0,1112
0,1314
0,1539
0,0764
0,0918
0,1093
0,1292
0,1515
0,0749
0,0901
0,1075
0,1271
0 ,1492
0,0735
0,0885
0,1056
0,1251
0,1469
0,0721
0,0869
0,1038
0,1230
0,1446
0,0708
0,0853
0,1020
0,1210
0,1423
0,0694
0,0838
0,1003
0,1190
0,1401
0,0681
0,0823
0,0985
0,1170
0,1379
-0,9
-0,8
-0,7
-0,6
-0,5
0,1841
0,2119
0,2420
0,2743
0,3085
0,1814
0,2090
0,2389
0,2709
0,3050
0,1788
0,2061
0,2358
0,2676
0,3015
0,1762
0,2033
0,2327
0,2643
0,2981
0,1736
0,2005
0,2296
0,2611
0,2946
0,1711
0,1977
0,2266
0,2578
0,2912
0,1685
0,1949
0,2236
0,2546
0,2877
0,1660
0,1922
0,2206
0,2514
0,2843
0,1635
0,1894
0,2177
0,2483
0,2810
0,1611
0,1867
0,2148
0,2451
0,2776
-0,4
-0,3
-0,2
-0,1
-0,0
0,3446
0,3821
0,4207
0,4602
0,5000
0,3409
0,3783
0,4168
0,4562
0,4960
0,3372
0,3745
0,4129
0,4522
0,4920
0,3336
0,3707
0,4090
0,4483
0,4880
0,3300
0,3669
0,4052
0,4443
0,4840
0,3264
0,3632
0,4013
0,4404
0,4801
0,3228
0,3594
0,3974
0,4364
0,4761
0,3192
0,3557
0,3936
0,4325
0,4721
0,3156
0,3520
0,3897
0,4286
0,4681
0,3121
0,3483
0,3859
0,4247
0,4641
z
0
1
2
3
4
5
6
7
8
9
0,0
0,1
0,2
0,3
0,4
0,5
0,5000
0,5398
0,5793
0,6179
0,6554
0,6915
0,5040
0,5438
0,5832
0,6217
0,6591
0,6950
0,5080
0,5478
0,5871
0,6255
0,6628
0,6985
0,5120
0,5517
0,5910
0,6293
0,6664
0,7019
0,5160
0,5557
0,5948
0,6331
0,6700
0,7054
0,5199
0,5596
0,5987
0,6368
0,6736
0,7088
0,5239
0,5636
0,6026
0,6406
0,6772
0,7123
0,5279
0,5675
0,6064
0,6443
0,6808
0,7157
0,5319
0,5714
0,6103
0,6480
0,6844
0,7190
0,5359
0,5753
0,6141
0,6517
0,6879
0,7224
0,6
0,7
0,8
0,9
1,0
0,7257
0,7580
0,7881
0,8159
0,8413
0,7291
0,7611
0,7910
0,8186
0,8438
0,7324
0,7642
0,7939
0,8212
0,8461
0,7357
0,7673
0,7967
0,8238
0,8485
0,7389
0,7704
0,7995
0,8264
0,8508
0,7422
0,7734
0,8023
0,8289
0,8531
0,7454
0,7764
0,8051
0,8315
0,8554
0,7486
0,7794
0,8078
0,8340
0,8577
0,7517
0,7823
0,8106
0,8365
0,8599
0,7549
0,7852
0,8133
0,8389
0,8621
1,1
1,2
1,3
1,4
1,5
0,8643
0,8849
0,9032
0,9192
0,9332
0,8665
0,8869
0,9049
0,9207
0,9345
0,8686
0,8888
0,9066
0,9222
0,9357
0,8708
0,8907
0,9082
0,9236
0,9370
0,8729
0,8925
0,9099
0,9251
0,9382
0,8749
0,8944
0,9115
0,9265
0,9394
0,8770
0,8962
0,9131
0,9279
0,9406
0,8790
0,8980
0,9147
0,9292
0,9418
0,8810
0,8997
0,9162
0,9306
0,9429
0,8830
0,9015
0,9177
0,9319
0,9441
1,6
1,7
1,8
1,9
2,0
0,9452
0,9554
0,9641
0,9713
0,9772
0,9463
0,9564
0,9649
0,9719
0,9778
0,9474
0,9573
0,9656
0,9726
0,9783
0,9484
0,9582
0,9664
0,9732
0,9788
0,9495
0,9591
0,9671
0,9738
0,9793
0,9505
0,9599
0,9678
0,9744
0,9798
0,9515
0,9608
0,9686
0,9750
0,9803
0,9525
0,9616
0,9693
0,9756
0,9808
0,9535
0,9625
0,9699
0,9761
0,9812
0,9545
0,9633
0,9706
0,9767
0,9817
2,1
2,2
2,3
2,4
2,5
0,9821
0,9861
0,9893
0,9918
0,9938
0,9826
0,9864
0,9896
0,9920
0,9940
0,9830
0,9868
0,9898
0,9922
0,9941
0,9834
0,9871
0,9901
0,9925
0,9943
0,9838
0,9875
0,9904
0,9927
0,9945
0,9842
0,9878
0,9906
0,9929
0,9946
0,9846
0,9881
0,9909
0,9931
0,9948
0,9850
0,9884
0,9911
0,9932
0,9949
0,9854
0,9887
0,9913
0,9934
0,9951
0,9857
0,9890
0,9916
0,9936
0,9952
2,6
2,7
2,8
2,9
3,0
0,9953
0,9965
0,9974
0,9981
0,9987
0,9955
0,9966
0,9975
0,9982
0,9987
0,9956
0,9967
0,9976
0,9982
0,9987
0,9957
0,9968
0,9977
0,9983
0,9988
0,9959
0,9969
0,9977
0,9984
0,9988
0,9960
0,9970
0,9978
0,9984
0,9989
0,9961
0,9971
0,9979
0,9985
0,9989
0,9962
0,9972
0,9979
0,9985
0,9989
0,9963
0,9973
0,9980
0,9986
0,9990
0,9964
0,9974
0,9981
0,9986
0,9990
Note:
Tabellen viser sandsynligheden: P ( Z< z), dvs. det skraverede område i figuren. Fx findes P ( Z ≤ 2,31)
ud for rækken med 2,3 og kolonnen med 1, dvs. P ( Z ≤ 2,31) = 0,9896.
Tabel 2. Standardnormalfordelingen: Fraktiler
P (Z < z )
z
0,001
0,005
0,010
0,020
0,025
0,030
0,040
0,050
0,100
0,150
0,200
0,250
0,300
0,350
0,400
0,450
0,500
0,550
0,600
0,650
0,700
0,750
0,800
0,850
0,900
0,950
0,960
0,970
0,975
0,980
0,990
0,995
0,999
-3,0902
-2,5758
-2,3263
-2,0537
-1,9600
-1,8808
-1,7507
-1,6449
-1,2816
-1,0364
-0,8416
-0,6745
-0,5244
-0,3853
-0,2533
-0,1257
0
0,1257
0,2533
0,3853
0,5244
0,6745
0,8416
1,0364
1,2816
1,6449
1,7507
1,8808
1,9600
2,0537
2,3263
2,5758
3,0902
Tabel 3. t-fordelingen: Fraktiler
Friheds­
grader
P
0,60
0,70
0,80
0,85
0,90
0,95
0,975
0,990
0,995
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
40
50
0,325
0,289
0,277
0,271
0,267
0,265
0,263
0,262
0,261
0,260
0,260
0,259
0,259
0,258
0,258
0,258
0,257
0,257
0,257
0,257
0,257
0,256
0,256
0,256
0,256
0,256
0,256
0,256
0,256
0,256
0,255
0,255
0,727
0,617
0,584
0,569
0,559
0,553
0,549
0,546
0,543
0,542
0,540
0,539
0,538
0,537
0,536
0,535
0,534
0,534
0,533
0,533
0,532
0,532
0,532
0,531
0,531
0,531
0,531
0,530
0,530
0,530
0,529
0,528
1,376
1,061
0,978
0,941
0,920
0,906
0,896
0,889
0,883
0,879
0,876
0,873
0,870
0,868
0,866
0,865
0,863
0,862
0,861
0,860
0,859
0,858
0,858
0,857
0,856
0,856
0,855
0,855
0,854
0,854
0,851
0,849
1,963
1,386
1,250
1,190
1,156
1,134
1,119
1,108
1,100
1,093
1,088
1,083
1,079
1,076
1,074
1,071
1,069
1,067
1,066
1,064
1,063
1,061
1,060
1,059
1,058
1,058
1,057
1,056
1,055
1,055
1,050
1,047
3,078
1,886
1,638
1,533
1,476
1,440
1,415
1,397
1,383
1,372
1,363
1,356
1,350
1,345
1,341
1,337
1,333
1,330
1,328
1,325
1,323
1,321
1,319
1,318
1,316
1,315
1,314
1,313
1,311
1,310
1,303
1,299
6,314
2,920
2,353
2,132
2,015
1,943
1,895
1,860
1,833
1,812
1,796
1,782
1,771
1,761
1,753
1,746
1,740
1,734
1,729
1,725
1,721
1,717
1,714
1,711
1,708
1,706
1,703
1,701
1,699
1,697
1,684
1,676
12,706
4,303
3,182
2,776
2,571
2,447
2,365
2,306
2,262
2,228
2,201
2,179
2,160
2,145
2,131
2,120
2,110
2,101
2,093
2,086
2,080
2,074
2,069
2,064
2,060
2,056
2,052
2,048
2,045
2,042
2,021
2,009
31,821
6,965
4,541
3,747
3,365
3,143
2,998
2,896
2,821
2,764
2,718
2,681
2,650
2,624
2,602
2,583
2,567
2,552
2,539
2,528
2,518
2,508
2,500
2,492
2,485
2,479
2,473
2,467
2,462
2,457
2,423
2,403
63,657
9,925
5,841
4,604
4,032
3,707
3,499
3,355
3,250
3,169
3,106
3,055
3,012
2,977
2,947
2,921
2,898
2,878
2,861
2,845
2,831
2,819
2,807
2,797
2,787
2,779
2,771
2,763
2,756
2,750
2,704
2,678
co
0,253
0,524
0,842
1,036
1,282
1,645
1,960
2,326
2,576
(d f . )
Noter:
1) Tabellen viser fraktilen tP(d.f.). Fx findes 0,7-fraktilen i t-fordelingen med 5 frihedsgrader, t0,7(5), i
rækken ud for „5” og i kolonnen under „0,7”. Dvs. t0,7(5) = 0,559.
2) t-fordelingen er symmetrisk. Derfor er t1–P(d .f) = – tp(d.f.)
Tabel 4. X2-fordelingen: Fraktiler
Friheds­
grader (d.f.)
P
0,01
0,025
0,05
0,10
0,20
0,30
0,50
0,70
0,80
0,90
0,95
0,975
0,99
6,635
1
0,000
0,001
0,004
0,016
0,064
0,148
0,455
1,074
1,642
2,706
3,841
5,024
2
0,020
0,051
0,103
0,211
0,446
0,713
1,386
2,408
3,219
4,605
5,991
7,378
9,210
3
0,115
0,216
0,352
0,584
1,005
1,424
2,366
3,665
4,642
6,251
7,815
9,348
11,345
4
0,297
0,484
0,711
1,064
1,649
2,195
3,357
4,878
5,989
7,779
9,488
11,143
13,277
5
0,554
0,831
1,145
1,610
2,343
3,000
4,351
6,064
7,289
9,236
11,070
12,833
15,086
6
0,872
1,237
1,635
2,204
3,070
3,828
5,348
7,231
8,558
10,645
12,592
14,449
16,812
7
1,239
1,690
2,167
2,833
3,822
4,671
6,346
8,383
9,803
12,017
14,067
16,013
18,475
8
1,646
2,180
2,733
3,490
4,594
5,527
7,344
9,524
11,030
13,362
15,507
17,535 20,090
9
2,088
2,700
3,325
4,168
5,380
6,393
8,343
10,656
12,242
14,684
16,919
19,023 21,666
10
2,558
3,247
3,940
4,865
6 ,179
7,267
9,342
11,781
13,442
15,987
18,307 20,483 23,209
19,675 21,920 24,725
11
3,053
3,816
4,575
5,578
6,989
8,148
10,341
12,899
14,631
17,275
12
3,571
4,404
5,226
6,304
7,807
9,034
11,340
14,011
15,812
18,549 21,026 23,337 26,217
13
4,107
5,009
5,892
7,042
8,634
9,926
12,340
15,119
16,985
19,812 22,362 24,736 27,688
14
4,660
5,629
6,571
7,790
9,467
10,821
13,339
16,222
18,151
21,064 23,685
15
5,229
6,262
7,261
8,547
10,307
11,721
14,339
17,322
19,311 22,307 24,996 27,488 30,578
16
5,812
6,908
7,962
9,312
11,152
12,624
15,338
18,418 20,465 23,542 26,296 28,845 32,000
17
6,408
7,564
8,672
10,085
12,002
13,531
16,338
19,511
18
7,015
8,231
9,390
10,865
12,857
14,440
17,338 20,601
26,119 29,141
21,615 24,769 27,587 30,191
22,760 25,989
33,409
28,869 31,526 34,805
19
7,633
8,907
10,117
11,651
13,716
15,352
18,338 21,689 23,900 27,204 30,144 32,852 36,191
20
8,260
9,591
10,851
12,443
14,578
16,266
19,337 22,775 25,038 28,412 31,410 34,170 37,566
21
8,897
10,283
11,591
13,240
15,445
17,182 20,337 23,858 26,171
29,615 32,671
22
9,542
10,982
12,338
14,041
16,314
18,101
21,337 24,939 27,301
30,813
23
10,196
11,689
13,091
14,848
17,187
19,021
22,337 26,018 28,429 32,007 35,172 38,076 41,638
24
10,856
12,401
13,848
15,659
18,062
19,943 23,337 27,096 29,553
25
11,524
13,120
14,611
16,473
18,940 20,867 24,337 28,172 30,675
26
12,198
13,844
15,379
17,292
19,820 21,792 25,336 29,246 31,795 35,563
27
12,879
14,573
16,151
18,114 20,703
28
13,565
15,308
16,928
18,939 21,588 23,647 27,336 31,391
34,027 37,916 41,337 44,461
29
14,256
16,047
17,708
19,768 22,475 24,577 28,336 32,461
35,139 39,087 42,557 45,722 49,588
16,791
18,493 20,599 23,364 25,508 29,336 33,530 36,250 40,256 43,773 46,979 50,892
30
14,953
22,164 24,433 26,509 29,051
50
29,707 32,357 34,764 37,689 41,449 44,313 49,335 54,723
60
37,485 40,482 43,188 46,459 50,641
Noter:
Tabellen viser fraktilen
kolonnen under „0,2”. Dvs.
33,196 36,415
40,289
39,364 42,980
34,382 37,652 40,646 44,314
22,719 26,336 30,319 32,912 36,741
40
35,479 38,932
33,924 36,781
32,345 34,872 39,335 44,165 47,269 51,805
38,885 41,923 45,642
40,113 43,195 46,963
48,278
55,758 59,342 63,691
58,164 63,167 67,505
71,420 76,154
53,809 59,335 65,227 68,972 74,397 79,082 83,298 88,379
Fx findes 0,2-fraktilen i X2-fordelingen m ed 3 frihedsgrader.
i rækken ud for „3” og i
Tabel 5. F-fordelingen: 0,95-fraktiler
Frihedsgrader, r
Friheds­
grader, s 1
2
3
4
5
6
8
10
12
15
20
24
30
161,45
199,50
215,71
224,58
230,16
233,99
238,88
241,88
243,91
245,95
248,01
249,05
250,10
2
18,51
19,00
19,16
19,25
19,30
19,33
19,37
19,40
19,41
19,43
19,45
19,45
19,46
3
10,13
9,55
9,28
9,12
9,01
8,94
8,85
8,79
8,74
8,70
8,66
8,64
8,62
4
7,71
6,94
6,59
6,39
6,26
6,16
6,04
5,96
5,91
5,86
5,80
5,77
5,75
4,50
1
5
6,61
5,79
5,41
5,19
5,05
4,95
4,82
4,74
4,68
4,62
4,56
4,53
6
5,99
5,14
4,76
4,53
4,39
4,28
4,15
4,06
4,00
3,94
3,87
3,84
3,81
7
5,59
4,74
4,35
4,12
3,97
3,87
3,73
3,64
3,57
3,51
3,44
3,41
3,38
3,08
8
5,32
4,46
4,07
3,84
3,69
3,58
3,44
3,35
3,28
3,22
3,15
3,12
9
5,12
4,26
3,86
3,63
3,48
3,37
3,23
3,14
3,07
3,01
2,94
2,90
2,86
10
4,96
4,10
3,71
3,48
3,33
3,22
3,07
2,98
2,91
2,85
2,77
2,74
2,70
11
4,84
3,98
3,59
3,36
3,20
3,09
2,95
2,85
2,79
2,72
2,65
2,61
2,57
12
4,75
3,89
3,49
3,26
3,11
3,00
2,85
2,75
2,69
2,62
2,54
2,51
2,47
13
4,67
3,81
3,41
3,18
3,03
2,92
2,77
2,67
2,60
2,53
2,46
2,42
2,38
14
4,60
3,74
3,34
3,11
2,96
2,85
2,70
2,60
2,53
2,46
2,39
2,35
2,31
15
4,54
3,68
3,29
3,06
2,90
2,79
2,64
2,54
2,48
2,40
2,33
2,29
2,25
16
4,49
3,63
3,24
3,01
2,85
2,74
2,59
2,49
2,42
2,35
2,28
2,24
2,19
17
4,45
3,59
3,20
2,96
2,81
2,70
2,55
2,45
2,38
2,31
2,23
2,19
2,15
18
4,41
3,55
3,16
2,93
2,77
2,66
2,51
2,41
2,34
2,27
2,19
2,15
2,11
19
4,38
3,52
3,13
2,90
2,74
2,63
2,48
2,38
2,31
2,23
2,16
2,11
2,07
20
4,35
3,49
3,10
2,87
2,71
2,60
2,45
2,35
2,28
2,20
2,12
2,08
2,04
21
4,32
3,47
3,07
2,84
2,68
2,57
2,42
2,32
2,25
2,18
2,10
2,05
2,01
22
4,30
3,44
3,05
2,82
2,66
2,55
2,40
2,30
2,23
2,15
2,07
2,03
1,98
23
4,28
3,42
3,03
2,80
2,64
2,53
2,37
2,27
2,20
2,13
2,05
2,01
1,96
24
4,26
3,40
3,01
2,78
2,62
2,51
2,36
2,25
2,18
2,11
2,03
1,98
1,94
25
4,24
3,39
2,99
2,76
2,60
2,49
2,34
2,24
2,16
2,09
2,01
1,96
1,92
30
4,17
3,32
2,92
2,69
2,53
2,42
2,27
2,16
2,09
2,01
1,93
1,89
1,84
40
4,08
3,23
2,84
2,61
2,45
2,34
2,18
2,08
2,00
1,92
1,84
1,79
1,74
60
4,00
3,15
2,76
2,53
2,37
2,25
2,10
1,99
1,92
1,84
1,75
1,70
1,65
Noter:
1) Tabellen viser 0,95-fraktilen i F-fordelingen med (r, s ) frihedsgrader. Fx findes 0,95-fraktilen i F-fordelingen m ed (4, 3)
frihedsgrader i rækken ud for „3” og i kolonnen under „4” . Dvs. F 0,95(4, 3) = 9,12.
2) 0,05-fraktilen i F-fordelingen med (s, r) frihedsgrader findes som:
delingen m ed (6, 5) frihedsgrader som:
Fx findes 0,05-fraktilen i F-for-
Tabel 6. F-fordelingen: 0,975-fraktiler
Friheds­
grader, s
Frihedsgrader, r
1
2
3
4
5
6
8
10
12
15
20
24
30
1
647,79
799,50
864,16
899,58
921,85
937,11
956,66
968,63
976,71
984,87
993,10
997,25
1001,41
2
38,51
39,00
39,17
39,25
39,30
39,33
39,37
39,40
39,41
39,43
39,45
39,46
39,46
3
17,44
16,04
15,44
15,10
14,88
14,73
14,54
14,42
14,34
14,25
14,17
14,12
14,08
4
12,22
10,65
9,98
9,60
9,36
9,20
8,98
8,84
8,75
8,66
8,56
8,51
8,46
5
10,01
8,43
7,76
7,39
7,15
6,98
6,76
6,62
6,52
6,43
6,33
6,28
6,23
6
8,81
7,26
6,60
6,23
5,99
5,82
5,60
5,46
5,37
5,27
5,17
5,12
5,07
7
8,07
6,54
5,89
5,52
5,29
5,12
4,90
4,76
4,67
4,57
4,47
4,41
4,36
8
7,57
6,06
5,42
5,05
4,82
4,65
4,43
4,30
4,20
4,10
4,00
3,95
3,89
9
7,21
5,71
5,08
4,72
4,48
4,32
4,10
3,96
3,87
3,77
3,67
3,61
3,56
10
6,94
5,46
4,83
4,47
4,24
4,07
3,85
3,72
3,62
3,52
3,42
3,37
3,31
11
6,72
5,26
4,63
4,28
4,04
3,88
3,66
3,53
3,43
3,33
3,23
3,17
3,12
12
6,55
5,10
4,47
4,12
3,89
3,73
3,51
3,37
3,28
3,18
3,07
3,02
2,96
13
6,41
4,97
4,35
4,00
3,77
3,60
3,39
3,25
3,15
3,05
2,95
2,89
2,84
14
6,30
4,86
4,24
3,89
3,66
3,50
3,29
3,15
3,05
2,95
2,84
2,79
2,73
15
6,20
4,77
4,15
3,80
3,58
3,41
3,20
3,06
2,96
2,86
2,76
2,70
2,64
16
4,69
4,08
3,73
3,50
3,34
3,12
2,99
2,89
2,79
2,68
2,63
2,57
17
6,12
6,04
4,62
4,01
3,66
3,44
3,28
3,06
2,92
2,82
2,72
2,62
2,56
2,50
18
5,98
4,56
3,95
3,61
3,38
3,22
3,01
2,87
2,77
2,67
2,56
2,50
2.44
19
5,92
4,51
3,90
3,56
3,33
3,17
2,96
2,82
2,72
2,62
2,51
2,45
2,39
20
5,87
4,46
3,86
3,51
3,29
3,13
2,91
2,77
2,68
2,57
2,46
2,41
2,35
21
5,83
4,42
3,82
3,48
3,25
3,09
2,87
2,73
2,64
2,53
2,42
2,37
2,31
22
5,79
4,38
3,78
3,44
3,22
3,05
2,84
2,70
2,60
2,50
2,39
2,33
2,27
23
5,75
4,35
3,75
3,41
3,18
3,02
2,81
2,67
2,57
2,47
2,36
2,30
2,24
24
5,72
4,32
3,72
3,38
3,15
2,99
2,78
2,64
2,54
2,44
2,33
2,27
2,21
25
5,69
4,29
3,69
3,35
3,13
2,97
2,75
2,61
2,51
2,41
2,30
2,24
2,18
30
5,57
4,18
3,59
3,25
3,03
2,87
2,65
2,51
2,41
2,31
2,20
2,14
2,07
40
5,42
4,05
3,46
3,13
2,90
2,74
2,53
2,39
2,29
2,18
2,07
2,01
1,94
60
5,29
3,93
3,34
3,01
2,79
2,63
2,41
2,27
2,17
2,06
1,94
1,88
1,82
Noter:
1) Tabellen viser 0,975-fraktilen i F-fordelingen m ed (r, s ) frihedsgrader. Fx findes 0,975-fraktilen i F-fordelingen m ed (4, 3)
frihedsgrader i rækken ud for „3” og i kolonnen under „4” . Dvs. F 0,975(4 , 3) = 15,10.
2) 0,025-fraktilen i F-fordelingen m ed (s, r) frihedsgrader findes som:
F-fordelingen m ed (6, 5) frihedsgrader som:
Fx findes 0,025-fraktilen i
Stikordsregister
A
D
additionssætningen 63
alternativhypotese 310
andelsfunktion 30
andelsfunktion, kum ulativ 34
decil 124
deduktion 20, 197
diff-in-diff estim ator 366
d iffusionskoeffi cient 190, 195
driftparam eter 187, 190
B
dum m yvariabel 448
baggrundskarakteristika 209
B ayes’ form el 90, 100
behandling 349
B ernoullifordeling 139
Bernoullipopulation 139
Bernoulliproces 177
beslutningsregel 317, 324
betinget middelværdi 400
binom ialfordeling 144
binom ialkoefficient 142
binom ialproces 178
box plot 38
Brownsk bevægelse 190
C
central 237
centrale grænseværdisæt­
ning 242
central tendens 125
centralt m om ent 119
central (unbiased) estim ator 237
c2-test 375
c2-test, fordeling 384
c2-test, uafhængighed 389
E
efficient 238
eksperim ent 49
eksponentialfordeling 186
element 25
em pirisk fordelingsfunktion 271
Erlangfordeling 185
estim at 236
estim ator 200, 236
F
F-fordeling 301
first passage time 175
fordelingsfunktion 81, 94
foreningshændelse 57
forudsigelser 197
forudsigelsesfejl 398
forventet værdi 108
forventet væ rdi, diskret
stokastisk variabel 108
forventet væ rdi, funktion 111
forventet væ rdi, kontinuert
stokastisk variabel 113
forventet væ rdi, regnereg­
ler 112, 113
forventet væ rdi, sum a f
stokastiske variabler 127
fraktil 37, 38, 120, 123, 124
frekvens 30
frekvens, relativ 30
fælleshændelse 57
første-differens transfor­
mation 171
hypotesetest, koefficient 437
hypotesetest, m iddelværdi 337
hypotesetest, uafhængighed 389
hypotesetest, varians 342
hældningskoefficient 401
hændelse 55
hændelser, kom plem entære 59
hændelser, sikre 57
hændelser, um ulige 57
hæ ndelsesalgebra 57
G
I
Gaussisk random w alk 187
geom etrisk fordeling 182
identifikation 214
H
ikke-observationsfejl 223
ikke-respondent 222
ikke-restringerede model 439
induktion 20, 197
interaktionsled 447
intercept 401
intervalestim ator 284
interviewerfejl 225
inverse sampling 175
invers Gaussisk fordeling 191
heltalsværdi 37
heterogene klynger 259
heteroskedasticitet 40 7 , 413
histogram 31
hom ogene strata 259
hom oskedasticitet 40 7, 413
hypergeom etrisk fordeling 147
hypotese, enkeltsidet 331
hypotese, dobbeltsidet 329
hypotese, sam m ensat 328
hypotese, simpel 328
hypotesem ål 314
hypotesem ål, estim eret 315
hypotesetest 201, 3 09, 323
hypotesetest, effekt a f
karakteristika 25
kausalitet 68
klyngeudvælgelse 259, 260
kodefejl 225
konfidensinterval 20 1 , 280
konfidensinterval for andel 287
behandling 363
hypotesetest, fordeling 384
konfidensinterval for m id­
delværdi 291
hypotesetest, forskel på
flere m iddelværdier 357, 358
konfidensinterval for varians 294
konfidensinterval, lineær
hypotesetest, forskel på to
K
regression 426, 429, 438
m iddelværdier 358
hypotesetest, forskel på to
varianser 369
kontrolgruppe 363
hypotesetest, hæ ldningsko­
efficient 420
korrelationskoefficient 4 4 , 132
kovarians 4 3 , 127
hypotesetest, hom ogenitet 390
konfidensniveau 282
konsistent 239
kovarians, diskrete stoka­
stiske variabler 128
kovarians, kontinuerte
stokastiske variabler 130
kovarians, regneregler 130
kritisk værdi 317
krydstabel 41
kurtosiskoefficient 268
kvartil 123
norm alfordeling 152, 157
nulhypotese 310
O
observationsfejl 225
OLS-estim ator 405, 40 9 , 434
optagefejl 225
optimal allokering 254
optimal stikprøvestørrelse 256
ordensstatistik 275
L
lagkagediagram 33
lineær regression, estim a­
torer 4 03, 434
lineær regression, forudsi­
gelse 398, 42 3 , 424, 444
lineær regression, multipel 429
lineær regression, simpel 401
loven om itererede forvent­
ninger 247
M
m edian 35, 36, 120, 121, 124
middelværdi 39, 108, 109, 110
mindste-kvadraters-metode 405
m odalværdi 125
m om ent 108, 119
multinom ialfordeling 161
m ultinomialkoefficient 159
multipel lineær regression 429
målefejl 225
m åleskala, interval 26, 27
m åleskala, nominal 26, 27
m åleskala, ordinal 26, 27
m åleskala, ratio 2 6 , 28
m åling, kvalitativ 26
P
paneldata 364
partiel-sum transform ation 170
percentil 124
pilotundersøgelse 205
poissonfordeling 151
Poissonproces 182
pooled variansestimator
298, 352
population 20, 25 , 49
population, virkelig 26, 50
(p, p)-plot 415
proportional allokering 256, 257
præ ference, afsløret 2 11
præ ference, formodet 2 11
p-værdi 335
punktdiagram 42
punktestim ator 284
Q
(q, q)-plot 418
R
rangordnet værdi 36
m åling, kvantitativ 26
m åling ved observation 210
reel signifikans 344
regressionsanalyse 201
regressionsfunktion 396
m ålpopulation 206
reliabilitet 211
N
negativ binom ialfordeling 181
residual 410
residualplot 411
responsfejl 225
restringerede model 439
S
sam m enhæ ng, kausal 68
sam m enhæ ng, spuriøs 71
sam m ensat hypotese 328
sandsynlighed 59
sandsynlighed, betinget 66, 88
sandsynlighed, marginal 86
sandsynlighedsfunktion 79
sandsynlighedsfunktion,
betinget 89
sandsynlighedsfunktion,
egenskaber 80
sandsynlighedsfunktion,
kum ulativ 81, 94
sandsynlighedsfunktion,
m arginal 87
sandsynlighedsfunktion,
simultan 86
sandsynlighed, simultan 86
sandsynlighedsm odellen 53
sandsynlighedsm ål 62
sandsynlighedsteori 17, 21
sandsynlighed, tilskrivning 60
selektionsbias 413
selvrapportering 210
selvselektion 223
signifikans, reel 343
signifikans, statistisk 343
signifikansniveau 318
simpel hypotese 328
simpel lineær regression 401
simpel tilfældig stikprøve 232
skævhedskoefficient 268
snowballing 210
spørgsmålsfejl 225
standardafvigelse 4 0 , 116
standardafvigelse, regne­
regler 117, 118
standardfejl 408 , 433
standardisering 155
standardnorm alfordeling 155
statistik 21
statistisk signifikans 343
stikprøve 20, 49
stikprøveanalogprincippet
234, 263
stikprøveenhed 20 4 , 207
stikprøvegennem snit 235
stikprøvekorrelationskoef­
ficient 270
stikprøvekovarians 269
stikprøveram me 204, 207
stikprøve, repræsentativ 216
stikprøvesti 168
stikprøvestørrelse 337
stikprøvestørrelse, konfi­
densintervalbaseret 303
stikprøvevarians 264
stokastisk proces 168
stokastisk proces, begiven­
hed 169
stokastisk proces, diskret tid 168
stokastisk proces, kontinu­
ert tid 168
stokastisk proces, realisering 168
stokastisk variabel 169
stokastisk variabel, di­
skret 77, 78
stokastisk variabel, konti­
nuert 77, 92
stratificeret stikprøvegen­
nem snit 249
stratifikation 210, 245
stratifikation uden tilbage­
lægning 258
stratumstikprøvestørrelse 254
styrke 313
styrkefunktion 330
superpopulation 50
søjlediagram 30
T
teststatistik 315, 324
t-fordeling 285
tidsrække 413
tilstandsfordeling 172
type-I-fejl 312
type-II-fejl 312
tælleproces 180
tæthedsfunktion 96
tæthedsfunktion, betinget 96
tæthedsfunktion, m arginal 96
tæthedsfunktion, simultan 96
U
uafhængighed 68, 93, 99
uafhængighed, betinget 70
udeladte-variabel-bias 451
udfald 54
udfaldsrum 54
udtagning, bevidst 209
udtagning, ikke-statistisk 208
udtagning, kvota- 209
udtagning, statistisk 209
udtagning, tilgængelig 209
udtrækning 20
udvælgelseskarakteristi­
kum 208, 213
udvælgelsesm ekanism e 49
unbiased 237
usikkerhed 17, 19
V
validitet 211
variabel, afhængig 397
variabel, forklarede 397
variabel, forklarende 397
variabel, uafhængig 397
varians 40, 108, 115
variansanalyse 360
varians, diskret stokastisk
variabel 115
varians, kontinuert stoka­
stisk variabel 118
varians, regneregler 117, 118
varians, sum a f stokastiske
variabler 130
ventetidsfordeling 174
W
Wienerproces 190
0
You can add this document to your study collection(s)
Sign in Available only to authorized usersYou can add this document to your saved list
Sign in Available only to authorized users(For complaints, use another form )