Inleiding tot regressie

Leer hoe je de best passende lijn door datapunten vindt en voorspellingen maakt met lineaire regressie.

Gevorderd25 minLes

Definitie

Lineaire regressie is een statistische methode om de rechte lijn te vinden die het beste past bij een verzameling datapunten. Deze lijn wordt de best passende lijn of regressielijn genoemd.
De vergelijking van een regressielijn is:
waarbij:
  • de helling is (hoe steil de lijn is)
  • het y-snijpunt is (waar de lijn de y-as snijdt)
  • de invoervariabele is (onafhankelijke variabele)
  • de voorspelde uitvoer is (afhankelijke variabele)
Het doel van regressie is om de totale afstand tussen de datapunten en de lijn te minimaliseren, zodat we voorspellingen kunnen doen voor nieuwe waarden van .

Probeer het meteen

Wat stelt de voor in de vergelijking ?

Uitgewerkte voorbeelden

Een studie toont aan dat voor elk extra uur studeren de testscores met 5 punten stijgen. Als een student die 0 uur studeert 50 punten scoort, wat is de regressievergelijking?

1

De helling identificeren

Score stijgt met 5 punten per uur studeren

2

Het y-snijpunt identificeren

Wanneer uur, is de score 50 punten

3

De vergelijking schrijven

Vul en in in

Veelgemaakte fouten

De volgorde van aftrekking in de hellingsformule verwarren

Waarom het fout is: Het gebruik van in plaats van geeft het omgekeerde van de juiste helling.

Correct: Onthoud: helling is 'stijging over verloop' - de verandering in (verticaal) gedeeld door de verandering in (horizontaal).

Te ver buiten de data extrapoleren

Waarom het fout is: De regressielijn is alleen betrouwbaar binnen het bereik van je data. Voorspellen ver buiten dit bereik kan leiden tot onrealistische resultaten.

Correct: Wees voorzichtig met voorspellingen voor -waarden die veel groter of kleiner zijn dan je oorspronkelijke datapunten.

Aannemen dat correlatie causaliteit betekent

Waarom het fout is: Alleen omdat twee variabelen gerelateerd zijn (gecorreleerd) betekent niet dat de ene de andere veroorzaakt.

Correct: Regressie toont relaties, maar aanvullende analyse is nodig om causaliteit vast te stellen.

Interactieve visualisatie

Lineaire functie verkenner

y = x
Helling (m)1
Y-snijpunt (b)0
b
verloop
stijging
xy
-2-2
-1-1
00
11
22

Interactieve sandbox

Interactieve grafieker

Probeer deze voorbeelden:

y = 2x + 1

m=2, b=1

Expressiecalculator

Probeer deze:

Geschiedenis

Nog geen berekeningen

Oefenproblemen

16 opgaven
Opgave 1 van 16
Makkelijk

Wat stelt de voor in de vergelijking ?

Waarom het belangrijk is

Lineaire regressie is een van de meest gebruikte hulpmiddelen in datawetenschap en statistiek:
  • Zakelijk: Verkoop voorspellen op basis van advertentie-uitgaven
  • Geneeskunde: Medicijndosering schatten op basis van patiëntgewicht
  • Economie: BBP-groei voorspellen uit verschillende indicatoren
  • Sport: Prestaties van atleten projecteren uit trainingsmetrieken
  • Wetenschap: Relaties tussen variabelen modelleren in experimenten
Het begrijpen van regressie helpt je om datagestuurde beslissingen te nemen en voorspellingen te doen op basis van echt bewijs in plaats van giswerk.

Toepassingen in de echte wereld

Huizenprijzen voorspellen

Vastgoedanalisten gebruiken regressie om huiswaarden te schatten op basis van factoren zoals vierkante meters, aantal slaapkamers en locatie.

Voorbeeld:

Als huizen voor ongeveer €1500 per vierkante meter verkopen met een basisprijs van €50000, zou de vergelijking kunnen zijn, waarbij het aantal vierkante meters is.

1Probeer het zelf

Een vastgoedmodel toont: , waarbij het aantal vierkante meters is en de prijs in euro.

Wat is de voorspelde prijs voor een huis van 150 vierkante meter?

Stap 1: Schrijf de wiskundige uitdrukking

Vul in de vergelijking in:

Brandstofefficiëntie-analyse

Auto-ingenieurs gebruiken regressie om te begrijpen hoe het voertuiggewicht het brandstofverbruik beïnvloedt.

Voorbeeld:

Data zou kunnen tonen dat de brandstofefficiëntie met 0,005 km/L afneemt voor elke kilogram extra gewicht.

2Probeer het zelf

Een automodel toont: , waarbij het gewicht in kg is en de efficiëntie in km/L.

Welke efficiëntie wordt voorspeld voor een auto van 1200 kg?

Stap 1: Schrijf de wiskundige uitdrukking

Bereken:

Belangrijke punten

  • 1Lineaire regressie vindt de lijn die het beste past bij een verzameling datapunten
  • 2De regressievergelijking is , waarbij de helling is en het y-snijpunt
  • 3De helling wordt berekend als (stijging over verloop)
  • 4Zodra je de vergelijking hebt, kun je voorspellingen doen door waarden voor in te vullen
  • 5Regressie toont correlatie, maar correlatie impliceert geen causaliteit

Veelgestelde vragen

Echte data valt zelden perfect op een lijn. De regressielijn minimaliseert de totale kwadratische afstand van alle punten tot de lijn. Sommige punten zullen boven de lijn liggen, sommige eronder - dat is normaal!
Echte data valt zelden perfect op een lijn. De regressielijn minimaliseert de totale kwadratische afstand van alle punten tot de lijn. Sommige punten zullen boven de lijn liggen, sommige eronder - dat is normaal!
De -waarde (determinatiecoëfficiënt) meet hoe goed de lijn past. Deze varieert van 0 tot 1 - hogere waarden betekenen een betere fit. Je leert hier meer over in de les over correlatie.
Lineaire regressie werkt alleen voor rechte-lijnrelaties. Voor gebogen relaties heb je polynomiale regressie of andere geavanceerde methoden nodig.

Woordenlijst

Lineaire regressie
Een statistische methode om de best passende rechte lijn door datapunten te vinden
Best passende lijn
De rechte lijn die de afstand tussen zichzelf en alle datapunten minimaliseert
Helling
De steilheid van de lijn, die de veranderingssnelheid voorstelt ( in )
Y-snijpunt
Het punt waar de lijn de y-as snijdt ( in )
Voorspelling
De regressievergelijking gebruiken om te schatten voor een gegeven waarde van
Onafhankelijke variabele
De invoervariabele () die we gebruiken om voorspellingen te doen
Afhankelijke variabele
De uitvoervariabele () die we proberen te voorspellen

Meer over dit onderwerp