Download - Fachgebiet Datenbanken und Informationssysteme

Transcript
4.2 Regression
4.2 Regression
In der Movie-Datenbank soll untersucht werden, ob es zwischen dem Jahr und der Anzahl produzierter Filme eine Abhängigkeit in Form einer Regressionsfunktion gibt. Diese Regressionsfunktion
ist bewusst nur von einem Parameter abhängig, damit diese anschaulich in einem zweidimensionalen Diagramm dargestellt werden kann. Es wird also eine Funktion gesucht, die bei Angabe der
Jahreszahl die Anzahl der produzierten Filme in dem Jahr berechnet.
Das Vorgehen dieser Data Mining-Aufgabe, der Regressionsanalyse, wird in die folgenden Schritte
unterteilt:
1. Bereitstellung der Daten
2. Preprocessing und Transformation
3. Data Mining – Regressionsanalyse
4. Testen des Regressionsmodells (Genauigkeit)
5. Darstellung & Auswertung der Ergebnisse
4.2.1 Regressionsanalyse: Jahr und Anzahl produzierter Filme pro Jahr
1. Bereitstellung der Daten: Zunächst werden die Daten, die zur Definition der Regressionsfunktion erforderlich sind, zusammengefasst. In Listing 4.8 wird dazu eine Tabelle definiert, die die notwendigen Informationen – Identifikation der Datensätze (ID), Jahreszahl (YEAR) und Anzahl der
produzierten Filme (ANZ_MOVIE) – enthält. Des weiteren sind die Daten auf die Jahre zwischen
1920 und 2005 beschränkt.
CREATE TABLE regression_data AS
select rownum as id , year , anz_movie
from (
select year , count ( a . movie ) as anz_movie
from moviedb . movie a
where year >= 1920 and year <= 2005
group by year ) f ;
Listing 4.8: Daten zur Regressionsanalyse
In Abb. 4.2 (a) sind die Daten dieser Tabelle graphisch in einem Diagramm dargestellt. Aus dem
Diagramm ist erkennbar, dass die Regressionsfunktion – zwischen den Jahren 1920 und 2005 –
nicht linear verlaufen wird. Da die Regressionsanalyse in ODM mit dem Support Vector MaschineAlgorithmus (siehe Kapitel 3) durchgeführt wird, werden im nicht-linearen Fall keine Informationen über das Modell und somit auch keine Angaben über die Regressionsfunktion verfügbar sein.
Aus diesem Grund wird der Bereich zur Definition der Regressionsfunktion im zweiten Schritt auf
die Jahre zwischen 1990 und 2005 beschränkt, da die Regressionsfunktion in diesem Bereich vermutlich linear ist. Der eingeschränkte Bereich ist in Abb. 4.2 (b) graphisch dargestellt.
Anmerkung: Die Veranschaulichung des Problems mittels der Diagramme ist in diesem Beispiel gut
realisierbar und vermutlich erscheint dadurch die Regressionsanalyse überflüssig, aber der Aspekt
der Visualisierung geht bei mehr-dimensionalen Problemen schnell verloren.
2. Preprocessing und Transformation: In diesem Schritt wird das Preprocessing und die Transformation der Daten durchgeführt. Da die Daten jedoch derart stark selektiert wurden, dass keine
fehlenden Werte enthalten sind, kann auf eine Behandlung von fehlenden Werte verzichtet werden.
79