Download - Fachgebiet Datenbanken und Informationssysteme
Transcript
4.2 Regression 4.2 Regression In der Movie-Datenbank soll untersucht werden, ob es zwischen dem Jahr und der Anzahl produzierter Filme eine Abhängigkeit in Form einer Regressionsfunktion gibt. Diese Regressionsfunktion ist bewusst nur von einem Parameter abhängig, damit diese anschaulich in einem zweidimensionalen Diagramm dargestellt werden kann. Es wird also eine Funktion gesucht, die bei Angabe der Jahreszahl die Anzahl der produzierten Filme in dem Jahr berechnet. Das Vorgehen dieser Data Mining-Aufgabe, der Regressionsanalyse, wird in die folgenden Schritte unterteilt: 1. Bereitstellung der Daten 2. Preprocessing und Transformation 3. Data Mining – Regressionsanalyse 4. Testen des Regressionsmodells (Genauigkeit) 5. Darstellung & Auswertung der Ergebnisse 4.2.1 Regressionsanalyse: Jahr und Anzahl produzierter Filme pro Jahr 1. Bereitstellung der Daten: Zunächst werden die Daten, die zur Definition der Regressionsfunktion erforderlich sind, zusammengefasst. In Listing 4.8 wird dazu eine Tabelle definiert, die die notwendigen Informationen – Identifikation der Datensätze (ID), Jahreszahl (YEAR) und Anzahl der produzierten Filme (ANZ_MOVIE) – enthält. Des weiteren sind die Daten auf die Jahre zwischen 1920 und 2005 beschränkt. CREATE TABLE regression_data AS select rownum as id , year , anz_movie from ( select year , count ( a . movie ) as anz_movie from moviedb . movie a where year >= 1920 and year <= 2005 group by year ) f ; Listing 4.8: Daten zur Regressionsanalyse In Abb. 4.2 (a) sind die Daten dieser Tabelle graphisch in einem Diagramm dargestellt. Aus dem Diagramm ist erkennbar, dass die Regressionsfunktion – zwischen den Jahren 1920 und 2005 – nicht linear verlaufen wird. Da die Regressionsanalyse in ODM mit dem Support Vector MaschineAlgorithmus (siehe Kapitel 3) durchgeführt wird, werden im nicht-linearen Fall keine Informationen über das Modell und somit auch keine Angaben über die Regressionsfunktion verfügbar sein. Aus diesem Grund wird der Bereich zur Definition der Regressionsfunktion im zweiten Schritt auf die Jahre zwischen 1990 und 2005 beschränkt, da die Regressionsfunktion in diesem Bereich vermutlich linear ist. Der eingeschränkte Bereich ist in Abb. 4.2 (b) graphisch dargestellt. Anmerkung: Die Veranschaulichung des Problems mittels der Diagramme ist in diesem Beispiel gut realisierbar und vermutlich erscheint dadurch die Regressionsanalyse überflüssig, aber der Aspekt der Visualisierung geht bei mehr-dimensionalen Problemen schnell verloren. 2. Preprocessing und Transformation: In diesem Schritt wird das Preprocessing und die Transformation der Daten durchgeführt. Da die Daten jedoch derart stark selektiert wurden, dass keine fehlenden Werte enthalten sind, kann auf eine Behandlung von fehlenden Werte verzichtet werden. 79