from google.colab import files
uploaded = files.upload()
import pandas as pd
from sklearn.preprocessing import LabelEncoder, StandardScaler
df = pd.read_csv("titanic.csv")
print("\n--- First 5 records ---")
print(df.head())
print("\n--- Shape ---")
print(df.shape)
print("\n--- Data Types ---")
print(df.dtypes)
print("\n--- Dataset Info ---")
df.info()
print("\n--- Statistical Summary ---")
print(df.describe(include="all"))
print("\n--- Missing Values ---")
print(df.isnull().sum())
print("\n--- Duplicate Records ---")
print(df.duplicated().sum())
df.drop_duplicates(inplace=True)
if "Age" in df.columns:
df["Age"] = df["Age"].fillna(df["Age"].median())
if "Fare" in df.columns:
df["Fare"] = df["Fare"].fillna(df["Fare"].median())
if "Embarked" in df.columns:
df["Embarked"] = df["Embarked"].fillna(df["Embarked"].mode()[0])
if "Cabin" in df.columns:
df.drop("Cabin", axis=1, inplace=True)
encoder = LabelEncoder()
if "Sex" in df.columns:
df["Sex"] = encoder.fit_transform(df["Sex"])
if "Embarked" in df.columns:
df["Embarked"] = encoder.fit_transform(df["Embarked"])
cleaned_file = "cleaned_titanic.csv"
df.to_csv(cleaned_file, index=False)
print("\nCleaned Dataset Saved Successfully!")
scaled_df = df.copy()
scale_cols = ["Age", "Fare", "SibSp", "Parch"]
available_cols = [
col for col in scale_cols
if col in scaled_df.columns
]
scaler = StandardScaler()
scaled_df[available_cols] = scaler.fit_transform(
scaled_df[available_cols]
)
scaled_file = "scaled_titanic.csv"
scaled_df.to_csv(scaled_file, index=False)
print("\nScaled Dataset Saved Successfully!")
print("\n--- Cleaned Dataset ---")
print(df.head())
print("\n--- Scaled Dataset ---")
print(scaled_df.head())
files.download(cleaned_file)
files.download(scaled_file)
print("\nPreprocessing Completed Successfully!")3 views