JustPaste
HomeCategoriesAboutDonateContactTerms of UsePrivacy Policy
JustPaste

Free online notepad — write and share instantly

Navigate

  • Home
  • Timeline
  • Categories

Info

  • About
  • Donate
  • Contact

Legal

  • Terms of Use
  • Privacy Policy

© 2026 JustPaste.app. All rights reserved.

Made with ♥ by JustPaste

ml 1 | JustPaste.app
29 days ago3 views
👨‍💻Programming

ml 1

from google.colab import files
uploaded = files.upload()

import pandas as pd
from sklearn.preprocessing import LabelEncoder, StandardScaler

df = pd.read_csv("titanic.csv")

print("\n--- First 5 records ---")
print(df.head())

print("\n--- Shape ---")
print(df.shape)

print("\n--- Data Types ---")
print(df.dtypes)

print("\n--- Dataset Info ---")
df.info()

print("\n--- Statistical Summary ---")
print(df.describe(include="all"))

print("\n--- Missing Values ---")
print(df.isnull().sum())

print("\n--- Duplicate Records ---")
print(df.duplicated().sum())

df.drop_duplicates(inplace=True)

if "Age" in df.columns:
    df["Age"] = df["Age"].fillna(df["Age"].median())

if "Fare" in df.columns:
    df["Fare"] = df["Fare"].fillna(df["Fare"].median())

if "Embarked" in df.columns:
    df["Embarked"] = df["Embarked"].fillna(df["Embarked"].mode()[0])

if "Cabin" in df.columns:
    df.drop("Cabin", axis=1, inplace=True)

encoder = LabelEncoder()

if "Sex" in df.columns:
    df["Sex"] = encoder.fit_transform(df["Sex"])

if "Embarked" in df.columns:
    df["Embarked"] = encoder.fit_transform(df["Embarked"])

cleaned_file = "cleaned_titanic.csv"
df.to_csv(cleaned_file, index=False)

print("\nCleaned Dataset Saved Successfully!")

scaled_df = df.copy()

scale_cols = ["Age", "Fare", "SibSp", "Parch"]

available_cols = [
    col for col in scale_cols
    if col in scaled_df.columns
]

scaler = StandardScaler()

scaled_df[available_cols] = scaler.fit_transform(
    scaled_df[available_cols]
)

scaled_file = "scaled_titanic.csv"
scaled_df.to_csv(scaled_file, index=False)

print("\nScaled Dataset Saved Successfully!")

print("\n--- Cleaned Dataset ---")
print(df.head())

print("\n--- Scaled Dataset ---")
print(scaled_df.head())

files.download(cleaned_file)
files.download(scaled_file)

print("\nPreprocessing Completed Successfully!")
← Back to timeline