import pandas as pd
import numpy as np
from sklearn.feature_extraction.text import CountVectorizer
from sklearn.model_selection import train_test_split
from sklearn.ensemble import RandomForestClassifier
from sklearn.metrics import accuracy_score,classification_report
data = {
    'tweet': [
        "The number of COVID cases is increasing rapidly",
        "Vaccination efforts are improving",
        "Outbreak in my area, many people are sick",
        "The pandemic seems to be under control now",
        "New virus variant detected, spreading fast",
        "People are getting vaccinated quickly",
        "Hospitals are overwhelmed again with new cases",
        "No more lockdown, the situation is improving",
        "More people are testing positive for the virus",
        "Cases are dropping, pandemic is slowing down"
    ],
    'outbreak': [1, 0, 1, 0, 1, 0, 1, 0, 1, 0]
}
df=pd.DataFrame(data)
vectorizer=CountVectorizer()
X=vectorizer.fit_transform(df['tweet'])
y=df['outbreak']
X_train,X_test,y_train,y_test=train_test_split(X,y,test_size=0.2,random_state=42)
classifier=RandomForestClassifier(n_estimators=100,random_state=42)
classifier.fit(X_train,y_train)
y_pred=classifier.predict(X_test)
print(accuracy_score(y_test,y_pred))
print(classification_report(y_test,y_pred))
