Πτυχιακή Εργασία · Computer Vision

AI Fruit Recognizer

Αυτόματη Αναγνώριση, Ταξινόμηση & Ανάλυση Φρούτων με Χρήση Τεχνητής Νοημοσύνης

Πηγή Εικόνας

Κάντε κλικ ή σύρετε μια φωτογραφία φρούτου εδώ

Preview
Αποτέλεσμα Πρόβλεψης

Ανεβάστε μια εικόνα ή ενεργοποιήστε την κάμερα για να δείτε τα αποτελέσματα του AI.

-
Κύρια Αναγνώριση
-
-
Top-3 Πιθανότητες
Ιστορικό Αναλύσεων
ID Όνομα Αρχείου Αναγνώριση Βεβαιότητα Ημερομηνία/Ώρα
Φόρτωση ιστορικού...
Επιβεβαίωση Διαγραφής

Μεθοδολογία & Περιορισμοί

Αρχιτεκτονική Μοντέλου

Το μοντέλο βασίζεται στο MobileNetV2, προεκπαιδευμένο σε ImageNet. Τα τελευταία blocks του backbone ξεπαγώθηκαν και εκπαιδεύτηκαν εκ νέου (fine-tuning), μαζί με έναν custom classifier (πλήρως συνδεδεμένο layer με Dropout) στο τέλος, ειδικά προσαρμοσμένο για ταξινόμηση φρούτων/λαχανικών.

Dataset

Βάση αποτελεί dataset τύπου Fruits-360 (εικόνες με καθαρό, ελεγχόμενο φόντο και σταθερό φωτισμό), εμπλουτισμένο με πραγματικές φωτογραφίες από το διαδίκτυο σε όλες τις 45 κλάσεις, ώστε να υπάρχει μεγαλύτερη ποικιλία σε φόντο/φωτισμό/γωνία λήψης.

Απόδοση

Στο test set (45 κλάσεις, ~9.300 εικόνες), το μοντέλο πετυχαίνει 98,6% ακρίβεια.

Bias Φόντου & Πώς Αντιμετωπίστηκε

Ανάλυση με Grad-CAM στα πρώιμα στάδια εκπαίδευσης αποκάλυψε ότι το μοντέλο «κολλούσε» σε χαρακτηριστικά του φόντου (το σχεδόν ομοιόμορφο, ανοιχτόχρωμο φόντο του Fruits-360) αντί να μαθαίνει τα οπτικά χαρακτηριστικά του ίδιου του φρούτου (σχήμα, υφή, χρώμα). Αντιμετωπίστηκε με δύο συμπληρωματικούς τρόπους: τυχαία αντικατάσταση φόντου (background randomization) κατά την εκπαίδευση, και εμπλουτισμό του dataset με τις πραγματικές φωτογραφίες που αναφέρθηκαν παραπάνω.

Γνωστοί Περιορισμοί

  • Παρά τον εμπλουτισμό με πραγματικές φωτογραφίες, ο πυρήνας του dataset παραμένει καθαρού/ελεγχόμενου φόντου — η ακρίβεια σε εντελώς τυχαίες φωτογραφίες (κινητό, φυσικό περιβάλλον, μεικτός φωτισμός) μπορεί να διαφέρει από αυτή στο test set.
  • Οπτικά όμοια φρούτα/λαχανικά συγχέονται πιο συχνά μεταξύ τους (π.χ. Ροδάκινο/Νεκταρίνι, Πιπεριά Κόκκινη/Ντομάτα).
  • Το Grad-CAM δείχνει πού «κοιτάει» το μοντέλο, όχι αν η πρόβλεψη είναι σωστή — χρησιμοποιείται για ερμηνευσιμότητα (interpretability), όχι για επαλήθευση ακρίβειας.
Grad-CAM