Plant Pathology Deep Learning Multi-Criteria Benchmark
A multi-dimensional empirical evaluation comparing 11 deep learning architectures across diagnostic reliability (MCC, Specificity, Precision, Sensitivity, F1), edge deployability (Latency, FLOPs, Size), uncertainty calibration (ECE), and compute sustainability.
Peak Diagnostic Accuracy
99.95%
ResNet-50
MCC: 0.9995 โข Spec: 99.99%
Best Edge Deployment Champion
99.85%
MobileNetV3-Small
2.9ms Latency โข 1.5M Params
Top Holistic Composite Score
96.4 / 100
GhostNet (1.0x)
99.81% Acc โข 14.3ms โข ECE 0.0014
Max Compute Saved on ES
70.0%
EdgeNeXt / GhostNet
No Significant Acc Loss (p>0.05)
Master Empirical Benchmark: Diagnostic Reliability View
Click column headers to sort dynamically. Switch views above to explore hardware latency, training sustainability, or composite rankings.
Multi-Dimensional Trade-off Frontiers & Holistic Radar Analysis
Interactive Plotly scatter plots and radar analysis proving why multidimensional evaluation beyond mere accuracy is crucial for edge deployment.
Diagnostic Reliability (MCC) vs. Edge Latency (ms)
Pareto frontier highlighting real-time IoT deployment capability (Batch Size = 1)
Top-1 Accuracy vs. Total Parameters (M) [Log Scale]
Memory footprint vs diagnostic precision on PlantVillage test dataset
Uncertainty Calibration: ECE vs. Top-1 Accuracy
Reliability metric quantifying model trust (lower ECE = higher confidence trust)
Early Stopping: Compute Time Saved (%) vs. Accuracy Delta
Quantifying sustainability gains and validation convergence speed
Interactive Multi-Model ROC & Precision-Recall Trajectories
Interactive Receiver Operating Characteristic (ROC) and Precision-Recall (PR) curves across all 11 architectures. Hover over any curve to inspect exact TPR/FPR coordinates or click legend items to isolate individual models.
Interactive Unified Multi-Model ROC Curves (Macro-Average OvR)
True Positive Rate (Sensitivity) vs. False Positive Rate (1 - Specificity) across decision thresholds
Interactive Precision-Recall (PR) Curves
Precision vs. Recall curves displaying Mean Average Precision (mAP) trajectories
Granular 15-Class Plant Disease Diagnostic Deep Dive
Select any specific disease to inspect model-by-model Precision, Sensitivity, Specificity, and F1 performance.
Disease Diagnostic Breakdown: Tomato (Late Blight)
Per-class diagnostic performance across all 11 architectures
Select Disease Class:
Statistical Significance & Rigorous Hypothesis Testing
Pairwise McNemar's tests, 95% Confidence Intervals (Wilson Score), and Wilcoxon Signed-Rank tests establishing scientific validation.
Early Stopping vs. Full Budget: McNemar's Test
Proving that 8 of 11 architectures experience no statistically significant loss (p > 0.05)
| Model | ES Acc | Full Acc | $\Delta$ Acc | p-value | Significance |
|---|
95% Confidence Intervals for Top Models (Wilson Score)
Confidence error bounds on 2,065 test set samples
Publication-Grade Standalone Figures (300 DPI)
Click any figure thumbnail to view full-screen high-resolution vector quality.
Figure 1: Unified Multi-Model ROC Curves
Figure 2: Unified Precision-Recall (PR) Curves
Figure 3: Reliability Diagrams & ECE Calibration
Figure 4: Comparative Learning Dynamics
Figure 5: Granular 15-Class F1-Score Heatmap
Figure 6: Top 4 Models Normalized Confusion Grid