Peak Diagnostic Accuracy
99.95%
ResNet-50 MCC: 0.9995 โ€ข Spec: 99.99%
Best Edge Deployment Champion
99.85%
MobileNetV3-Small 2.9ms Latency โ€ข 1.5M Params
Top Holistic Composite Score
96.4 / 100
GhostNet (1.0x) 99.81% Acc โ€ข 14.3ms โ€ข ECE 0.0014
Max Compute Saved on ES
70.0%
EdgeNeXt / GhostNet No Significant Acc Loss (p>0.05)
Paradigm: Family:
Master Empirical Benchmark: Diagnostic Reliability View
Click column headers to sort dynamically. Switch views above to explore hardware latency, training sustainability, or composite rankings.
Multi-Dimensional Trade-off Frontiers & Holistic Radar Analysis
Interactive Plotly scatter plots and radar analysis proving why multidimensional evaluation beyond mere accuracy is crucial for edge deployment.
Diagnostic Reliability (MCC) vs. Edge Latency (ms)
Pareto frontier highlighting real-time IoT deployment capability (Batch Size = 1)
Top-1 Accuracy vs. Total Parameters (M) [Log Scale]
Memory footprint vs diagnostic precision on PlantVillage test dataset
Uncertainty Calibration: ECE vs. Top-1 Accuracy
Reliability metric quantifying model trust (lower ECE = higher confidence trust)
Early Stopping: Compute Time Saved (%) vs. Accuracy Delta
Quantifying sustainability gains and validation convergence speed
Interactive Multi-Model ROC & Precision-Recall Trajectories
Interactive Receiver Operating Characteristic (ROC) and Precision-Recall (PR) curves across all 11 architectures. Hover over any curve to inspect exact TPR/FPR coordinates or click legend items to isolate individual models.
Interactive Unified Multi-Model ROC Curves (Macro-Average OvR)
True Positive Rate (Sensitivity) vs. False Positive Rate (1 - Specificity) across decision thresholds
Interactive Precision-Recall (PR) Curves
Precision vs. Recall curves displaying Mean Average Precision (mAP) trajectories
Granular 15-Class Plant Disease Diagnostic Deep Dive
Select any specific disease to inspect model-by-model Precision, Sensitivity, Specificity, and F1 performance.
Disease Diagnostic Breakdown: Tomato (Late Blight)
Per-class diagnostic performance across all 11 architectures
Select Disease Class:
Statistical Significance & Rigorous Hypothesis Testing
Pairwise McNemar's tests, 95% Confidence Intervals (Wilson Score), and Wilcoxon Signed-Rank tests establishing scientific validation.
Early Stopping vs. Full Budget: McNemar's Test
Proving that 8 of 11 architectures experience no statistically significant loss (p > 0.05)
Model ES Acc Full Acc $\Delta$ Acc p-value Significance
95% Confidence Intervals for Top Models (Wilson Score)
Confidence error bounds on 2,065 test set samples