2026-saleem-open-world-darknet-traffic
Open-World Darknet Traffic Recognition Under Leave-One-Service-Out Evaluation
canonical link → · arxiv: 2608.04167
2026-saleem-open-world-darknet-traffic
canonical link → · arxiv: 2608.04167
findings extracted from this paper
Closed-world evaluation substantially overestimates deployment robustness for darknet traffic classifiers. XGBoost Macro-F1 drops from 88.8% to 46.1% in I2P and Random Forest from 87.4% to 45.7% when unknown services are introduced at inference time under leave-one-service-out evaluation. FreeNet shows the highest closed-world inflation, with RF reaching 96.0% closed-world vs. 61.9% under open-world forced classification.
Uncertainty-based rejection (confidence thresholding) provides negligible improvement against behaviorally overlapping unknown services. In I2P, XGBoost rejection recovery is +0.0% Macro-F1; FreeNet known-service mean confidence is 97.75% vs. unknown-service 97.95%, making threshold-based separation impossible. Only Tor exhibits partial confidence separation (known 81.22% vs. unknown 67.66%), enabling XGB recovery of +8.5%.
Macro-F1 degrades more severely than Accuracy under open-world evaluation, revealing that classification failures disproportionately concentrate on behaviorally overlapping minority service classes. High Accuracy values in FreeNet (unknown services absorbed at 97.95% confidence) do not indicate successful detection of unseen services. Conventional single-metric reporting thus conceals the most operationally relevant failure modes.
Unknown darknet service traffic is not randomly misclassified but is absorbed into semantically related known services with high confidence. FreeNet video traffic is classified as browsing with an 88.1% assignment rate at 97.95% mean confidence; I2P P2P traffic is absorbed into FTP-related behavior with an 83.4% assignment rate at 92.93% mean confidence. Behavioral similarity, not classifier uncertainty, drives open-world failure.