By: 24-7 Press Release
September 23, 2026
Diffusion-Mamba-Hybrid Setzt Neuen Standard Für Infrarot-Zielerkennung
KNOXVILLE, TN, 23. September 2026 /24-7PressRelease/ -- Die Infrarot-Kleinzielerkennung ist entscheidend für Fernerkundung, Brandverhütung und Überwachung, doch bestehende Methoden haben Schwierigkeiten mit winzigen, kontrastarmen Zielen, denen es an deutlicher Form oder Textur mangelt. Forscher haben ein zweistufiges Deep-Learning-Netzwerk entwickelt, das diffusionsbasierte Merkmalsverbesserung mit Zustandsraummodellierung (SSM) kombiniert, um Hintergrundstörungen zu unterdrücken und gleichzeitig Zielsignale zu verstärken. Der Ansatz erreicht modernste Erkennungsraten auf drei öffentlichen Datensätzen und reduziert sowohl verpasste Erkennungen als auch Fehlalarme in komplexen Bildgebungsumgebungen erheblich.
Die Infrarot-Kleinzielerkennung ermöglicht die binäre Segmentierung schwacher Ziele in komplexen Hintergründen und dient Anwendungen von der Waldbrandfrühwarnung bis zur Bedrohungsbewertung in der Fernerkundung. Es bestehen jedoch praktische Herausforderungen: Infrarotziele nehmen oft weniger als 81 Pixel ein (typischerweise unter 9×9), weisen eine extrem niedrige Energie mit Signal-Rausch-Verhältnissen um 3 auf und entbehren auffälliger Form- oder Texturinformationen. Diese Eigenschaften führen dazu, dass Ziele leicht im Hintergrundrauschen untergehen, was die Merkmalsextraktion besonders schwierig macht. Deep-Learning-Methoden haben die Leistung verbessert, konzentrieren sich jedoch meist ausschließlich auf Zielmerkmale und vernachlässigen Hintergrundinformationen – den Großteil des Bildes – was zu einer starken Klassenungleichheit zwischen positiven und negativen Proben führt. Aufgrund dieser Herausforderungen besteht ein dringender Bedarf an einem Ansatz, der sowohl Ziele als auch Hintergründe gleichzeitig modelliert, um eine robuste Erkennung in komplexen Szenen zu erreichen.
Am 30. Juni 2026 veröffentlichten Forscher des Forschungszentrums für Raumfahrtoptik am Harbin Institute of Technology (DOI: 10.34133/remotesensing.1046) ihre Ergebnisse im Journal of Remote Sensing. Ihr vorgeschlagenes Diffusion-Enhanced Dense Mamba Network (DEDM-Net) adressiert eine kritische Herausforderung in der Fernerkundung: die Erkennung von Infrarot-Kleinzielen, die leicht von Hintergrundstörungen überwältigt werden. Diese Technologie wirkt sich direkt auf Waldbrandverhütung, Überwachungsfrühwarnsysteme und militärische Bedrohungsbewertung aus – Anwendungen, bei denen verpasste Erkennungen oder Fehlalarme schwerwiegende Folgen haben können.
Das Team entwickelte ein zweistufiges Netzwerk, das einen synergistischen Effekt erzielt, der größer ist als die Summe seiner Teile. Die erste Stufe verwendet ein Dual-Path-Diffusionsmodell mit einem neuartigen Blindverarbeitungsmodul, das jedes Pixel nur anhand umgebender Informationen vorhersagt – niemals das Pixel selbst – und so verhindert, dass extrem kleine Ziele als Hintergrund fehlklassifiziert werden. Die zweite Stufe führt eine dichte verschachtelte Mamba-Architektur ein, die auf dem Zustandsraummodell (SSM) basiert und langreichweitige Korrelationen über globale und lokale Merkmale mit linearer Rechenkomplexität erfasst – ein signifikanter Vorteil gegenüber herkömmlichen Transformern. Ein stufenübergreifendes Vorhersagefusionsmodul integriert ferner Merkmale aus beiden Stufen und verbessert die Genauigkeit der Kontursegmentierung. Zusammen liefern diese Innovationen eine überlegene Leistung bei allen Bewertungsmetriken im Vergleich zu 11 modernsten Methoden.
Das DEDM-Net wurde auf drei öffentlichen Datensätzen evaluiert: NUAA-SIRST (427 Bilder), NUDT-SIRST (1.327 Bilder bei 256×256) und IRSTD-1k (1.000 Bilder bei 512×512). Auf dem NUDT-SIRST-Datensatz erreichte die Methode 93,40 % IoU, 93,28 % nIoU, 98,37 % Erkennungswahrscheinlichkeit (P_d) und eine bemerkenswert niedrige Fehlalarmrate von nur 3,75×10⁻⁶ – und übertraf damit DNA-Net (92,99 % IoU, 93,22 % nIoU) und ISTDU-Net (91,69 % IoU, 91,84 % nIoU). Auf dem IRSTD-1k-Datensatz erreichte DEDM-Net 73,71 % IoU und 93,89 % P_d bei nur 11,10×10⁻⁶ Fehlalarmen und übertraf alle Konkurrenten. Das Blindverarbeitungsmodul verwendet eine Dual-Fenster-Struktur mit äußerem Radius R=4 und innerem Radius r=2, wodurch sichergestellt wird, dass Zielregionen „blind verarbeitet“ werden, während umgebender Kontext erfasst wird. Ablationsstudien bestätigten, dass jede Komponente – der Generierungspfad, der Wiederherstellungspfad, die dichte verschachtelte Struktur und die residualen Mamba-Blöcke – sinnvoll zur Gesamtleistung beiträgt. Das Netzwerk wurde auf einer NVIDIA RTX 4080 GPU mit dem Adam-Optimierer trainiert.
„Infrarot-Kleinziele sind extrem herausfordernd, weil ihnen Form und Textur fehlen – sie sind im Wesentlichen nur ein paar helle Pixel in einem Meer von Hintergrund“, sagte der korrespondierende Autor Dr. Shikai Jiang vom Harbin Institute of Technology. „Durch die gleichzeitige Modellierung sowohl des zielfreien Hintergrunds als auch potenzieller Zielregionen verstärkt unser diffusionsgestützter Ansatz effektiv, was wichtig ist, und unterdrückt, was nicht wichtig ist. Die Mamba-Architektur liefert dann den globalen Kontext, der benötigt wird, um echte Ziele von hellem Störrauschen zu unterscheiden.“
Die Methode verwendet ein zweistufiges Trainingsframework. In der Diffusionsverbesserungsstufe schätzt ein U-Net-Backbone Rauschen über 1.000 Diffusionsschritte, wobei ein Dual-Path-Schema sowohl Zielmasken als auch Hintergrundbilder modelliert. Das Blindverarbeitungsmodul erzeugt pixelweise Faltungskerne, die das zentrale Pixel ausschließen und so kleine Ziele effektiv aus der Hintergrundrekonstruktion entfernen. In der Erkennungsstufe extrahiert ein dichtes verschachteltes Netzwerk mit Merkmalspyramidenverbindungen und residualen Mamba-Blöcken multiskalige Merkmale. Die Verlustfunktion kombiniert binäre Kreuzentropie (BCE) und Dice-Verluste, um Klassenungleichheit zu adressieren.
Während DEDM-Net eine überlegene Genauigkeit erreicht, erhöht das diffusionsbasierte zweistufige Design die Inferenzzeit im Vergleich zu einstufigen Netzwerken. Zukünftige Arbeiten werden sich auf Modelldestillation, Mixed-Precision-Inferenz und schnellere Sampler konzentrieren, um die erforderlichen Diffusionsschritte zu reduzieren. Der Ansatz ist vielversprechend für Echtzeit-Überwachungssysteme, autonome Drohnennavigation bei schlechten Sichtverhältnissen und Frühwarnnetzwerke für Waldbrände. Wie das Team anmerkte, könnte das Framework auch neues Denken darüber anregen, wie generative Modelle und Zustandsraumarchitekturen für andere anspruchsvolle Computer-Vision-Aufgaben kombiniert werden können, bei denen die Trennung von Ziel und Hintergrund kritisch ist.
Referenzen
DOI
10.34133/remotesensing.1046
URL der Originalquelle
https://spj.science.org/doi/10.34133/remotesensing.1046
Förderinformationen
Diese Arbeit wurde von der National Natural Science Foundation of China unter Grant 62305086, der China Postdoctoral Science Foundation unter Grant 2023M740901, der Natural Science Foundation of Heilongjiang Province of China unter Grant LH2024F032 und teilweise vom National Key Laboratory of Air-Based Information Perception and Fusion unter Grant 20220001077001 unterstützt.
Über Journal of Remote Sensing
Journal of Remote Sensing, eine ausschließlich online erscheinende Open-Access-Zeitschrift, die in Verbindung mit AIR-CAS veröffentlicht wird, fördert Theorie, Wissenschaft und Technologie der Fernerkundung sowie interdisziplinäre Forschung innerhalb der Erd- und Informationswissenschaften.
Chuanlink Innovations, wo revolutionäre Ideen ihr wahres Potenzial entfalten. Unser Name, verwurzelt im Wesen von Übertragung und Verbindung, spiegelt unser Engagement wider, Innovation zu fördern und den Weg von Ideen von der Entstehung bis zur Verwirklichung zu erleichtern.
Verwandter Link:
http://chuanlink-innovations.com
Haftungsausschluss: Diese Übersetzung wurde automatisch von NewsRamp™ für 24-7 Press Release (gemeinsam als "DIE UNTERNEHMEN" bezeichnet) mit öffentlich zugänglichen generativen KI-Plattformen erstellt. DIE UNTERNEHMEN garantieren nicht die Genauigkeit oder Vollständigkeit dieser Übersetzung und haften nicht für Fehler, Auslassungen oder Ungenauigkeiten. Die Nutzung dieser Übersetzung erfolgt auf eigenes Risiko. DIE UNTERNEHMEN haften nicht für Schäden oder Verluste, die aus solcher Nutzung entstehen. Die offizielle und maßgebliche Version dieser Pressemitteilung ist die englische Version.

