dinov2-small-visible-flame-monopoint-v2.5
Modèle public pour ai model, documenté sur le Hub.
Ouvrir la source publiqueModèle public pour ai model, documenté sur le Hub.
- Téléchargements
- 4
- Mis à jour
- 07 oct. 26
- Framework
- pytorch
- Source
- Hugging Face
- Status
- Source connectée
Documentation et périmètre
Contenu structuré depuis la documentation publique de la source.
English — purpose and architecture
Predict one flamebaseanchor per visible-flame crop. Multiple full-image points arise by applying this model independently to detected flame boxes and reprojecting them; there is no learned fire-group association. Input is a tight flame-box RGB crop, bilinearly resized to 448×448 and ImageNet-normalized. DINOv2-S/14 supplies 384-dimensional spatial tokens on a 32×32 grid. A small Conv/GroupNorm/GELU decoder with two ×2 upsampling stages yields a 128×128 heatmap. Extraction uses its peak and local 5×5 softmax refinement. No calibrated point-confidence probability is produced.
Training targets are SAM/color/intensity pseudo-points, not independently annotated human flame bases. The principal linked dataset is v2.5-visible-flame-crop-monopoint (30,460 train / 1,812 validation public crops); v2.5-visible-flame-full-image-multipoint carries the same points on original images with missing point targets explicitly ignored. Actual training used 50,562 train / 2,732 validation accepted crops from the retained full corpus. Public data are a rights-filtered subset.
Français — rôle et architecture
Prédire une ancre de base visuelle par crop flamme. Le multipoint sur image entière résulte d'un appel indépendant par boîte puis d'une reprojection ; aucun regroupement de foyers n'est appris. Entrée RGB serrée, resize bilinéaire 448×448 et normalisation ImageNet. Les tokens spatiaux DINOv2-S/14 alimentent un petit décodeur à heatmap 128×128. Le point vient du maximum avec raffinement local 5×5. Il n'a pas de score de confiance calibré. Le corpus public est une sous-partie des 50 562 crops train et 2 732 crops validation effectivement utilisés.
Training and selection / Apprentissage et sélection
Run 20261005-183446-flame-crop-dinov2s: 10 completed epochs, early stop after plateau, selected E6 by lowest validation mean normalized point error. Planned maximum 12, minimum 6, patience 4. Batch 128, BF16, seed 42; first two epochs decoder/head only, then last four DINO blocks and final LayerNorm unfrozen. Head LR 3e-4, backbone LR 2e-5, AdamW weight decay 0.01, warmup fraction 0.08, LR floor 0.1, horizontal flips. Loss: spatial cross-entropy against a normalized Gaussian heatmap (sigma 6 input pixels) plus 2× SmoothL1 coordinate loss.
Le run termine à 10 époques après plateau, avec sélection E6 sur l'erreur normalisée moyenne de validation. Deux époques tête seule, puis quatre derniers blocs et LayerNorm ; batch 128, BF16, seed 42. Les LR sont 3e-4 et 2e-5. La loss associe une cible gaussienne (sigma 6 px entrée), une cross-entropy spatiale et 2× la loss de coordonnées SmoothL1.
Validation: pseudo-label agreement / Validation : accord aux pseudo-labels
NME = Euclidean point distance divided by original crop diagonal, evaluated on 2,732 retained validation crops. PCK@r = fraction with NME ≤r. These are selected-validation agreement measures against the generator, not independent human localization accuracy. Tiny here is crop area <32² px, a different definition from detector tiny. No full cascade point-accuracy audit or independent TEST score is claimed.
NME est la distance au pseudo-point divisée par la diagonale du crop d'origine. PCK est la fraction sous le seuil. Ces chiffres mesurent l'accord avec le générateur, pas une précision humaine indépendante. Le tiny de cette tâche est l'aire du crop <32² pixels. Le pipeline complet n'a pas encore de benchmark indépendant des points.
The error tail is substantial. Training uses GT box crops while deployment receives predicted boxes, so crop distribution shift must be audited. The learned point is not snapped to a SAM/color mask at inference; recipe guarantees on pseudo-targets do not guarantee every learned prediction satisfies them.
Annotation method / Méthode d'annotation
EN. Points are deterministic pseudo-labels called flamebaseanchor. SAM 2.1 Hiera Large is prompted inside each tight original flame-box crop, never on the complete image. Integer crops use floor for the top-left and ceil for the bottom-right, clamped to image dimensions, without context. The highest SAM predicted-IoU candidate mask is used; that score is uncalibrated. The initial target is the mask-bounding-box horizontal centre and y = mask centre + 0.35 × mask height, i.e. 85% from its top. The point is moved to an allowed flame-colour region near that target: HSV red/orange/yellow (hue 0–65 or 350–360, saturation ≥0.35, value ≥0.35), or luminous white (saturation ≤0.22, value ≥0.82). Local golden-yellow pixels (35–65°, saturation ≥0.35, value ≥0.65) are preferred.…
FR. Les points sont des pseudo-annotations déterministes flamebaseanchor. SAM 2.1 fonctionne uniquement dans le crop serré de chaque boîte flamme : aucun contexte ajouté, coordonnées arrondies vers l'extérieur et limitées à l'image. Le masque au meilleur IoU prédit est retenu, sans interpréter ce score comme une confiance calibrée. La cible initiale est au centre horizontal du masque et à 85% de sa hauteur depuis le sommet. Elle est rapprochée des pixels rouge/orange/jaune/blanc lumineux admissibles, avec préférence pour le jaune doré local et les pixels intenses. La composante connexe ayant la masse d'intensité dominante fournit un centroïde, ensuite projeté dans son cœur robuste. Sans masque ou couleur admissible, la génération s'abstient.
This is an appearance-based anchor convention, not an ignition point, geographic fire origin, physical temperature measurement, or one point per incident. The accepted pilot contained 50 boxes from 28 images, with 48 resolved points; the user accepted the green crosses. That acceptance does not validate every corpus annotation. Every public row remains humanreviewed=False and pointlabelsarepseudo=True.
Reproducible loading / Chargement reproductible
The release contains tensor-only model.safetensors, a plain config.json, an explicit inference.py and checksum provenance. Download a revision-pinned snapshot, install the repository's requirements, and load it explicitly. No Hugging Face trustremotecode is required. The optional smoke backbone fetches a pinned official Facebook Research Torch Hub source; inspect and cache that source for an offline deployment. RF-DETR 1.11 requires a native wrapper; the helper creates it locally from safe tensors and JSON, never from an external pickle.
La publication contient les tenseurs seuls, la configuration JSON, un chargeur explicite et les empreintes de provenance. Téléchargez une révision figée, installez les dépendances et chargez le module explicitement. Le backbone smoke utilise le code officiel Facebook Research figé à une révision ; conservez-le en cache pour un déploiement hors ligne. Le wrapper natif RF-DETR est construit localement à partir des tenseurs sûrs et du JSON.
Set REPOSITORY to this repository ID and REVISION to a full commit SHA from its Files tab. The complete inference CLI and geometry are documented in PIPELINEEN.md and PIPELINEFR.md. This is an explicit PyTorch research interface, not a Transformers AutoModel export.
Une fiche traçable jusqu’à sa source
Les informations éditoriales, les métadonnées et la documentation restent reliées au dépôt public d’origine.
- Identifiant public
- fireviewer/dinov2-small-visible-flame-monopoint-v2.5
- Dernière activité
- 7 octobre 2026