08-04-2026, 01:57 PM
Hvala, ovo je zlata vredno.
Grep pristup sa --line-buffered je pametan za initialni prefilter. Ja sam krenuo sličnom logikom ali sam na kraju napravio dedicated detector koji radi boundary matching po tokenima - upravo zbog problema koje si pomenuo:
- banca.intesa-rs.com - cross-label brand split, sad ga prepoznajem
- imefirme-rs.nekiTLD - imam to kao regional_impersonation_marker, dodaje bodove samo kad postoji potvrđen brand match
- imefirme-srb.nekiTLD - isto, pokrivam rs/srb/srbija/serbia/govrs/gov-rs
Tvoj regex mi je dao ideju za par stvari koje nisam pokrivao - eprekrsaj, iddeea, muphr, govhr. Vidim da pratiš i širi region (HR). To je logično jer napadači ciljaju ceo Balkan istom kampanjom.
Pitanje: koliko ti fajl dnevno naraste sa ovim filterom? I da li radiš neku dalju klasifikaciju posle grep-a ili ručno pregledaš?
Grep pristup sa --line-buffered je pametan za initialni prefilter. Ja sam krenuo sličnom logikom ali sam na kraju napravio dedicated detector koji radi boundary matching po tokenima - upravo zbog problema koje si pomenuo:
- banca.intesa-rs.com - cross-label brand split, sad ga prepoznajem
- imefirme-rs.nekiTLD - imam to kao regional_impersonation_marker, dodaje bodove samo kad postoji potvrđen brand match
- imefirme-srb.nekiTLD - isto, pokrivam rs/srb/srbija/serbia/govrs/gov-rs
Tvoj regex mi je dao ideju za par stvari koje nisam pokrivao - eprekrsaj, iddeea, muphr, govhr. Vidim da pratiš i širi region (HR). To je logično jer napadači ciljaju ceo Balkan istom kampanjom.
Pitanje: koliko ti fajl dnevno naraste sa ovim filterom? I da li radiš neku dalju klasifikaciju posle grep-a ili ručno pregledaš?

