Metodolohiya
Idinodokumento ng pahinang ito kung paano ginagawang maaasahang pagtataya ng NoCall ang libu-libong ulat ng user para sa bawat numero ng telepono. Ipinapaliwanag namin ang eksaktong formula ng risk-score, ang mga danger level, kung paano namin inuuri ang mga kategorya, kung paano gumagana ang aming artificial-intelligence analysis at kung saan nanggagaling ang datos. Inilalathala namin ang metodolohiyang ito upang maunawaan —at maitanong— ng kahit sino ang mga desisyong ginagawa ng sistema.
Paano kinakalkula ang risk score
Ang bawat numero sa aming database ay binibigyan ng risk score sa pagitan ng 0 at 100. Hindi ito subjective na paghatol: nagmumula ito sa isang deterministic na formula na muling kinakalkula tuwing may bagong aprubadong ulat na dumarating.
risk = min(100, reports × 5 + (verified ? 30 : 0))
Ang bawat aprubadong ulat ay nagdaragdag ng 5 puntos. Kung na-verify ng aming team ang numero bilang kumpirmadong spam, may karagdagang 30 puntos na idinadagdag. Hindi kailanman lalampas sa 100 ang resulta.
Ang verification factor ay umiiral upang ihiwalay ang isang numerong may maraming kamakailang ulat (na maaaring isang beses lang na false positive) mula sa isang numerong aktibong kinumpirma ng human reviewer bilang abusive. Kaya naman ang 20 unverified na ulat (100 puntos mula sa mga ulat, naka-cap) at 14 verified na ulat (70 + 30) ay maaaring umabot sa magkatulad na score sa magkaibang paraan.
Kapag nasuri na ng aming AI ang isang numero at may mga aprubadong community signal, ang natukoy na danger level ay kumikilos din bilang floor para sa score: ang numerong na-flag bilang critical ay hindi kailanman babagsak sa ibaba ng 90, ang high ay sa ibaba ng 70, medium sa ibaba ng 45, at low sa ibaba ng 20, kahit kaunti pa ang mga ulat. Sa ganitong paraan, ang isang malinaw na fraudulent na pattern ay hindi mababawasan ang halaga kahit bago pa lang ito.
Mga danger level
Mula sa numeric score, inuuri namin ang bawat numero sa isa sa apat na danger level. Ito ang mga parehong identifier na ginagamit ng aming database sa loob nito:
Low (bajo)0–39
Few reports or none. The number shows no clear signs of spam activity. It may be a legitimate line or an isolated, unconfirmed report.
Medium (medio)40–59
Several reports received. Caution is advised before answering or calling back. The default value when the signal is ambiguous.
High (alto)60–79
Numerous confirmed reports. High likelihood of aggressive telemarketing or repeated unwanted calls.
Critical (critico)80–100
Number verified as spam or a scam, or identified by the AI as fraud or impersonation. We recommend blocking it immediately.
Mga kategorya ng spam
Ang bawat ulat at bawat numero ay inuuri sa isa sa pitong kategorya. Ang kategorya ang nagtatakda kung paano ipinapakita ang numero sa directory at hinango mula sa ulat ng user at sa kalaunang automated na pagsusuri:
- SPAM — Generic, unwanted commercial calls that do not fit a more specific category.
- TELEMARKETING — Telephone sales campaigns, usually telecoms or energy, that persist despite rejection.
- SCAM — Scams and fraud, including identity impersonation (banks, public bodies, fake tech support). The most serious category.
- DEBT — Debt-collection and recovery calls, often aggressive or aimed at the wrong person.
- HARASSMENT — Repeated calls intended to harass, intimidate or deliberately disturb.
- SURVEY — Unsolicited phone surveys, polls and market research.
- OTHER — Any other type of unwanted call that does not fit the above.
Pagsusuring artificial-intelligence
Bukod sa numeric score, sinusuri ng isang AI worker ang mga numero batay sa community-approved na content: ang mga komento at ulat na nakapasa sa moderation. Hindi kailanman gumagamit ang AI ng unapproved na content, kaya walang unreviewed na kontribusyon ang makakaapekto sa pampublikong pagsusuri.
Para sa bawat nasuring numero, bumubuo ang AI ng isang structured na set ng impormasyon na ipinapakita sa pahina ng numero:
Ang mga field na binubuo ng pagsusuri ay ang mga sumusunod:
- Description — A natural-language summary of who seems to be behind the number and what they want.
- Complaint patterns — The most repeated complaint reasons across reports (for example, calls at unsociable hours or persistence after refusal).
- Tactics used — The specific techniques detected, such as pressure, false urgency or requests for personal data.
- Sector — The field the activity belongs to (telecoms, energy, debt collection, surveys, etc.).
- Detected company — The company or organisation the number appears to represent or impersonate, when it can be identified.
- Impersonation — An indicator of whether the number pretends to be a legitimate entity (bank, public administration, known brand).
- Recommended action — The final recommendation for the user: block, caution, ignore or safe.
Ang pagsusuring ito ay indicative at awtomatikong nabubuo mula sa mga kontribusyon ng komunidad; hindi ito kapalit ng sariling paghatol ng user ni bumubuo ng akusasyon laban sa anumang partikular na kumpanya.
Moderation: walang inilalathala nang hindi nasusuri
Ang quality control ang sentro ng metodolohiya. Ang mga ulat at komento ay hindi lumalabas sa pampublikong directory sa mismong sandaling isumite ang mga ito: mananatili silang pending hanggang aprubahan ng isang administrator. Doon lang sila ibinibilang sa risk score, pinapakain ang AI analysis, at nagiging visible sa ibang user.
Ang moderation gate na ito ay may dalawang layunin: itinatapon nito ang mga huwad o maliciously na ulat bago pa man makaapekto sa reputasyon ng isang numero, at tinitiyak nito na ang AI ay nangangatuwiran lamang batay sa nasuring impormasyon. Ang may-akda ng isang pending na ulat ay makikita ang kanyang sariling kontribusyon, ngunit walang iba, hanggang aprubahan ito.
Mga pinagmulan ng datos
Pinagsasama ng pagtataya ng bawat numero ang tatlong independent na pinagmulan:
- Community reports — The foundation of everything. Users report numbers from the app and the web, anonymously, with a category and a comment. After moderation, they are the main signal for the score.
- CNMC operator and prefix data — We use public data from the National Commission for Markets and Competition (CNMC) to identify the operator assigned to each numbering block and the line type (mobile, landline, premium rate).
- Company press releases (RSS) — We follow companies' newsrooms via RSS feeds to detect legitimate campaigns and reduce false positives when a real company is running mass communications.