Lumaktaw sa nilalaman
AutoValue
Setyembre 6, 2026 · Property Data

Ang Linggo na Sumingit ang Real Estate sa Aming Used-Car Dataset

AutoValue Editorial
Ang Linggo na Sumingit ang Real Estate sa Aming Used-Car Dataset

Karamihan ng oras ko ay ginugol sa used cars — 1.1 milyong listing, 73 rehiyon, ang karaniwang ikot ng pagbaba ng presyo at muling pag-list. Kaya nang magsimulang pumasok ang property data sa parehong mga dashboard na ginagamit ko para sa mga sasakyan, hindi ko inaasahang mahuhuli nito ang atensyon ko. Pero nangyari, at wala itong kinalaman sa orihinal na plano.

Narito ang log, halos ayon sa pagkakasunod-sunod ng aking napansin.

Unang araw: ang numerong hindi gumagalaw

Ang unang tinitingnan ko sa anumang bagong feed ay ang total, dahil mas kaunti ang kasinungalingan ng mga total kaysa sa kahit anong bagay sa negosyong ito. Nasa 601,702 listing ang property. Ayos lang. Pagkatapos, hinati ko ito ayon sa rehiyon at biglang hindi na ito parang isang global rollout kundi parang isang single-country project na may kasamang rounding error: si Japan lamang ang may 588,644 sa mga listing na iyon. Iyon ay 97.8% ng lahat ng nasa feed.

Bilang konteksto, sumasaklaw ang aming car data sa 73 rehiyon na walang iisang rehiyon na lumalampas sa 6% ng total (ang France, ang pinakamalaki namin, ay 67,569 sa 1.1 milyon — humigit-kumulang 6.1%). Ang property ay labing-anim na beses na mas concentrated kaysa doon. Nag-alangan ako kung ito ba ay isang bug sa region tagger bago ko naalala kung ano talaga ang nagtutulak nito: ang sariling real estate portals ng Japan ay naglilista ng napakaraming akiya, ang mga inabandunang o halos inabandunang rural na bahay na sinusubukan nang ibenta ng gobyerno sa loob ng maraming taon, kadalasan sa mga presyong nagpapamukha sa isang segundamanong Corolla na parang isang luxury purchase. Masinsinan, machine-readable, at napakalaki ang mga portal na ito. Hindi pa ganoon ang sa iba.

Ikalawang araw: paghahanap sa natitirang 2.2%

Gusto kong malaman kung ano ang itsura ng "lahat ng iba pa," kaya kinuha ko ang mga rehiyon maliban sa Japan at inihanay ang mga ito.

Bahagyang nangunguna ang Egypt kumpara sa Germany, na ikinagulat ko — akala ko malamang na mangibabaw ang isang malaki at maayos ang dokumentasyon na merkado tulad ng Germany sa isang random na sample bago pa man ang Cairo. Nananatili rin ang Sri Lanka sa apat na digit. Pagkatapos, may biglaang pagbaba: ang apat na bansa sa Central America — Guatemala, Nicaragua, Panama, at El Salvador — ay nasa 80, 80, 80, at 78.

Ikatlong araw: hindi kailanman pagkakataon lang ang tatlong magkaparehong numero

Ang biglaang pagbabang iyon ang talagang nagpahinto sa akin. Ang tatlong bansang nagkaroon ng eksaktong parehong bilang ay hindi isang senyales ng merkado, ito ay isang fingerprint. Kapag ang Guatemala, Nicaragua, at Panama ay nagpakita ng eksaktong 80 listing bawat isa, hindi ito tatlong ekonomiya na nagsanib sa parehong laki ng imbentaryo — iyon ay isang upstream source na may mahigpit na page cap na 80, na pareho ang pinapakain sa tatlong bansa. Ang 78 ng El Salvador ang nagpapatunay: sapat na katulad para sabihing pareho ang pinagmulan, ngunit sapat din ang pagkakaiba para patunayang hindi ito isang copy-paste error sa aming sariling pipeline. May isang regional real estate aggregator sa isang lugar na naglilimita ng mga libreng result page sa halos 80 listing bawat bansa, at hangga't hindi namin ito naliligtaan — direktang mag-source imbes na sa aggregator, o mag-paginate lampas sa anumang hadlang na ipinapataw nito — ang apat na bansang iyon ay babasahing pantay-pantay ang liit anuman ang aktwal na hitsura ng kanilang mga merkado.

Ito ang hindi kaaya-ayang bahagi ng matapat na pagbuo ng anumang bagong dataset: ang unang mga numerong makukuha mo ay hindi ang merkado, ito ang hugis ng iyong kasalukuyang mga source. Mas gugustuhin kong malaman ito sa unang linggo kaysa maglathala ng isang post na "pinakamaliit na real estate market sa Central America" na nakabatay lamang sa page limit ng isang scraper.

Ikaapat na araw: ang talagang nagulat sa akin

Hindi ang concentration sa Japan — medyo inaasahan ko na iyon, dahil karamihan sa aming sariling property signal ay galing na rin sa mga Japanese source sa car side ng negosyo. Ang nagulat sa akin ay kung gaano kadaling maunawaan ang problema sa kalidad ng data nang walang espesyal na tooling. Hindi mo kailangan ng background sa statistics para mapansin ang tatlong 80 nang sunud-sunod. Kailangan mo lang tingnan ang mga numero ayon sa pagkakasunod-sunod, na siyang karamihan sa aktwal na trabahong ito.

Napabalik din nito ang pansin ko sa isang bagay tungkol sa aming car data na hindi ko na napapansin dahil sanay na ako rito: 73 rehiyon na may tunay na pagkakalat, walang rehiyong lumalampas sa 6.1%, 1,375 independiyenteng source na nagpapakain dito — ang distribusyong iyon ay hindi ang natural na kalagayan ng isang scraped dataset, ito ay walong taon ng sinasadyang pag-iwas sa eksaktong uri ng aggregator wall na kagagawa lamang lumitaw sa ikatlong araw ng property feed. Bawat isa sa 73 rehiyong iyon ay nagsimulang mukhang katulad ng Guatemala.

Nasaan ito ngayon

Hindi pa produkto ang property — isang signal ito na binabantayan namin habang tumatakbo ang car side, isang linya sa mas mahabang roadmap patungo sa mas malawak na coverage ng real estate. Ngunit ang isang linggo ng pagbabantay dito habang napupuno ito ay isang magandang paalala kung ano talaga ang pagkakasunod-sunod ng mga operasyon: gawing live ang feed, maging mapaghinala sa mga bilog na numero, hanapin ang hadlang, tapos gumawa ng paraan para malampasan ito. Titigil si Japan sa pagiging 97.8% ng feed na ito sa parehong paraang naging France, hindi ang UAE o Japan, ang nangunguna sa aming car counts — sa pamamagitan ng pagdaragdag ng mga source hanggang sa walang iisa ang maaaring mangibabaw sa total nang aksidente.

Property DataJapanMarket DataData QualityExpansion
Ibahagi

Mga kaugnay na artikulo