基于上海二手房房价的多因素模型分析参赛者曹晨舟陈旭欣张家浩崔畅

发布时间:2024-02-10 08:03:58      来源:网络整理   浏览次数:183

扫描到手机,新闻随时看
扫一扫,用手机看文章
更加方便分享给朋友

房地产模型多少钱一平_模型房地产价格怎么算_房地产价格的模型

“大数据时代”如何利用数据实现实际业务需求,已成为数学、统计学等科学领域的重点研究方向。 也是当代大学生学以致用的重要学习路径。

统计建模竞赛是上海财经大学面向本科生和研究生的统计应用活动。 目的是激发学生学习统计学和应用统计学,提高运用统计方法建立统计模型和利用计算机技术解决实际问题的能力,启发学生运用各种统计分析方法建立统计模型并探索处理过程。通过对批量数据的处理,揭示批量数据背后的信息,丰富学生的学习经验,真正学以致用。 为切实帮助提高大赛参赛作品质量,还将邀请校内知名教师、专家助阵。

基于上海二手房价的多因素模型分析

参赛者曹辰洲、陈旭新、张家豪、崔畅、沉晖

介绍

随着金融和土地政策的收紧,近年来上海商品房价格持续上涨,越来越多的中低收入人群将目光转向二手房市场。 上海二手房交易发展较为成熟,交易量与新建商品房持平,占据房地产市场半壁江山。 与此同时,市场正处于蓬勃发展之中。 上海主城区可供开发的土地越来越少。 主城区房屋销售将主要依靠二手房销售。 随着上海二手房市场的日益发展,二手房市场的买卖、抵押等交易活动越来越广泛。 于是,市场交易不可避免地涉及到二手房的价格,受到了更广泛的关注。 然而,随着二手房交易规模不断扩大,住房中介机构鱼龙混杂不断出现。 信息不对称问题给消费者购房带来了巨大障碍。 如何更加科学有效地预测上海二手房价格走势,是我们面临的问题。 其主要影响因素的研究变得越来越有必要。

国外二手房市场起步较早,经济学家形成了多种学派,包括土地经济学派、城市学派、行为学派、规划学派和社会学派。 这些理论研究成果揭示了现代二手房市场的内部运行规律和外部影响因素,为我们研究二手房价格影响因素提供了思路。 国内学者也对二手房价格问题进行了相关研究。 孙波等人在《房价八因素模型》[10]中总结了影响房价的八因素模型,包括土地、房地产、房地产公司、购房者、政务管理、官方政策、房地产房地产市场和资金构成影响房价的八个因素。 最近比较热门的还有李选海等人的研究,他们在《一种新的二手房估价方法研究》中提出了模糊数直觉模糊集的距离公式在二手房估价中的应用[11] 。 目前,房地产估价正在向定量化、信息化、系统化方向发展。

上海的房价一直走在全国前列。 除了影响房价的基本因素外,政策的影响也不容忽视。 2015年的“3.30上海新楼市新政”极大刺激了去年的二手房市场。 上海二手房均价一年内上涨30%以上。 今年的“3.25上海新楼市新政”已实施近半年,有效传递了政策。 调控使房价回归理性,预计未来上海二手房交易将平稳发展。

本文通过对2015-2016年上海二手住宅价格的研究,辅以回归和数据挖掘方法,探讨了上海房价的变化趋势以及影响房价的重要因素。 并试图以某地区为例进行深入细致的分析。 。

2. 数据处理

2. 样本选择和数据处理

(一)数据来源

本文使用的房产数据取自链家房产网[1],2015年7月4日至2016年6月17日,上海地区共计约5万条二手房交易记录。 链家网作为目前排名前三的房产经纪公司,数据量大、数据准确性高、数据结构清晰,适合作为研究的数据源。 首先,我们使用Gooseeker[2]创建一个爬虫框架(包括设置主题、排序框等)来爬取包括单价在内的多个变量。 然后我们利用百度地图API中的Geocoding API[3]函数的反向地址解析服务,将Gooseeker爬取的社区等信息转换为百度地图坐标中的经纬度信息。 同时我们找到了上海排名前100的小学[4]以及各个地铁。 站点信息[5],同样通过Geocoding API函数转换为经纬度信息。 最后,我们利用经纬度转换距离公式[6],利用R语言将经纬度信息转换为距离信息,找出距离每个社区最近的地铁和学校信息。

(2)变量选择

每条交易记录包含13个属性,结合其地理属性,可归纳为四个方面:交易特征、房屋特征、地理特征和区位特征(见表1)。

表1 房屋租赁交易记录属性

综合考虑内部因素和外部因素,最终变量选择如表2所示

表2 变量说明

模型房地产价格怎么算_房地产价格的模型_房地产模型多少钱一平

房地产价格的模型_模型房地产价格怎么算_房地产模型多少钱一平

(3)数据的描述性分析

1.因变量:单位面积房价

表3 单位面积价格

模型房地产价格怎么算_房地产价格的模型_房地产模型多少钱一平

从上表可以看出,上海二手房单位面积均价为36846元/平方米,房价中位数为33520元/平方米,极差为179423元/平方米。平方米,表明上海二手房的价格差异

距离较大。 分布呈右偏态,表明大部分房价集中在4万元/平方米以下,峰度小于3,陡度小于正态分布。

房地产价格的模型_模型房地产价格怎么算_房地产模型多少钱一平

2、各市辖区房价

上海不同市辖区的房价差异较大。 一个基本现象是,距离市中心较近的地区二手房平均单价普遍较高,而距离市中心较远的地区则较低。 尤其是黄浦区、静安区的二手房平均单价远高于其他13个市辖区,而奉贤区的房价则远低于平均水平。

因此,在二手房价格研究中,房屋所在的市辖区是一个重要的影响因素。

房地产模型多少钱一平_房地产价格的模型_模型房地产价格怎么算

3、区位因素分析

(一)学区因素

从历史上看,学区房一直受到入学家庭的青睐,学区房的房价也因此远高于其他学区。 从下表可以看出,非学区房与学区房的房价相差近1.5万(不排除优质教学资源向城市集中的可能性),但住房一级和二级学区的价格非常接近。

因此,住房是否在学区是影响单位房价的重要因素,而区分一、二学区住房来研究房价变化意义不大。

模型房地产价格怎么算_房地产价格的模型_房地产模型多少钱一平

房地产模型多少钱一平_房地产价格的模型_模型房地产价格怎么算

(2)地铁因素

模型房地产价格怎么算_房地产模型多少钱一平_房地产价格的模型

上图横轴是二手房所在小区到最近地铁的距离的对数,纵轴是这些房子的单价。

(元),由此初步可以看出,房价与轨道交通便利程度之间存在正相关关系。

4.内部因素分析

(一)装修因素

模型房地产价格怎么算_房地产价格的模型_房地产模型多少钱一平

装修因素作为二手房独有的因素,在定价中发挥着重要作用。 从图6可以看出,部分数据缺少装饰数据。 从不缺失数据的角度来看,对于粗装修、简装修、中装修、硬装修、豪华装修,随着装修程度的提高,单位面积的价格也随之提高。

(2) 楼层系数

房地产模型多少钱一平_房地产价格的模型_模型房地产价格怎么算

图 7 将楼层因素添加到学区因素中。 不难发现,优质学区房中,别墅和中低层在价格上具有优势,而中学学区房和非学区房中,别墅占比并不高。价格。 相反,中下阶层更有优势。

(3)面积系数

模型房地产价格怎么算_房地产模型多少钱一平_房地产价格的模型

受豪宅、别墅的影响,二手房的房屋面积与单价普遍呈现正相关关系。 从图8中不难发现,做了简单的线性回归后,验证了之前的观点。 我们还做了简单的相关分析,得到相关系数为0.15417(p

5、各月单位面积房价

房地产模型多少钱一平_模型房地产价格怎么算_房地产价格的模型

我们在之前的行政区划划分中加入了时间的因素。 总体来看,2015年7月至2016年6月房价呈上涨趋势,其中中心城区涨幅较大,各地区价格差异较大。

3. 基于房价数据的定量分析与建模

(1)模型准备

1.数据处理

从箱线图和数据观察中,我们发现房价数据的分布并不对称,而是向右偏斜,并且存在一些总价或单价的所谓“天价房”远高于平均水平(总价高于3000)。 万元),这些“天价房”或者其他“高价房”对实际研究影响很大,尤其是模型拟合,会极大影响模型参数的计算。 然而,在实际的房价研究中,我们要研究的是最能代表整个房地产市场的数据,是与大多数人密切相关的房地产价格。 因此,在后续的研究中,我们删除了前1%和后1%。 保留极值进行建模分析,是为了打造出更符合大众预期、更好模拟实际二手房市场状况的模型。

去除极值后,我们再根据单价选择不同的颜色来绘制地图。 不难发现,单价较高的区域主要出现在上海中心地带,而单价则向周边辐射逐渐下降。 在青浦,奉贤等远离市中心的地区,房价普遍处于3万左右/平方米及以下的低价。

房地产模型多少钱一平_房地产价格的模型_模型房地产价格怎么算

2.二级区域k-means方法聚类

(1)聚类k-means方法简介:

K-means算法是一种典型的基于距离的聚类算法。 它以距离作为相似度评价指标,即认为两个对象之间的距离越近,相似度就越大。 该算法认为簇是由靠近的对象组成的,因此其最终目标是获得紧凑且独立的簇。

K-means聚类问题的假设是有一组N个数据X={x1,x2,x3,...,xn}需要聚类。 K-means值聚类问题是找到一个分区

房地产模型多少钱一平_房地产价格的模型_模型房地产价格怎么算

最低限度。 其中mi=1/ni表示第i个簇的中心位置,i=1,...,k; ni 是簇 Ci 中数据项的数量; 表示从 xi 到 mi 的距离。 常见的空间聚类算法基于各种距离,例如欧氏距离、曼哈顿距离和明考斯距离。 其中,最常用的是欧氏距离[8]。

K-means算法的基本思想是:给定一个包含n个数据对象的数据库和要生成的聚类数量k,随机选择k个对象作为初始k个聚类中心; 然后计算剩余样本到每个聚类中心之间的距离,将样本分类到离它最近的聚类中心的类中,并使用平均方法计算调整后的新类的新聚类中心; 如果相邻的两个聚类中心没有变化,说明样本调整完成,聚类平均误差准则函数已经收敛。 该算法在每次迭代中检查每个样本的分类是否正确。 如果不正确,必须进行调整。 所有样本调整完成后,修改聚类中心,进入下一次迭代。 如果所有样本在迭代算法中都被正确分类,则不会进行调整,聚类中心也不会改变。 在算法迭代过程中该值不断减小房地产价格的模型,最终收敛到一个固定值。 这个标准也是衡量算法是否正确的依据之一。 K-means算法的流程可以描述为[9]:

算法:根据簇中的对象进行划分并计算平均值。

输入:簇的数量K和包含n个对象的数据库。

输出:误差平方和最小化条件下的 K 个聚类。

方法:1)随机选择K个对象作为初始聚类中心;

2)将所有对象划分到相应的簇中;

3)计算每个簇中对象的平均值,并将所有对象重新分配到相似的簇中;

4)重复;

5) 直到不再改变。

本文使用JMP 12 [7]对次要区域进行K-means聚类。

(2)使用k-means建模

为了找出影响上海二手房价格的主要因素,我们进一步引入了“杨浦区五角场”等二级区,采用k-means动态聚类方法房地产价格的模型,选取单价作为聚类的基础,并进行分类共有 177 个次要区域,分为 4 类。

从地图上我们可以看到,从1类到4类,总体来说,都是逐渐被市中心包围的。 中心区主要由三类、四类次区域组成。 这也符合我们的直觉。 ,城市中心区主要由繁华区和相对次繁华区组成。 松江区内有少量高端别墅区和少量四类区域,而周边其他大部分区域由一类区域组成。

房地产价格的模型_模型房地产价格怎么算_房地产模型多少钱一平

根据图像,我们初步推测三类区域的价格最高,其次是四类、二类和一类。同时我们也发现,单纯按照行政区来区分房价是不合理的(如浦东等)。 以浦东新区为例,“浦东新区陆家嘴”区域属于三类区域,其平均房价约为58366元/平方米,而同区域的“浦东新区川沙”区域则属于三类区域。 1类区域,其平均房价仅为25116元/平方米,相差3万多元。 这一现象也给了我们很多启发。 即使在同一行政区域内,各个次区域的情况也有很大差异。 以陆家嘴为例。 陆家嘴周边作为上海的CBD,地理位置得天独厚。 距离陆家嘴很近。 周边地铁线路发达,还有福山外国语小学等上海顶级小学作为加分。 其单位房价肯定不会低。 但川沙地区地处偏远,周边配套设施不够发达。 其房价较低也是合理的。

(2)模型建立

1.简要说明

众所周知,任何商品的定价都不受单一因素的影响。 二手房的定价不仅受面积、区位等自身属性的影响,还受到消费心理、政策导向等外部供求关系的影响。 基于上述描述性统计和聚类分析,我们将逐步建立和完善模型,分析各种因素对房价的影响。

2. 对数线性多因素模型

房地产模型多少钱一平_模型房地产价格怎么算_房地产价格的模型

模型房地产价格怎么算_房地产模型多少钱一平_房地产价格的模型

(4) 模型应用

首先,在分析的基础上,我们选取​​了可能影响房价的因素,即总价、面积、月份、区、最近的地铁、装修程度、楼层(低、中、高)、小学年级。学区(第一梯队、第二梯队、非重点小学),无论有没有客厅,我们首先假设存在线性关系,尝试对房屋单价进行线性回归。 使用R语言进行最小二乘线性回归。 发现残差存在异方差性,不满足回归假设。 而且,拟合结果显示大量负的单位房价,与现实不符。

房地产价格的模型_模型房地产价格怎么算_房地产模型多少钱一平

进一步观察数据分布,我们发现总价对单价的影响并不是线性的,因此我们尝试对总价进行对数变换。 同时,通过上述描述性统计分析,我们发现了距离最近地铁站的距离与单位房价之间的关系。 它不是线性的,到最近地铁站的距离也是对数变换的。 同时,为了解决拟合结果出现负数的问题,我们还对单价进行了对数变换,使得单价的预测始终为正。 数字。

进一步看残差,我们发现异方差性得到了很大的改善,与均值为0且方差相等的假设一致。

房地产价格的模型_模型房地产价格怎么算_房地产模型多少钱一平

此时R平方为0.92,表明模型相关性较高,各因素显着。 使用新模型的结果如下:

(5)月度分析

房地产模型多少钱一平_房地产价格的模型_模型房地产价格怎么算

表5为2015年7月至2016年6月各月回归模型的系数,可视为剔除其他影响因素后的简单月度因素。 由于模型中我们对因变量单价进行了对数处理,所以我们对自变量的月份进行索引(其他自变量也是如此),就可以得到以2015年7月为基准的倍数关系值​​均大于1,表明近一年来上海二手房价格呈现上涨趋势。 ,且增速持续加快。 例如,2016年6月的房价是2015年7月的1.095倍。也就是说,如果2015年7月的房价是35000元/平方米,那么2016年6月的房价就涨到了38310元/平方米。 一年内每平方米价格上涨约3000元。 但我们发现前三个月(即2015年7月、8月、9月)的系数并不显着,说明这三个月的变化并不显着,其中2016年2月至3月有一个。大幅增长近3%。 这种现象很容易解释,因为2月份是春节期间,房地产市场的价格涨幅首先会呈现放缓趋势。 假期结束,新年伊始,人们的购房意愿回归。 变得很高了。 与此同时,上海房地产新政策的消息泄露,人们普遍选择在政策正式实施前抢购二手房,导致需求曲线上升,推高房价。 新政出台后,房价上涨趋势回落至较正常水平。

(六)区域分析

房地产价格的模型_模型房地产价格怎么算_房地产模型多少钱一平

通过回归模型我们可以得到上海各区的系数。 以保山为基准,各区系数有正有负,说明保山并非极端地区,房价仍存在较高或较低的地区。 为了便于研究,我们将基准调整到房价最低的地区。 从回归系数可以看出,奉贤地区的系数负值最大。 我们将其调整为0基准,重新索引,并将其他区域与奉贤进行比较。 房价最低的地区是奉贤,房价最高的地区是黄浦。 黄浦房价是静安的1.267倍。 事实上,上海的发展比较分散。 杨浦、徐汇、黄浦、浦东等都以其为中心,有很多繁华地段。 分析结果显示,黄浦、静安、徐汇、杨浦均为房价高位区域,符合实际预期。

(7)装修分析

模型房地产价格怎么算_房地产模型多少钱一平_房地产价格的模型

在所有装修类型中,回归模型中毛坯房的系数负值最大。 我们将其系数调整为0,其他装饰类型的系数也相应调整。 以价格最低的毛坯房作为分析基准。 可以看出,五类装修条件的价格从低到高依次为:粗装修、中装修、精装修、简装修、豪华装修。 总体符合人们的预期,唯一令人意外的是,简装修房的价格高于精装修房。 这可能与二手房的性质有关。 人们购买二手房时,通常会自己装修。 对于硬装修房来说,如果装修不满意,就需要自己进行巨大的再加工工作,费时费力。 因此,人们更喜欢购买装修简单的房子。 供需关系决定了简装修房。 价格比带家具的房间要高。

(8)其他自变量分析

对于自变量楼层,房价从低到高依次为低层、高层、中层、别墅。 中高层价格比低层高约0.48%。 即以5万元/平方米的住房供应量计算,中层比低层的价格高出约240元/平方米,而别墅的单价约为低层的1.4倍。拔地而起的建筑物。 结果比较合理。 低层建筑容易出现潮湿、采光不足的问题,而高层建筑则出行不方便,因此价格比中层建筑低。 学区房自变量结果显示,重点学区住房房价高于非重点学区住房房价。 房价上涨约5%。 如果进一步细分,属于第一线的对应小学的房价更高。 对于房价来说属于二线。但差别并不显着

同时,我们发现一个有趣的现象,那就是房价总价与房屋单价之间存在正相关关系。 通过观察数据我们发现,总房价的上涨一般都伴随着房屋总面积的增加以及房屋档次的提升(比如从普通公寓升级而来)而在面积较大、档次较高的房屋中,一般以精装修、豪华装修为主,简装修很少见,这使得房屋的单价与总价形成正相关趋势。

3. 具有交叉项的对数线性模型

此外,我们认识到一些因素对单价的影响并不是完全独立的。 例如,当没有客厅时,随着面积的增加,单价可能会比有客厅的二手房下降得更快,因为面积更大。 如果面积小,没有客厅带来的不便可能会更强,人们会更倾向于选择有客厅的房子。 当面积较小时,没有客厅的房子会有更多的活动区域,可能会更有吸引力。 同时,我们也在试图寻找到最近地铁站的距离与学区房等级之间的交叉效应。 例如,当是学区房时,到地铁站的距离可能相对不太重要,但相反,可能相对更重要。 因此,在接下来的模型中,我们加入了是否有客厅*单位面积和学区房等级*到最近地铁站距离这两个交互因素进行拟合,以验证我们的想法。

(1) 学区*地铁

根据模型拟合结果,我们发现,当房屋位于非重点学区时,地铁距离每增加1%,单价下降约3.36%,而当房屋位于第二学区时,单价下降约3.36%。一线学区,地铁距离每增加1%,单价就会下降。 房价下降了约1.88%,但说到一线学区房,在同样的变化下,单元房价格只下降了约1.68%。

房地产价格的模型_模型房地产价格怎么算_房地产模型多少钱一平

此外,根据图像我们发现,当距离地铁站越近时,几个不同学区的房屋之间的价格差异较小,但当距离较远时,差异变得越来越显着。 这可能是因为,当距离地铁站很近时,学区因素相对不那么重要,交通便利性占主导地位。 然而,当到地铁站的距离较远时,到地铁站的距离就不再那么重要了。 这使得学区因素显得尤为重要。

(2)是否有大厅*区域

模型房地产价格怎么算_房地产价格的模型_房地产模型多少钱一平

通过拟合结果,我们绘制了房屋单价与总面积的关系。 我们发现,当房屋总面积较小时,不带客厅的房屋单价高于带客厅的房屋,而当房屋面积超过90平方米时,一套房屋的价格有客厅的房子的单价超过了无客厅房子的单价,即当面积较大时,无客厅的房子显得吸引力较小,价格较低,这与我们的预测一致。

4 结论分析

上海二手房价格不仅仅是一个简单的数字问题,它关系到本市居民的居住条件,是一个与每个居民息息相关的问题,关系到居民的利益和一个城市的可持续发展。一线城市。 通过分析和理解影响上海二手房屋价格的因素,政府可以制定一些相关政策,以使房地产价格保持在一定范围内,从而促进房地产行业的持续和快速发展当地经济。 本文对于将上海的二手住房价格保持在一定范围内以及发展当地生活和经济标准方面具有重要意义。 我们可以得出结论:

1.上海二手房屋的住房价格具有明显的二级区域特征,同一市政区不同次要地区的住房价格也将有很大的差异。

2.装修良好的二手房屋的价格通常位于高潮。 但是,由于二手房屋的特殊性,人们更倾向于选择在硬装饰和简单装饰之间的简单装饰,这使得简单的二手房屋的住房价格在较高的一侧。

3.上海二手住房价格的过度增长导致引入了3.30新交易。 引入新交易后,住房价格过热。

4.当与地铁站的距离非常接近时,学区的因素相对较不重要,交通便利性就占主导地位。 但是,当到达地铁站的距离很远时,地铁站的距离不再那么重要,这使学区​​因素变得尤为重要。

5.当房屋的总面积很小时,没有客厅的房屋价格高于带客厅的房屋的价格。 当房屋地区超过90平方米时,带客厅的房屋价格高于没有客厅的房屋的价格。 也就是说,当该区域较大时,没有客厅的房屋显得较不吸引人且相对便宜。

5.分析模型的缺点

1.由于数据来源有限,我们仅在一年内从二手住房经销商Lianjia收集了二手住房数据。 时间范围的选择将对模型的准确性和模型的构建产生一定影响。 将其限制在一个二手住房经销商处可能会对所研究的二手住房的性质带来一定的偏见,并且不一定反映上海整个二手住房市场的特征。

2.我们仅研究了上海的二手住房市场。 上海在该国拥有特殊地位,房价高,人口庞大,对商业住房的需求很大。 获得的模型只能反映上海等一级城市中二手住房市场的特征,并且在全国范围内并不普遍。

3.当我们处理数据和构建模型时,我们假设所有数据都是独立的且分布相同的,并且不考虑数据之间的可能相关性,因此最终模型可能会偏差。

4.在模型中,每个二手房屋都基于经销商的二手室数据统计时间,而不是确切的交易时间,因此数据中可能存在一定的滞后。

5.使用与最近的小学和地铁站的距离来表达社区的位置优势是有偏见的。 实际上,这不一定是距离越远,位置优势越明显。 因此,这样的近似可能会影响建模过程。 构建以产生影响。

(省略了参考

模型房地产价格怎么算_房地产模型多少钱一平_房地产价格的模型

打赏
凡注明"来源:长丰房产网"的稿件为本网独家原创稿件,引用或转载请注明出处。 【编辑:佚名】
0相关评论

新闻排行

热点楼盘

更多