day-034-NumPy统计与线性代数
Day 34NumPy 统计与线性代数今天用 NumPy 做统计分析和线性代数运算——相关性、矩阵乘法、解方程组。这是从数据处理迈向机器学习的关键一步。一、统计分析函数importnumpyasnp datanp.array([82,91,78,85,92,76,88,95,84,79])# 基本统计print(f均值:{np.mean(data):.2f})print(f中位数:{np.median(data):.2f})print(f总和:{np.sum(data)})# 离散程度print(f标准差:{np.std(data):.2f})# 标准差偏离均值多少print(f方差:{np.var(data):.2f})# 方差 标准差的平方# 百分位数print(f25分位:{np.percentile(data,25)})# 25% 的数据低于此值print(f50分位:{np.percentile(data,50)})# 中位数print(f75分位:{np.percentile(data,75)})# 极值print(f最大值:{np.max(data)})print(f最小值:{np.min(data)})print(f最大值的索引:{np.argmax(data)})# 第 7 个0-basedprint(f最小值的索引:{np.argmin(data)})样本方差 vs 总体方差np.var(data)→ 总体方差除以 nnp.var(data, ddof1)→ 样本方差除以 n-1统计上更常用二、相关系数——两个变量之间的关系# 学习时间 vs 考试成绩study_hoursnp.array([1,2,3,4,5,6,7,8,9,10])exam_scoresnp.array([52,58,63,65,72,74,78,82,88,91])# 皮尔逊相关系数corr_matrixnp.corrcoef(study_hours,exam_scores)print(corr_matrix)# [[1. 0.993... ]# [0.993... 1. ]]# 非对角线元素即两个变量的相关系数correlationcorr_matrix[0,1]print(f学习时间与成绩的相关系数{correlation:.4f})# 0.993... 表示强正相关学的时间越长成绩越高相关系数解读1完全正相关X 增加Y 增加0不相关-1完全负相关X 增加Y 减少一般认为|r| 0.7就是强相关三、矩阵运算基础# 矩阵乘法Anp.array([[1,2],[3,4]])Bnp.array([[5,6],[7,8]])# numpy.dot() 或 运算符Cnp.dot(A,B)# 传统写法CA B# Python 3.5 推荐写法print(C)# [[19 22]# [37 44]]# 结果[1*52*7, 1*62*8] → [19, 22]# [3*54*7, 3*64*8] → [37, 44]# 转置print(A.T)# [[1 3]# [2 4]]# 逆矩阵A_invnp.linalg.inv(A)print(A_inv)# [[-2. 1. ]# [ 1.5 -0.5]]print(A A_inv)# 接近单位矩阵四、解线性方程组假设方程组3x y 9 x 2y 8用 NumPy 一行求解# 系数矩阵Anp.array([[3,1],[1,2]])# 常数向量bnp.array([9,8])# 求解 Ax bxnp.linalg.solve(A,b)print(fx {x[0]}, y {x[1]})# x 2.0, y 3.0# 验证print(A x)# [9. 8.] 等于 b五、特征值与特征向量特征值和特征向量是机器学习中 PCA主成分分析的数学基础Anp.array([[4,-2],[1,1]])eigenvalues,eigenvectorsnp.linalg.eig(A)print(特征值,eigenvalues)# [3. 2.]print(特征向量)print(eigenvectors)# [[ 0.8944 0.7071]# [-0.4472 0.7071]]# 每列是一个特征向量# 验证A v λ vveigenvectors[:,0]# 第一个特征向量lameigenvalues[0]# 第一个特征值print(A v)# 应该等于 lam * vprint(lam*v)六、实战——用 NumPy 实现简单线性回归线性回归的解析解w (X^T X)^(-1) X^T yimportnumpyasnp# 模拟数据房价 2 * 面积 3 * 房间数 噪声np.random.seed(42)n_samples100areanp.random.uniform(50,200,n_samples)roomsnp.random.randint(1,6,n_samples)noisenp.random.normal(0,10,n_samples)price2*area3*rooms*50noise# 构建设计矩阵 X加一列 1 表示截距项Xnp.column_stack([np.ones(n_samples),area,rooms*50])yprice# 解析解wnp.linalg.inv(X.T X) X.T yprint(f截距{w[0]:.2f})print(f面积系数{w[1]:.2f})print(f房间系数{w[2]:.2f})# 面积系数约 2房间系数约 3接近真实值七、今日学习总结学习内容掌握情况一句话要点统计函数✅ 重点mean/median/std/percentile相关系数✅ 重点np.corrcoef分析变量关联矩阵乘法✅ 重点A B或np.dot(A, B)逆矩阵✅ 理解np.linalg.inv(A)解方程组✅ 了解np.linalg.solve(A, b)特征值分解✅ 了解PCA 的数学基础线性回归✅ 实战用线性代数做预测今日踩坑记录矩阵乘法维度要对齐(m, n) (n, p)→(m, p)。(2, 3) (2, 3)直接报错需要第二个矩阵转置。np.linalg.inv对奇异矩阵报错不是所有矩阵都能求逆。用np.linalg.pinv可以求伪逆。np.std(ddof0)vsnp.std(ddof1)默认ddof0是总体标准差。抽样数据应该用ddof1贝塞尔校正。八、明天学什么NumPy 最后一篇——随机数生成与数据科学综合实战。然后正式进入 Pandas 的世界。统计告诉你是什么线性代数告诉你怎么算。两者合在一起就是机器学习的数学基石。第34天打卡完成。明天见本系列是个人学习笔记如有错误欢迎在评论区指正交流。