Statistica

Descrittiva, distribuzioni, correlation, test, ANOVA, PCA, resampling, pesi e analisi di repliche.

Versione verificata

FrameworkGX-TXT 0.9.8.10-dev-031
API matematicaNUMERIC_API_v1; non esiste una separata “STATISTICS_API_v1” nella dev-031.

1. Che cos'è la statistica?

La statistica cerca di descrivere variabilità e incertezza e di distinguere pattern plausibili da differenze che potrebbero essere spiegate dal rumore o dal campionamento. Non esiste un unico “test statistico”: la domanda scientifica e il modo in cui i dati sono stati raccolti determinano quale metodo ha senso.

Domande statistiche e strumenti
Parti dalla domanda, non dal nome del test. La stessa tabella può supportare analisi diverse ma con ipotesi differenti.

2. Concetti minimi

Media / medianaMisure di posizione centrale; la mediana è più robusta agli estremi.
Varianza / deviazione standardMisure della dispersione attorno al centro.
QuantiliSoglie che suddividono la distribuzione, per esempio mediana = 50° percentile.
Covariance / correlationMisurano co-variazione; la correlazione non dimostra causalità.
Hypothesis testConfronta i dati con una ipotesi nulla secondo un test dichiarato.
ANOVAConfronta la variabilità fra gruppi con quella all'interno dei gruppi.
PCARappresenta variabili correlate con nuove direzioni che catturano molta varianza.
Bootstrap/resamplingCostruisce distribuzioni empiriche di una stima ripetendo campionamenti controllati.

3. Moduli presenti nella dev-031

IDNomeVersioneTipoScopo
analysis.statistics.descriptiveDescriptive Statistics1.1.0analysisStatistiche descrittive + histogram/box-whisker Plot Dataset.
analysis.statistics.groupedGrouped Statistics1.0.0analysisStatistiche per gruppi categoriali o numerici.
analysis.statistics.correlationCovariance and Correlation1.0.1analysisCovariance/correlation con missing-data policy.
analysis.statistics.distributionEmpirical Distribution1.0.1analysisIstogramma/ECDF e distribuzioni empiriche riproducibili.
analysis.statistics.outliersOutlier Flags1.0.1analysisScore, limiti e flag mantenendo source-row identity.
analysis.statistics.weightedWeighted Statistics1.0.1analysisStatistiche e quantili con pesi.
analysis.statistics.testsHypothesis Tests1.0.1analysisTest di ipotesi tramite NUMERIC_API.
analysis.statistics.anovaOne-way ANOVA1.0.1analysisANOVA one-way ordinaria o Welch.
analysis.statistics.pcaPrincipal Component Analysis1.0.1analysisScores, loadings, explained variance e scaling.
analysis.statistics.resamplingResampling Inference1.0.1analysisDistribuzioni di replicate seeded e summary.
analysis.regressionRegression1.0.1cross-areaRegression numerica con coefficienti/covariance/metrics.
curve.replicate_analysisReplicate Curve Analysis8cross-areaConsensus e uncertainty su curve ripetute; non fitta un modello fisico.
demo.numeric.statisticsNumerical Statistics Demo1.0.1reference/demoDescriptive + weighted statistics.
demo.numeric.uncertaintyNumerical Uncertainty Demo1.0.1reference/demoUncertainty propagation + weighted estimation.

4. API statistica effettiva

Le primitive statistiche vivono in NUMERIC_API_v1: descriptive statistics, rank, covariance, Pearson/Spearman correlation, MAD, histogram, ECDF, quantili, weighted quantiles/statistics, hypothesis tests, one-way ANOVA, SVD/PCA building blocks, seeded resampling e una famiglia foundation.statistics con confidence interval, robust methods, multiple testing, bootstrap/permutation, logistic regression, GLM, survival e k-means.

5. Missing/non-finite data

Molte primitive richiedono una policy esplicita error o omit. Le analisi di correlation possono distinguere pairwise e listwise policies. Questo è parte del significato scientifico: eliminare osservazioni non finite cambia il campione.

6. Pesi

I pesi non sono automaticamente “incertezze”. NUMERIC_API_v1 distingue semantiche relative e inverse-variance nelle operazioni di fitting/statistica che lo prevedono. Zero-weight observations vengono escluse, mentre il conteggio resta diagnosticabile.

7. ANOVA in parole semplici

Una one-way ANOVA chiede se le differenze fra le medie dei gruppi sono grandi rispetto alla variabilità interna ai gruppi. La variante Welch è pensata per gruppi con varianze non omogenee. Un risultato significativo non dice da solo quali gruppi differiscono o perché.

8. PCA in parole semplici

Se molte variabili misurano aspetti correlati dello stesso fenomeno, PCA costruisce nuove coordinate ortogonali (“componenti principali”) ordinate per varianza spiegata. Scores descrivono le osservazioni nel nuovo spazio; loadings descrivono quanto ogni variabile contribuisce alle componenti.

9. Replicate Curve Analysis

È una caratterizzazione statistica di curve ripetute, non un fit di modello fisico. Con replicate ID espliciti usa il percorso trace-based; senza ID non inventa un numero di repliche ma tratta le osservazioni come point cloud ripetute, stima consensus e componenti di dispersione.

10. Collegamenti