<?xml version="1.0" encoding="UTF-8"?><toc><section id="sec_foreword"><title>Foreword</title></section><section id="sec_intro"><title>0		Introduction</title></section><section id="sec_1"><label>1</label><title>Scope</title></section><section id="sec_2"><label>2</label><title>Normative references</title></section><section id="sec_3"><label>3</label><title>Terms and definitions</title></section><section id="sec_4"><label>4</label><title>General principles</title><section id="sec_4.1"><label>4.1</label><title>General requirements for statistical methods</title></section><section id="sec_4.2"><label>4.2</label><title>Basic model</title></section><section id="sec_4.3"><label>4.3</label><title>General approaches for the evaluation of performance</title></section></section><section id="sec_5"><label>5</label><title>Guidelines for the statistical design of proficiency testing schemes</title><section id="sec_5.1"><label>5.1</label><title>Introduction to the statistical design of proficiency testing schemes</title></section><section id="sec_5.2"><label>5.2</label><title>Basis of a statistical design</title></section><section id="sec_5.3"><label>5.3</label><title>Considerations for the statistical distribution of results</title></section><section id="sec_5.4"><label>5.4</label><title>Considerations for small numbers of participants</title></section><section id="sec_5.5"><label>5.5</label><title>Guidelines for choosing the reporting format</title><section id="sec_5.5.1"><label>5.5.1</label><title>General requirements for reporting format</title></section><section id="sec_5.5.2"><label>5.5.2</label><title>Reporting of replicate measurements</title></section><section id="sec_5.5.3"><label>5.5.3</label><title>Reporting of ‘less than’ or ‘greater than’ a limit (censored data)</title></section><section id="sec_5.5.4"><label>5.5.4</label><title>Number of significant digits</title></section></section></section><section id="sec_6"><label>6</label><title>Guidelines for the initial review of proficiency testing items and results</title><section id="sec_6.1"><label>6.1</label><title>Homogeneity and stability of proficiency test items</title></section><section id="sec_6.2"><label>6.2</label><title>Considerations for different measurement methods</title></section><section id="sec_6.3"><label>6.3</label><title>Blunder removal</title></section><section id="sec_6.4"><label>6.4</label><title>Visual review of data</title></section><section id="sec_6.5"><label>6.5</label><title>Robust statistical methods</title></section><section id="sec_6.6"><label>6.6</label><title>Outlier techniques for individual results</title></section></section><section id="sec_7"><label>7</label><title>Determination of the assigned value and its standard uncertainty</title><section id="sec_7.1"><label>7.1</label><title>Choice of method of determining the assigned value</title></section><section id="sec_7.2"><label>7.2</label><title>Determining the uncertainty of the assigned value</title></section><section id="sec_7.3"><label>7.3</label><title>Formulation</title></section><section id="sec_7.4"><label>7.4</label><title>Certified reference material</title></section><section id="sec_7.5"><label>7.5</label><title>Results from one laboratory</title></section><section id="sec_7.6"><label>7.6</label><title>Consensus value from expert laboratories</title></section><section id="sec_7.7"><label>7.7</label><title>Consensus value from participant results</title></section><section id="sec_7.8"><label>7.8</label><title>Comparison of the assigned value with an independent reference value</title></section></section><section id="sec_8"><label>8</label><title>Determination of criteria for evaluation of performance</title><section id="sec_8.1"><label>8.1</label><title>Approaches for determining evaluation criteria</title></section><section id="sec_8.2"><label>8.2</label><title>By perception of experts</title></section><section id="sec_8.3"><label>8.3</label><title>By experience from previous rounds of a proficiency testing scheme</title></section><section id="sec_8.4"><label>8.4</label><title>By use of a general model</title></section><section id="sec_8.5"><label>8.5</label><title>Using the repeatability and reproducibility standard deviations from a previous collaborative study of precision of a measurement method</title></section><section id="sec_8.6"><label>8.6</label><title>From data obtained in the same round of a proficiency testing scheme</title></section><section id="sec_8.7"><label>8.7</label><title>Monitoring interlaboratory agreement</title></section></section><section id="sec_9"><label>9</label><title>Calculation of performance statistics</title><section id="sec_9.1"><label>9.1</label><title>General considerations for determining performance</title></section><section id="sec_9.2"><label>9.2</label><title>Limiting the uncertainty of the assigned value</title></section><section id="sec_9.3"><label>9.3</label><title>Estimates of deviation (measurement error)</title></section><section id="sec_9.4"><label>9.4</label><title>z scores</title></section><section id="sec_9.5"><label>9.5</label><title>z′ scores</title></section><section id="sec_9.6"><label>9.6</label><title>Zeta scores (ζ)</title></section><section id="sec_9.7"><label>9.7</label><title>E scores</title></section><section id="sec_9.8"><label>9.8</label><title>Evaluation of participant uncertainties in testing</title></section><section id="sec_9.9"><label>9.9</label><title>Combined performance scores</title></section></section><section id="sec_10"><label>10</label><title>Graphical methods for describing performance scores</title><section id="sec_10.1"><label>10.1</label><title>Application of graphical methods</title></section><section id="sec_10.2"><label>10.2</label><title>Histograms of results or performance scores</title></section><section id="sec_10.3"><label>10.3</label><title>Kernel density plots</title></section><section id="sec_10.4"><label>10.4</label><title>Bar-plots of standardized performance scores</title></section><section id="sec_10.5"><label>10.5</label><title>Youden plot</title></section><section id="sec_10.6"><label>10.6</label><title>Plots of repeatability standard deviations</title></section><section id="sec_10.7"><label>10.7</label><title>Split samples</title></section><section id="sec_10.8"><label>10.8</label><title>Graphical methods for combining performance scores over several rounds of a proficiency testing scheme</title></section></section><section id="sec_11"><label>11</label><title>Design and analysis of qualitative proficiency testing schemes (including nominal and ordinal properties)</title><section id="sec_11.1"><label>11.1</label><title>Types of qualitative data</title></section><section id="sec_11.2"><label>11.2</label><title>Statistical design</title></section><section id="sec_11.3"><label>11.3</label><title>Assigned values for qualitative proficiency testing schemes</title></section><section id="sec_11.4"><label>11.4</label><title>Performance evaluation and scoring for qualitative proficiency testing schemes</title></section></section><section id="sec_A"><label>Annex A</label><title>Symbols (normative)</title></section><section id="sec_B"><label>Annex B</label><title>Homogeneity and stability of proficiency test items (informative)</title><section id="sec_B.1"><label>B.1</label><title>General procedure for a homogeneity check</title></section><section id="sec_B.2"><label>B.2</label><title>Assessment criteria for a homogeneity check</title></section><section id="sec_B.3"><label>B.3</label><title>Formulae for homogeneity check</title></section><section id="sec_B.4"><label>B.4</label><title>Procedures for checking stability</title><section id="sec_B.4.1"><label>B.4.1</label><title>General considerations for checking stability</title></section><section id="sec_B.4.2"><label>B.4.2</label><title>Procedure for checking stability during the course of a proficiency testing scheme round</title></section></section><section id="sec_B.5"><label>B.5</label><title>Assessment criterion for a stability check</title></section><section id="sec_B.6"><label>B.6</label><title>Stability in transport conditions</title></section></section><section id="sec_C"><label>Annex C</label><title>Robust analysis (informative)</title><section id="sec_C.1"><label>C.1</label><title>General</title></section><section id="sec_C.2"><label>C.2</label><title>Simple outlier-resistant estimators for the population mean and standard deviation</title><section id="sec_C.2.1"><label>C.2.1</label><title>The median</title></section><section id="sec_C.2.2"><label>C.2.2</label><title>Scaled median absolute deviation MAD</title></section><section id="sec_C.2.3"><label>C.2.3</label><title>Normalized interquartile range nIQR</title></section></section><section id="sec_C.3"><label>C.3</label><title>Robust analysis: Algorithm A</title><section id="sec_C.3.1"><label>C.3.1</label><title>Algorithm A with iterated scale</title></section><section id="sec_C.3.2"><label>C.3.2</label><title>Variants of Algorithm A</title></section></section><section id="sec_C.4"><label>C.4</label><title>Robust analysis: Algorithm S</title></section><section id="sec_C.5"><label>C.5</label><title>Computationally intensive robust estimators: Q method and Hampel estimator</title><section id="sec_C.5.1"><label>C.5.1</label><title>Rationale for computationally intensive estimators</title></section><section id="sec_C.5.2"><label>C.5.2</label><title>Determination of a robust standard deviation using Q and Q methods</title></section><section id="sec_C.5.3"><label>C.5.3</label><title>Determination of a robust mean using the Hampel estimator</title></section><section id="sec_C.5.4"><label>C.5.4</label><title>The Q/Hampel method</title></section></section><section id="sec_C.6"><label>C.6</label><title>Other robust techniques</title></section></section><section id="sec_D"><label>Annex D</label><title>Additional guidance on statistical procedures (informative)</title><section id="sec_D.1"><label>D.1</label><title>Procedures for small numbers of participants</title><section id="sec_D.1.1"><label>D.1.1</label><title>General considerations</title></section><section id="sec_D.1.2"><label>D.1.2</label><title>Procedures for identifying outliers</title></section><section id="sec_D.1.3"><label>D.1.3</label><title>Procedures for estimates of location</title></section><section id="sec_D.1.4"><label>D.1.4</label><title>Procedures for estimates of dispersion</title></section></section><section id="sec_D.2"><label>D.2</label><title>Efficiency and breakdown points for robust procedures</title><section id="sec_D.2.1"><label>D.2.1</label><title>Different statistical estimators (e.g. robust techniques) can be compared on three key characteristics:</title></section><section id="sec_D.2.2"><label>D.2.2</label><title>Breakdown point</title></section><section id="sec_D.2.3"><label>D.2.3</label><title>Relative efficiency</title></section></section><section id="sec_D.3"><label>D.3</label><title>Use of proficiency testing data for evaluating the reproducibility and repeatability of a measurement method</title></section></section><section id="sec_E"><label>Annex E</label><title>Illustrative examples (informative)</title><section id="sec_E.1"><label>E.1</label><title>Effect of censored values (see 5.5.3.3)</title></section><section id="sec_E.2"><label>E.2</label><title>Homogeneity and stability test – Arsenic (As) in chocolate (see 6.1)</title></section><section id="sec_E.3"><label>E.3</label><title>Comprehensive example of atrazine in drinking water</title></section><section id="sec_E.4"><label>E.4</label><title>Comprehensive example for mercury in animal feed</title></section><section id="sec_E.5"><label>E.5</label><title>Reference value from a single laboratory: Los Angeles value of aggregates (see 7.5)</title></section><section id="sec_E.6"><label>E.6</label><title>Example of bootstrap technique for Coliforms in food sample (see 7.7.6)</title></section><section id="sec_E.7"><label>E.7</label><title>Comparison of reference value and consensus mean (see 7.8)</title></section><section id="sec_E.8"><label>E.8</label><title>Determination of evaluation criteria by experience with previous rounds of a proficiency testing scheme: toxaphene in drinking water (see 8.3)</title></section><section id="sec_E.9"><label>E.9</label><title>From a general model: Horwitz equation (see 8.4)</title></section><section id="sec_E.10"><label>E.10</label><title>Determining performance from a precision experiment: Determination of the cement content of hardened concrete (see 8.5)</title></section><section id="sec_E.11"><label>E.11</label><title>Bar-plots of standardized biases: Antibody concentrations (see 10.4)</title></section><section id="sec_E.12"><label>E.12</label><title>Youden Plot — antibody concentrations (see 10.5)</title></section><section id="sec_E.13"><label>E.13</label><title>Plot of repeatability standard deviations: Antibody concentrations (see 10.6)</title></section><section id="sec_E.14"><label>E.14</label><title>Graphical methods for tracking performance over time (see 10.8)</title></section><section id="sec_E.15"><label>E.15</label><title>Qualitative Data Analysis; example of an ordinal quantity: skin reaction to a cosmetic (see Clause 11)</title></section></section><section id="sec_F"><label>Annex F</label><title>Example of computer code for plotting and resampling analysis (“bootstrapping”) of PT results (Informative)</title></section><section id="sec_bibl"><title>Bibliography</title></section></toc>