cpuset: mm: reduce large amounts of memory barrier related damage v3

Commit c0ff7453bb5c ("cpuset,mm: fix no node to alloc memory when changing cpuset's mems") wins a super prize for the largest number of memory barriers entered into fast paths for one commit. [get|put]_mems_allowed is incredibly heavy with pairs of full memory barriers inserted into a number of hot paths. This was detected while investigating at large page allocator slowdown introduced some time after 2.6.32. The largest portion of this overhead was shown by oprofile to be at an mfence introduced by this commit into the page allocator hot path. For extra style points, the commit introduced the use of yield() in an implementation of what looks like a spinning mutex. This patch replaces the full memory barriers on both read and write sides with a sequence counter with just read barriers on the fast path side. This is much cheaper on some architectures, including x86. The main bulk of the patch is the retry logic if the nodemask changes in a manner that can cause a false failure. While updating the nodemask, a check is made to see if a false failure is a risk. If it is, the sequence number gets bumped and parallel allocators will briefly stall while the nodemask update takes place. In a page fault test microbenchmark, oprofile samples from __alloc_pages_nodemask went from 4.53% of all samples to 1.15%. The actual results were 3.3.0-rc3 3.3.0-rc3 rc3-vanilla nobarrier-v2r1 Clients 1 UserTime 0.07 ( 0.00%) 0.08 (-14.19%) Clients 2 UserTime 0.07 ( 0.00%) 0.07 ( 2.72%) Clients 4 UserTime 0.08 ( 0.00%) 0.07 ( 3.29%) Clients 1 SysTime 0.70 ( 0.00%) 0.65 ( 6.65%) Clients 2 SysTime 0.85 ( 0.00%) 0.82 ( 3.65%) Clients 4 SysTime 1.41 ( 0.00%) 1.41 ( 0.32%) Clients 1 WallTime 0.77 ( 0.00%) 0.74 ( 4.19%) Clients 2 WallTime 0.47 ( 0.00%) 0.45 ( 3.73%) Clients 4 WallTime 0.38 ( 0.00%) 0.37 ( 1.58%) Clients 1 Flt/sec/cpu 497620.28 ( 0.00%) 520294.53 ( 4.56%) Clients 2 Flt/sec/cpu 414639.05 ( 0.00%) 429882.01 ( 3.68%) Clients 4 Flt/sec/cpu 257959.16 ( 0.00%) 258761.48 ( 0.31%) Clients 1 Flt/sec 495161.39 ( 0.00%) 517292.87 ( 4.47%) Clients 2 Flt/sec 820325.95 ( 0.00%) 850289.77 ( 3.65%) Clients 4 Flt/sec 1020068.93 ( 0.00%) 1022674.06 ( 0.26%) MMTests Statistics: duration Sys Time Running Test (seconds) 135.68 132.17 User+Sys Time Running Test (seconds) 164.2 160.13 Total Elapsed Time (seconds) 123.46 120.87 The overall improvement is small but the System CPU time is much improved and roughly in correlation to what oprofile reported (these performance figures are without profiling so skew is expected). The actual number of page faults is noticeably improved. For benchmarks like kernel builds, the overall benefit is marginal but the system CPU time is slightly reduced. To test the actual bug the commit fixed I opened two terminals. The first ran within a cpuset and continually ran a small program that faulted 100M of anonymous data. In a second window, the nodemask of the cpuset was continually randomised in a loop. Without the commit, the program would fail every so often (usually within 10 seconds) and obviously with the commit everything worked fine. With this patch applied, it also worked fine so the fix should be functionally equivalent. Signed-off-by: Mel Gorman <mgorman@suse.de> Cc: Miao Xie <miaox@cn.fujitsu.com> Cc: David Rientjes <rientjes@google.com> Cc: Peter Zijlstra <a.p.zijlstra@chello.nl> Cc: Christoph Lameter <cl@linux.com> Signed-off-by: Andrew Morton <akpm@linux-foundation.org> Signed-off-by: Linus Torvalds <torvalds@linux-foundation.org>
author: Mel Gorman <mgorman@suse.de> 2012-03-21 19:34:11 -0400
committer: Linus Torvalds <torvalds@linux-foundation.org> 2012-03-21 20:54:59 -0400
commit: cc9a6c8776615f9c194ccf0b63a0aa5628235545 (patch)
tree: 0cbbf118e86541f8eb2fc7b717a0e08eaced986d /mm/mempolicy.c
parent: e845e199362cc5712ba0e7eedc14eed70e144258 (diff)
1 files changed, 21 insertions, 7 deletions
diff --git a/mm/mempolicy.c b/mm/mempolicy.c
index 71e1a523e209..cfb6c8678754 100644
--- a/mm/mempolicy.c
+++ b/mm/mempolicy.c
@@ -1850,18 +1850,24 @@ struct page *
 alloc_pages_vma(gfp_t gfp, int order, struct vm_area_struct *vma,
                unsigned long addr, int node)
 {
-        struct mempolicy *pol = get_vma_policy(current, vma, addr);
+        struct mempolicy *pol;
        struct zonelist *zl;
        struct page *page;
+        unsigned int cpuset_mems_cookie;
+retry_cpuset:
+        pol = get_vma_policy(current, vma, addr);
+        cpuset_mems_cookie = get_mems_allowed();
-        get_mems_allowed();
        if (unlikely(pol->mode == MPOL_INTERLEAVE)) {
                unsigned nid;
                nid = interleave_nid(pol, vma, addr, PAGE_SHIFT + order);
                mpol_cond_put(pol);
                page = alloc_page_interleave(gfp, order, nid);
-                put_mems_allowed();
+                if (unlikely(!put_mems_allowed(cpuset_mems_cookie) && !page))
+                        goto retry_cpuset;
                return page;
        }
        zl = policy_zonelist(gfp, pol, node);
@@ -1872,7 +1878,8 @@ alloc_pages_vma(gfp_t gfp, int order, struct vm_area_struct *vma,
                struct page *page =  __alloc_pages_nodemask(gfp, order,
                                                zl, policy_nodemask(gfp, pol));
                __mpol_put(pol);
-                put_mems_allowed();
+                if (unlikely(!put_mems_allowed(cpuset_mems_cookie) && !page))
+                        goto retry_cpuset;
                return page;
        }
        /*
@@ -1880,7 +1887,8 @@ alloc_pages_vma(gfp_t gfp, int order, struct vm_area_struct *vma,
         */
        page = __alloc_pages_nodemask(gfp, order, zl,
                                      policy_nodemask(gfp, pol));
-        put_mems_allowed();
+        if (unlikely(!put_mems_allowed(cpuset_mems_cookie) && !page))
+                goto retry_cpuset;
        return page;
 }
@@ -1907,11 +1915,14 @@ struct page *alloc_pages_current(gfp_t gfp, unsigned order)
 {
        struct mempolicy *pol = current->mempolicy;
        struct page *page;
+        unsigned int cpuset_mems_cookie;
        if (!pol || in_interrupt() || (gfp & __GFP_THISNODE))
                pol = &default_policy;
-        get_mems_allowed();
+retry_cpuset:
+        cpuset_mems_cookie = get_mems_allowed();
        /*
         * No reference counting needed for current->mempolicy
         * nor system default_policy
@@ -1922,7 +1933,10 @@ struct page *alloc_pages_current(gfp_t gfp, unsigned order)
                page = __alloc_pages_nodemask(gfp, order,
                                policy_zonelist(gfp, pol, numa_node_id()),
                                policy_nodemask(gfp, pol));
-        put_mems_allowed();
+        if (unlikely(!put_mems_allowed(cpuset_mems_cookie) && !page))
+                goto retry_cpuset;
        return page;
 }
 EXPORT_SYMBOL(alloc_pages_current);
author	Mel Gorman <mgorman@suse.de>	2012-03-21 19:34:11 -0400
committer	Linus Torvalds <torvalds@linux-foundation.org>	2012-03-21 20:54:59 -0400
commit	cc9a6c8776615f9c194ccf0b63a0aa5628235545 (patch)
tree	0cbbf118e86541f8eb2fc7b717a0e08eaced986d /mm/mempolicy.c
parent	e845e199362cc5712ba0e7eedc14eed70e144258 (diff)

diff --git a/mm/mempolicy.c b/mm/mempolicy.c index 71e1a523e209..cfb6c8678754 100644 --- a/mm/mempolicy.c +++ b/mm/mempolicy.c
@@ -1850,18 +1850,24 @@ struct page *
1850	alloc_pages_vma(gfp_t gfp, int order, struct vm_area_struct *vma,	1850	alloc_pages_vma(gfp_t gfp, int order, struct vm_area_struct *vma,
1851	unsigned long addr, int node)	1851	unsigned long addr, int node)
1852	{	1852	{
1853	struct mempolicy *pol = get_vma_policy(current, vma, addr);	1853	struct mempolicy *pol;
1854	struct zonelist *zl;	1854	struct zonelist *zl;
1855	struct page *page;	1855	struct page *page;
		1856	unsigned int cpuset_mems_cookie;
		1857
		1858	retry_cpuset:
		1859	pol = get_vma_policy(current, vma, addr);
		1860	cpuset_mems_cookie = get_mems_allowed();
1856		1861
1857	get_mems_allowed();
1858	if (unlikely(pol->mode == MPOL_INTERLEAVE)) {	1862	if (unlikely(pol->mode == MPOL_INTERLEAVE)) {
1859	unsigned nid;	1863	unsigned nid;
1860		1864
1861	nid = interleave_nid(pol, vma, addr, PAGE_SHIFT + order);	1865	nid = interleave_nid(pol, vma, addr, PAGE_SHIFT + order);
1862	mpol_cond_put(pol);	1866	mpol_cond_put(pol);
1863	page = alloc_page_interleave(gfp, order, nid);	1867	page = alloc_page_interleave(gfp, order, nid);
1864	put_mems_allowed();	1868	if (unlikely(!put_mems_allowed(cpuset_mems_cookie) && !page))
		1869	goto retry_cpuset;
		1870
1865	return page;	1871	return page;
1866	}	1872	}
1867	zl = policy_zonelist(gfp, pol, node);	1873	zl = policy_zonelist(gfp, pol, node);
@@ -1872,7 +1878,8 @@ alloc_pages_vma(gfp_t gfp, int order, struct vm_area_struct *vma,
1872	struct page *page = __alloc_pages_nodemask(gfp, order,	1878	struct page *page = __alloc_pages_nodemask(gfp, order,
1873	zl, policy_nodemask(gfp, pol));	1879	zl, policy_nodemask(gfp, pol));
1874	__mpol_put(pol);	1880	__mpol_put(pol);
1875	put_mems_allowed();	1881	if (unlikely(!put_mems_allowed(cpuset_mems_cookie) && !page))
		1882	goto retry_cpuset;
1876	return page;	1883	return page;
1877	}	1884	}
1878	/*	1885	/*
@@ -1880,7 +1887,8 @@ alloc_pages_vma(gfp_t gfp, int order, struct vm_area_struct *vma,
1880	*/	1887	*/
1881	page = __alloc_pages_nodemask(gfp, order, zl,	1888	page = __alloc_pages_nodemask(gfp, order, zl,
1882	policy_nodemask(gfp, pol));	1889	policy_nodemask(gfp, pol));
1883	put_mems_allowed();	1890	if (unlikely(!put_mems_allowed(cpuset_mems_cookie) && !page))
		1891	goto retry_cpuset;
1884	return page;	1892	return page;
1885	}	1893	}
1886		1894
@@ -1907,11 +1915,14 @@ struct page *alloc_pages_current(gfp_t gfp, unsigned order)
1907	{	1915	{
1908	struct mempolicy *pol = current->mempolicy;	1916	struct mempolicy *pol = current->mempolicy;
1909	struct page *page;	1917	struct page *page;
		1918	unsigned int cpuset_mems_cookie;
1910		1919
1911	if (!pol \|\| in_interrupt() \|\| (gfp & __GFP_THISNODE))	1920	if (!pol \|\| in_interrupt() \|\| (gfp & __GFP_THISNODE))
1912	pol = &default_policy;	1921	pol = &default_policy;
1913		1922
1914	get_mems_allowed();	1923	retry_cpuset:
		1924	cpuset_mems_cookie = get_mems_allowed();
		1925
1915	/*	1926	/*
1916	* No reference counting needed for current->mempolicy	1927	* No reference counting needed for current->mempolicy
1917	* nor system default_policy	1928	* nor system default_policy
@@ -1922,7 +1933,10 @@ struct page *alloc_pages_current(gfp_t gfp, unsigned order)
1922	page = __alloc_pages_nodemask(gfp, order,	1933	page = __alloc_pages_nodemask(gfp, order,
1923	policy_zonelist(gfp, pol, numa_node_id()),	1934	policy_zonelist(gfp, pol, numa_node_id()),
1924	policy_nodemask(gfp, pol));	1935	policy_nodemask(gfp, pol));
1925	put_mems_allowed();	1936
		1937	if (unlikely(!put_mems_allowed(cpuset_mems_cookie) && !page))
		1938	goto retry_cpuset;
		1939
1926	return page;	1940	return page;
1927	}	1941	}
1928	EXPORT_SYMBOL(alloc_pages_current);	1942	EXPORT_SYMBOL(alloc_pages_current);