upstream/mercurial-mirror Files · mercurial/dagutil.py

manifest: persist the manifestfulltext cache...

manifest: persist the manifestfulltext cache Reconstructing the manifest from the revlog takes time, so much so that there already is a LRU cache to avoid having to load a manifest multiple times. This patch persists that LRU cache in the .hg/cache directory, so we can re-use this cache across hg commands. Commit benchmark (run on Macos 10.13 on a 2017-model Macbook Pro with Core i7 2.9GHz and flash drive), testing without and with patch run 5 times, baseline is r2a227782e754: * committing to an existing file, against the mozilla-central repository. Baseline real time average 1.9692, with patch 1.3786. A new debugcommand "hg debugmanifestfulltextcache" lets you inspect the cache, clear it, or add specific manifest nodeids to it. When calling repo.updatecaches(), the manifest(s) for the working copy parents are added to the cache. The hg perfmanifest command has an additional --clear-disk switch to clear this cache when testing manifest loading performance. Using this command to test performance on the firefox repository for revision f947d902ed91, whose manifest has a delta chain length of 60540, we see: $ hg perfmanifest --clear-disk ! wall 0.972253 comb 0.970000 user 0.850000 sys 0.120000 (best of 10) $ hg debugmanifestfulltextcache -a `hg log --debug -r | grep manifest | cut -d: -f3` Cache contains 1 manifest entries, in order of most to least recent: id: 0294517df4aad07c70701db43bc7ff24c3ce7dbc, size 25.6 MB Total cache data size 25.6 MB, on-disk 0 bytes $ hg perfmanifest ! wall 0.036748 comb 0.040000 user 0.020000 sys 0.020000 (best of 100) Worst-case scenario: a manifest text loaded from a single delta; in the firefox repository manifest node is the chain base for the manifest attached to revision f947d902ed91. Loading this from a full cache file is just as fast as without the cache; the extra node ids ensure a big full cache: $ for node in 1a1922c14a3e 0294517df4aa; do > hgd debugmanifestfulltextcache -a $node > /dev/null > done $ hgd perfmanifest -m ! wall 0.077513 comb 0.080000 user 0.030000 sys 0.050000 (best of 100) $ hgd perfmanifest -m --clear-disk ! wall 0.078547 comb 0.080000 user 0.070000 sys 0.010000 (best of 100)

Boris Feld - - Load All Authors

File last commit:

r35305:f77121b6 default


                r38803:0a57945a

default

Download file

             dagutil.py
        
                    287 lines
            
             | 8.2 KiB
            
                | text/x-python
            
             |
                PythonLexer
            
             / mercurial / dagutil.py
          
                    History
                
                 |
                  Annotation
                 | Raw
                 |Copy content
                 |Copy permalink

      # dagutil.py - dag utilities for mercurial

      #

      # Copyright 2010 Benoit Boissinot <bboissin@gmail.com>

      # and Peter Arrenbrecht <peter@arrenbrecht.ch>

      #

      # This software may be used and distributed according to the terms of the

      # GNU General Public License version 2 or any later version.

      from __future__ import absolute_import

      from .i18n import _

      from .node import nullrev

      class basedag(object):

          '''generic interface for DAGs

          terms:

          "ix" (short for index) identifies a nodes internally,

          "id" identifies one externally.

          All params are ixs unless explicitly suffixed otherwise.

          Pluralized params are lists or sets.

          '''

          def __init__(self):

              self._inverse = None

          def nodeset(self):

              '''set of all node ixs'''

              raise NotImplementedError

          def heads(self):

              '''list of head ixs'''

              raise NotImplementedError

          def parents(self, ix):

              '''list of parents ixs of ix'''

              raise NotImplementedError

          def inverse(self):

              '''inverse DAG, where parents becomes children, etc.'''

              raise NotImplementedError

          def ancestorset(self, starts, stops=None):

              '''

              set of all ancestors of starts (incl), but stop walk at stops (excl)

              '''

              raise NotImplementedError

          def descendantset(self, starts, stops=None):

              '''

              set of all descendants of starts (incl), but stop walk at stops (excl)

              '''

              return self.inverse().ancestorset(starts, stops)

          def headsetofconnecteds(self, ixs):

              '''

              subset of connected list of ixs so that no node has a descendant in it

              By "connected list" we mean that if an ancestor and a descendant are in

              the list, then so is at least one path connecting them.

              '''

              raise NotImplementedError

          def externalize(self, ix):

              '''return a node id'''

              return self._externalize(ix)

          def externalizeall(self, ixs):

              '''return a list of (or set if given a set) of node ids'''

              ids = self._externalizeall(ixs)

              if isinstance(ixs, set):

                  return set(ids)

              return list(ids)

          def internalize(self, id):

              '''return a node ix'''

              return self._internalize(id)

          def internalizeall(self, ids, filterunknown=False):

              '''return a list of (or set if given a set) of node ixs'''

              ixs = self._internalizeall(ids, filterunknown)

              if isinstance(ids, set):

                  return set(ixs)

              return list(ixs)

      class genericdag(basedag):

          '''generic implementations for DAGs'''

          def ancestorset(self, starts, stops=None):

              if stops:

                  stops = set(stops)

              else:

                  stops = set()

              seen = set()

              pending = list(starts)

              while pending:

                  n = pending.pop()

                  if n not in seen and n not in stops:

                      seen.add(n)

                      pending.extend(self.parents(n))

              return seen

          def headsetofconnecteds(self, ixs):

              hds = set(ixs)

              if not hds:

                  return hds

              for n in ixs:

                  for p in self.parents(n):

                      hds.discard(p)

              assert hds

              return hds

      class revlogbaseddag(basedag):

          '''generic dag interface to a revlog'''

          def __init__(self, revlog, nodeset):

              basedag.__init__(self)

              self._revlog = revlog

              self._heads = None

              self._nodeset = nodeset

          def nodeset(self):

              return self._nodeset

          def heads(self):

              if self._heads is None:

                  self._heads = self._getheads()

              return self._heads

          def _externalize(self, ix):

              return self._revlog.index[ix][7]

          def _externalizeall(self, ixs):

              idx = self._revlog.index

              return [idx[i][7] for i in ixs]

          def _internalize(self, id):

              ix = self._revlog.rev(id)

              if ix == nullrev:

                  raise LookupError(id, self._revlog.indexfile, _('nullid'))

              return ix

          def _internalizeall(self, ids, filterunknown):

              rl = self._revlog

              if filterunknown:

                  return [r for r in map(rl.nodemap.get, ids)

                          if (r is not None

                              and r != nullrev

                              and r not in rl.filteredrevs)]

              return [self._internalize(i) for i in ids]

      class revlogdag(revlogbaseddag):

          '''dag interface to a revlog'''

          def __init__(self, revlog, localsubset=None):

              revlogbaseddag.__init__(self, revlog, set(revlog))

              self._heads = localsubset

          def _getheads(self):

              return [r for r in self._revlog.headrevs() if r != nullrev]

          def parents(self, ix):

              rlog = self._revlog

              idx = rlog.index

              revdata = idx[ix]

              prev = revdata[5]

              if prev != nullrev:

                  prev2 = revdata[6]

                  if prev2 == nullrev:

                      return [prev]

                  return [prev, prev2]

              prev2 = revdata[6]

              if prev2 != nullrev:

                  return [prev2]

              return []

          def inverse(self):

              if self._inverse is None:

                  self._inverse = inverserevlogdag(self)

              return self._inverse

          def ancestorset(self, starts, stops=None):

              rlog = self._revlog

              idx = rlog.index

              if stops:

                  stops = set(stops)

              else:

                  stops = set()

              seen = set()

              pending = list(starts)

              while pending:

                  rev = pending.pop()

                  if rev not in seen and rev not in stops:

                      seen.add(rev)

                      revdata = idx[rev]

                      for i in [5, 6]:

                          prev = revdata[i]

                          if prev != nullrev:

                              pending.append(prev)

              return seen

          def headsetofconnecteds(self, ixs):

              if not ixs:

                  return set()

              rlog = self._revlog

              idx = rlog.index

              headrevs = set(ixs)

              for rev in ixs:

                  revdata = idx[rev]

                  for i in [5, 6]:

                      prev = revdata[i]

                      if prev != nullrev:

                          headrevs.discard(prev)

              assert headrevs

              return headrevs

          def linearize(self, ixs):

              '''linearize and topologically sort a list of revisions

              The linearization process tries to create long runs of revs where

              a child rev comes immediately after its first parent. This is done by

              visiting the heads of the given revs in inverse topological order,

              and for each visited rev, visiting its second parent, then its first

              parent, then adding the rev itself to the output list.

              '''

              sorted = []

              visit = list(self.headsetofconnecteds(ixs))

              visit.sort(reverse=True)

              finished = set()

              while visit:

                  cur = visit.pop()

                  if cur < 0:

                      cur = -cur - 1

                      if cur not in finished:

                          sorted.append(cur)

                          finished.add(cur)

                  else:

                      visit.append(-cur - 1)

                      visit += [p for p in self.parents(cur)

                                if p in ixs and p not in finished]

              assert len(sorted) == len(ixs)

              return sorted

      class inverserevlogdag(revlogbaseddag, genericdag):

          '''inverse of an existing revlog dag; see revlogdag.inverse()'''

          def __init__(self, orig):

              revlogbaseddag.__init__(self, orig._revlog, orig._nodeset)

              self._orig = orig

              self._children = {}

              self._roots = []

              self._walkfrom = len(self._revlog) - 1

          def _walkto(self, walkto):

              rev = self._walkfrom

              cs = self._children

              roots = self._roots

              idx = self._revlog.index

              while rev >= walkto:

                  data = idx[rev]

                  isroot = True

                  for prev in [data[5], data[6]]: # parent revs

                      if prev != nullrev:

                          cs.setdefault(prev, []).append(rev)

                          isroot = False

                  if isroot:

                      roots.append(rev)

                  rev -= 1

              self._walkfrom = rev

          def _getheads(self):

              self._walkto(nullrev)

              return self._roots

          def parents(self, ix):

              if ix is None:

                  return []

              if ix <= self._walkfrom:

                  self._walkto(ix)

              return self._children.get(ix, [])

          def inverse(self):

              return self._orig

	Site-wide shortcuts
/	Use quick search box
g h	Goto home page
g g	Goto my private gists page
g G	Goto my public gists page
g 0-9	Goto bookmarked items from 0-9
n r	New repository page
n g	New gist page

	Repositories
g s	Goto summary page
g c	Goto changelog page
g f	Goto files page
g F	Goto files page with file search activated
g p	Goto pull requests page
g o	Goto repository settings
g O	Goto repository access permissions settings
t s	Toggle sidebar on some pages

				# dagutil.py - dag utilities for mercurial
				#
				# Copyright 2010 Benoit Boissinot <bboissin@gmail.com>
				# and Peter Arrenbrecht <peter@arrenbrecht.ch>
				#
				# This software may be used and distributed according to the terms of the
				# GNU General Public License version 2 or any later version.

				from __future__ import absolute_import

				from .i18n import _
				from .node import nullrev

				class basedag(object):
				'''generic interface for DAGs

				terms:
				"ix" (short for index) identifies a nodes internally,
				"id" identifies one externally.

				All params are ixs unless explicitly suffixed otherwise.
				Pluralized params are lists or sets.
				'''

				def __init__(self):
				self._inverse = None

				def nodeset(self):
				'''set of all node ixs'''
				raise NotImplementedError

				def heads(self):
				'''list of head ixs'''
				raise NotImplementedError

				def parents(self, ix):
				'''list of parents ixs of ix'''
				raise NotImplementedError

				def inverse(self):
				'''inverse DAG, where parents becomes children, etc.'''
				raise NotImplementedError

				def ancestorset(self, starts, stops=None):
				'''
				set of all ancestors of starts (incl), but stop walk at stops (excl)
				'''
				raise NotImplementedError

				def descendantset(self, starts, stops=None):
				'''
				set of all descendants of starts (incl), but stop walk at stops (excl)
				'''
				return self.inverse().ancestorset(starts, stops)

				def headsetofconnecteds(self, ixs):
				'''
				subset of connected list of ixs so that no node has a descendant in it

				By "connected list" we mean that if an ancestor and a descendant are in
				the list, then so is at least one path connecting them.
				'''
				raise NotImplementedError

				def externalize(self, ix):
				'''return a node id'''
				return self._externalize(ix)

				def externalizeall(self, ixs):
				'''return a list of (or set if given a set) of node ids'''
				ids = self._externalizeall(ixs)
				if isinstance(ixs, set):
				return set(ids)
				return list(ids)

				def internalize(self, id):
				'''return a node ix'''
				return self._internalize(id)

				def internalizeall(self, ids, filterunknown=False):
				'''return a list of (or set if given a set) of node ixs'''
				ixs = self._internalizeall(ids, filterunknown)
				if isinstance(ids, set):
				return set(ixs)
				return list(ixs)


				class genericdag(basedag):
				'''generic implementations for DAGs'''

				def ancestorset(self, starts, stops=None):
				if stops:
				stops = set(stops)
				else:
				stops = set()
				seen = set()
				pending = list(starts)
				while pending:
				n = pending.pop()
				if n not in seen and n not in stops:
				seen.add(n)
				pending.extend(self.parents(n))
				return seen

				def headsetofconnecteds(self, ixs):
				hds = set(ixs)
				if not hds:
				return hds
				for n in ixs:
				for p in self.parents(n):
				hds.discard(p)
				assert hds
				return hds


				class revlogbaseddag(basedag):
				'''generic dag interface to a revlog'''

				def __init__(self, revlog, nodeset):
				basedag.__init__(self)
				self._revlog = revlog
				self._heads = None
				self._nodeset = nodeset

				def nodeset(self):
				return self._nodeset

				def heads(self):
				if self._heads is None:
				self._heads = self._getheads()
				return self._heads

				def _externalize(self, ix):
				return self._revlog.index[ix][7]
				def _externalizeall(self, ixs):
				idx = self._revlog.index
				return [idx[i][7] for i in ixs]

				def _internalize(self, id):
				ix = self._revlog.rev(id)
				if ix == nullrev:
				raise LookupError(id, self._revlog.indexfile, _('nullid'))
				return ix
				def _internalizeall(self, ids, filterunknown):
				rl = self._revlog
				if filterunknown:
				return [r for r in map(rl.nodemap.get, ids)
				if (r is not None
				and r != nullrev
				and r not in rl.filteredrevs)]
				return [self._internalize(i) for i in ids]


				class revlogdag(revlogbaseddag):
				'''dag interface to a revlog'''

				def __init__(self, revlog, localsubset=None):
				revlogbaseddag.__init__(self, revlog, set(revlog))
				self._heads = localsubset

				def _getheads(self):
				return [r for r in self._revlog.headrevs() if r != nullrev]

				def parents(self, ix):
				rlog = self._revlog
				idx = rlog.index
				revdata = idx[ix]
				prev = revdata[5]
				if prev != nullrev:
				prev2 = revdata[6]
				if prev2 == nullrev:
				return [prev]
				return [prev, prev2]
				prev2 = revdata[6]
				if prev2 != nullrev:
				return [prev2]
				return []

				def inverse(self):
				if self._inverse is None:
				self._inverse = inverserevlogdag(self)
				return self._inverse

				def ancestorset(self, starts, stops=None):
				rlog = self._revlog
				idx = rlog.index
				if stops:
				stops = set(stops)
				else:
				stops = set()
				seen = set()
				pending = list(starts)
				while pending:
				rev = pending.pop()
				if rev not in seen and rev not in stops:
				seen.add(rev)
				revdata = idx[rev]
				for i in [5, 6]:
				prev = revdata[i]
				if prev != nullrev:
				pending.append(prev)
				return seen

				def headsetofconnecteds(self, ixs):
				if not ixs:
				return set()
				rlog = self._revlog
				idx = rlog.index
				headrevs = set(ixs)
				for rev in ixs:
				revdata = idx[rev]
				for i in [5, 6]:
				prev = revdata[i]
				if prev != nullrev:
				headrevs.discard(prev)
				assert headrevs
				return headrevs

				def linearize(self, ixs):
				'''linearize and topologically sort a list of revisions

				The linearization process tries to create long runs of revs where
				a child rev comes immediately after its first parent. This is done by
				visiting the heads of the given revs in inverse topological order,
				and for each visited rev, visiting its second parent, then its first
				parent, then adding the rev itself to the output list.
				'''
				sorted = []
				visit = list(self.headsetofconnecteds(ixs))
				visit.sort(reverse=True)
				finished = set()

				while visit:
				cur = visit.pop()
				if cur < 0:
				cur = -cur - 1
				if cur not in finished:
				sorted.append(cur)
				finished.add(cur)
				else:
				visit.append(-cur - 1)
				visit += [p for p in self.parents(cur)
				if p in ixs and p not in finished]
				assert len(sorted) == len(ixs)
				return sorted


				class inverserevlogdag(revlogbaseddag, genericdag):
				'''inverse of an existing revlog dag; see revlogdag.inverse()'''

				def __init__(self, orig):
				revlogbaseddag.__init__(self, orig._revlog, orig._nodeset)
				self._orig = orig
				self._children = {}
				self._roots = []
				self._walkfrom = len(self._revlog) - 1

				def _walkto(self, walkto):
				rev = self._walkfrom
				cs = self._children
				roots = self._roots
				idx = self._revlog.index
				while rev >= walkto:
				data = idx[rev]
				isroot = True
				for prev in [data[5], data[6]]: # parent revs
				if prev != nullrev:
				cs.setdefault(prev, []).append(rev)
				isroot = False
				if isroot:
				roots.append(rev)
				rev -= 1
				self._walkfrom = rev

				def _getheads(self):
				self._walkto(nullrev)
				return self._roots

				def parents(self, ix):
				if ix is None:
				return []
				if ix <= self._walkfrom:
				self._walkto(ix)
				return self._children.get(ix, [])

				def inverse(self):
				return self._orig